- 自我介绍(重点讲AIGC/RAG项目)
======================
为什么这么问:考察表达结构、项目真实性、角色边界。判断你是项目核心还是边缘,是否有业务结果意识。
回答侧重点:按"业务背景→链路→我的角色→量化成果"四段讲;每个技术名词后跟一句"为什么这么选";明确区分"从零到一/参与设计/同事负责"。
答案: “我主要做财税知识库RAG,给企业财务人员做政策问答,替代人工翻文档,单次查数从十几分钟压到一分钟内。链路是文档解析→结构切分→双路索引→混合召回→重排→生成。检索链路和召回策略是我从零到一做的,切分和评测集参与设计,前端和标注是同事负责。上线后MRR从0.72提到0.92,引用准确率是我们最看重的指标。”
- 你这家公司主要做什么的?
===============
为什么这么问:考察求职前是否做过功课,以及能否把业务和技术对应起来(业务理解力)。
回答侧重点:一句业务定位+一个用户场景+技术如何支撑业务。不要背官网slogan。
答案: “贵公司做财税数智化方向,核心是把财税政策和流程知识结构化,给企业财务和代账人员提供问答与检索服务。我理解技术侧主要是知识库建设、语义检索和生成,业务侧的核心指标是查得准、有出处。”
- 你们项目人员构成?
============
为什么这么问:考察团队协作认知和你在团队中的位置,判断你的沟通边界。
回答侧重点:角色+规模+协作方式,重点是"我负责的模块如何与上下游衔接"。
答案: “产品1人、算法2人、后端2人、前端1人、测试1人,另有业务方兼职标注。算法里我负责检索和重排,同事负责模型微调和生成;后端负责接口和数据链路。我这边主要跟业务方对齐标注口径,跟后端约定评测数据的落库格式。”
- 你在项目中主要负责什么?
===============
为什么这么问:与自我介绍联动,追问细节验证真实性,考察职责边界是否清晰。
回答侧重点:只讲自己负责的模块,讲清每个模块的输入输出和踩过的坑;不揽全项目。
答案: “负责检索链路:切分策略、双路召回、RRF融合和重排。典型决策:无边框表格的切分本质是版面问题,按文档类型做了路由;数值类问题走ES精确匹配,语义类问题走BGE-M3,避免向量检索对编号、文号区分度不足。”
- 没做RAG之前是怎么检索的?
=================
为什么这么问:考察你对RAG价值的理解,能否讲出旧方案的痛点和RAG的不可替代性。
回答侧重点:旧方案是什么+痛点在哪+RAG补了什么。重点是痛点,不是方案罗列。
答案: “之前是关键词检索加人工翻目录:ES或数据库like查询只能字面匹配,用户口语化提问和跨文档综合问题查不到;几千份文档靠人工定位。RAG补的是两块:语义召回解决’换个说法就搜不到’,引用溯源解决’答案有没有出处’。”
- RAG主要用到哪些工具?
===============
为什么这么问:考察工具链真实性,更考察选型理由——你是使用者还是决策者。
回答侧重点:工具+选型理由+取舍。每个工具一句"为什么是它";主动说明过渡或替换决策。
答案: “BGE-M3做稠密语义召回(要中文多语言、长文档);ES做BM25字面匹配和结构化过滤(文号、年份);Milvus存向量做ANN检索;LangChain早期快速验证,后续自己封装了链路,因为要精细控制上下文组装和重试逻辑。选型原则:能确定的用规则和精确匹配,语义理解才交给模型。”
- 有哪些评判指标?
===========
为什么这么问:考察评测体系是否完整、数字是否可归因、是否具备数据驱动迭代能力。
回答侧重点:分检索侧/生成侧/端到端三层说;每个数字配评测集、归因、消融三份材料。
答案: “分三层。检索侧:Recall@K、MRR、nDCG;生成侧:答案准确率、忠实度、引用准确率;端到端:人工抽检加bad case归因。评测集用线上真实query采样加业务标注,调参集和测试集分离。线上最关注引用准确率,因为财税场景用户要求可溯源;漏报比误报更敏感,优先保召回。”
- 详细介绍RAG流程?重做有哪些优化?
=====================
为什么这么问:流程题考察完整链路掌握;优化题考察迭代能力和复盘能力,是拉开差距的关键。
回答侧重点:流程一条线讲清每步输入输出;优化必须"因为什么所以改",体现按数据决策。
答案: "流程:解析清洗→按结构切分→稠密+稀疏双路索引→混合召回(RRF融合)→cross-encoder重排→上下文组装(带引用)→生成。 重做的优化:
- 评测集先行——第一版没有评测集,靠感觉调参;
- 切分按文档类型路由——表格和条款类策略分开;
- query改写——口语化问题先改写再检索;
- metadata过滤——年份、机构、文号不参与语义计算;
- 反馈回流——线上被否定的回答进bad case迭代。 最重要的改动是评测集,没有它后面所有优化都无法验证。
- BGE-M3主要有哪3部分?作用是什么?
=======================
为什么这么问:纯知识题,验证技术细节是否扎实,RAG岗高频考点,必须答全。
回答侧重点:"三多"全报——多语言、多功能、多粒度;每个给一句话作用;补一句三种表示如何配合。
答案: "BGE-M3是’三多’:
多语言:100+语言统一建模,中英混合查询不用换模型;
多功能:一个模型出三种表示——稠密向量dense(语义召回)、稀疏向量sparse(可解释词权重,接近BM25)、多向量multi-vector(ColBERT式后期交互,精排更准);
多粒度:最长支持8192 token,长文档可直接编码。 用法上dense管语义、sparse管精确词、multi-vector管精排,正好对应混合检索各环节。"
- 财税项目用ES做什么?和BGE-M3的区别?
==========================
为什么这么问:考察工具定位是否清晰,能否区分"检索基础设施"和"表示模型",能否讲清互补关系。
回答侧重点:先定义层级,再从匹配机制、擅长短板、部署成本、关系四方面对比,给一个场景化例子。
答案: “ES是检索基础设施,BGE-M3是embedding模型,不在一个层级。ES靠倒排索引+BM25做字面匹配,精确匹配、过滤、聚合强、成熟稳定,短板是换个说法就搜不到;BGE-M3做语义匹配,同义改写、口语化提问能召回,短板是专有名词、编号、数字区分度弱。 财税场景里两者互补而非替代:文号、条款编号走ES精确匹配,'跨年度汇算清缴怎么处理’这类语义问题走BGE-M3,双路召回RRF融合。”
- 你有什么要问我的?
=============
为什么这么问:考察求职动机、主动性、思考深度;是候选人唯一掌控主动权的环节。
回答侧重点:问岗位(第一个项目)、团队(分工/评测沉淀)、业务(瓶颈);不问薪资福利细节和加班。
答案: "想问三个问题:
这个岗位进来后第一个要接的项目是什么?
目前团队RAG链路的评测集沉淀到什么程度了?
财税场景现在最大的瓶颈是数据质量还是模型能力?"
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~