AI 高频面试题答案速查
这页覆盖 AI、RAG、Embedding、LangChain、Agent、MCP、微调、LLMOps 和 AI 安全的常见答案。回答时尽量结合业务场景和风险控制。
AI 与大模型基础
大模型是什么?
大模型通常指参数规模大、训练数据广、泛化能力强的模型。面试语境里多数指大语言模型,也就是 LLM。它擅长文本生成、问答、摘要、翻译、代码生成和信息抽取。
项目化补充:大模型不是数据库,不能默认相信它的事实性输出。企业场景通常要结合 RAG、工具、规则和评估。
Token 是什么?为什么重要?
Token 是模型处理文本的基本单位。输入、输出、上下文窗口和计费通常都按 token 计算。Prompt、历史对话、检索上下文和模型输出都会占用 token。
项目化补充:做 RAG 时不能无限塞资料,要控制 token 预算,否则成本高、延迟高、答案还可能变差。
幻觉是什么?怎么降低?
幻觉是模型生成了看似合理但实际错误或无依据的内容。降低方式包括使用 RAG、要求引用来源、检索不到就拒答、对高风险输出做规则校验、人工审核和评估集测试。
项目化补充:客服、法律、医疗、退款政策等场景不能只靠 Prompt,要有转人工和规则兜底。
RAG 和微调怎么选?
RAG 适合知识经常变化、需要引用来源、私有知识问答。微调适合固定输出风格、特定任务模式、格式稳定性要求高的场景。
项目化补充:很多企业知识库优先 RAG,必要时再用微调改善模型回答格式或风格。
RAG 与向量检索
RAG 是什么?
RAG 是检索增强生成。它先从外部知识库检索相关资料,再把资料放进上下文,让模型基于资料生成答案。
典型流程是文档加载、切分、Embedding、入向量库、用户提问、检索、重排、组装 Prompt、模型回答、返回引用。
RAG 为什么会答错?
常见原因包括文档没入库、切分不合理、Embedding 模型不适合、query 太模糊、top-k 不合适、没有 rerank、检索结果无权限或 Prompt 没约束模型基于资料回答。
项目化补充:排查 RAG 问题时先看检索结果,再看 Prompt 和模型。
chunk size 和 overlap 怎么理解?
chunk size 是文档切分片段大小,overlap 是相邻片段的重叠内容。切太大噪声多,切太小语义不完整。overlap 可以缓解边界截断,但过大会增加重复和成本。
项目化补充:FAQ、合同、表格、代码文档的切分策略不应该完全一样。
rerank 是什么?
rerank 是对初步召回的候选文档再排序。常见做法是向量检索先召回 top 20,再用 reranker 选出最相关的 top 5 放进 Prompt。
项目化补充:知识库规模大、召回噪声多时,rerank 对答案质量提升很明显。
向量数据库是什么?
向量数据库用于存储和检索 embedding 向量,可以根据语义相似度找到相关文档。它通常支持 top-k 查询、metadata 过滤、namespace 或 collection 隔离。
项目化补充:企业 RAG 一定要用 metadata 做权限过滤,否则可能检索到用户无权访问的内容。
Hybrid Search 是什么?
Hybrid Search 是混合检索,把关键词检索和向量检索结合起来。关键词适合编号、错误码、专有名词;向量检索适合语义相近但表达不同的问题。
项目化补充:企业文档里经常有订单号、接口名、政策编号,纯向量检索不一定够。
LangChain、Agent 与 MCP
LangChain 是什么?
LangChain 是构建 LLM 应用的框架,提供模型调用、Prompt、检索、工具、Agent、输出解析和链路编排等能力。
项目化补充:LangChain 不是模型本身,而是应用编排层。简单场景可以直接调模型 API,复杂 RAG 和 Agent 场景再考虑框架。
Chain 和 Agent 有什么区别?
Chain 是固定流程,步骤由开发者定义,稳定可控。Agent 是动态决策,模型可以根据任务选择工具和下一步动作,更灵活但更难评估和控制。
项目化补充:普通文档问答适合 RAG Chain;需要查知识库、查数据库、调用业务接口的开放任务可以考虑 Agent。
Function Calling 是什么?
Function Calling 让模型根据函数 schema 生成结构化调用参数。模型不直接执行函数,真正执行由后端完成。
项目化补充:它比让模型拼 URL 或 SQL 更安全,因为后端可以做参数校验、鉴权、审计和错误处理。
MCP 是什么?
MCP 是 Model Context Protocol,用于标准化 AI 应用和外部工具、数据源之间的连接。它让 AI 客户端通过 MCP Server 访问工具、资源和提示词能力。
项目化补充:Function Calling 更偏模型接口能力,MCP 更偏工具和数据源的标准化接入协议,两者可以配合使用。
Agent 为什么容易不稳定?
因为 Agent 会动态规划和调用工具,可能遇到目标不清、工具描述不准、返回结果混乱、步骤过多、模型选错工具、缺少失败处理等问题。
项目化补充:生产环境要限制最大步骤数、最小权限、结构化工具返回、高风险操作确认和 trace 记录。
微调、LoRA、蒸馏
微调是什么?
微调是在预训练模型基础上,用特定任务数据继续训练,让模型更适合某个任务、格式或风格。
项目化补充:微调不适合频繁变化的知识更新,这类场景优先 RAG。
LoRA 是什么?
LoRA 是参数高效微调方法。它冻结原模型大部分参数,只训练少量低秩适配矩阵,从而降低训练成本和显存需求。
项目化补充:多个业务任务可以保存不同 LoRA adapter,比全量微调更灵活。
蒸馏是什么?
蒸馏是用大模型作为 teacher,生成答案或标签,再训练更小的 student 模型,让小模型在特定任务上接近大模型效果。
项目化补充:蒸馏常用于降低推理成本、降低延迟和私有化部署。
LLMOps 与工程化
LLMOps 是什么?
LLMOps 是大模型应用的开发、评估、部署、监控和持续改进实践。它关注 Prompt 版本、评估集、模型路由、RAG trace、Agent 工具调用、成本、延迟和安全。
项目化补充:LLM 应用不只是上线一次,必须能回放 bad case、做回归测试和持续优化。
如何评估 AI 应用质量?
可以用人工评估集、自动化指标、LLM-as-a-judge、线上反馈和 A/B 测试。评估维度包括准确性、完整性、忠实度、格式合规、安全性、延迟和成本。
项目化补充:RAG 要分开评估检索质量和答案质量。
AI 成本怎么控制?
控制输入输出 token,使用合适模型,缓存高频结果,简单任务用小模型,长文档先摘要,RAG 只放必要上下文,并监控每个功能的调用量和 token 消耗。
项目化补充:没有 token 监控,就很难知道钱花在哪里。
AI 安全
Prompt Injection 是什么?怎么防?
Prompt Injection 是用户输入或外部文档中的恶意指令影响模型行为。防护方式包括把外部资料标记为不可信数据、系统提示要求忽略资料中的指令、工具调用做权限校验、高风险操作确认和输出安全检测。
项目化补充:RAG 检索到的文档不能被当成系统指令。
AI Agent 为什么要最小权限?
Agent 能调用工具,如果权限过大,可能误删数据、误发邮件、修改权限或执行高风险操作。最小权限能降低模型误判带来的影响范围。
项目化补充:删除、支付、发邮件、改权限这类动作必须二次确认和审计。
模型输出能不能直接执行?
不能直接执行。模型输出可能有错误、恶意内容或格式不稳定。执行前必须做 schema 校验、白名单限制、权限校验和人工确认。
项目化补充:模型生成 SQL、Shell、HTML、接口参数时尤其要谨慎。
RAG 如何做权限隔离?
文档入库时保存权限 metadata,检索时根据用户身份过滤,生成答案前再次校验来源权限,不把无权限片段放入上下文。
项目化补充:不能只在前端隐藏文档入口,权限必须发生在检索和服务端层。