AI 与大模型基础
大模型是什么?
大模型通常指参数规模大、训练数据广、具备较强泛化能力的模型。面试中说的大模型多数指大语言模型,也就是 LLM。
LLM 擅长处理文本相关任务:
- 问答
- 摘要
- 翻译
- 代码生成
- 信息抽取
- 对话
- 推理和规划
但 LLM 不是数据库,也不是绝对可靠的事实来源。它的输出是基于上下文和训练分布生成的,需要结合检索、工具、规则、评估和人工审核来落地。
Token 是什么?
Token 是模型处理文本的基本单位,可以理解为文本被切分后的片段。
一个中文词、一个英文单词、一个标点,可能会被切成一个或多个 token。不同模型使用的 tokenizer 不完全一样。
Token 会影响:
- 输入长度
- 输出长度
- 上下文窗口
- 请求成本
- 延迟
面试时可以补充:做 RAG 或 Prompt 设计时,不能只看字符数,还要考虑 token 预算。
上下文窗口是什么?
上下文窗口是模型一次请求能处理的最大 token 数,包括:
- system prompt
- user prompt
- 历史对话
- 检索到的上下文
- 工具调用结果
- 模型输出
窗口越大,不代表效果一定越好。塞入太多无关内容可能会降低回答质量、增加成本和延迟。
实际项目中通常会做上下文裁剪、摘要、检索、重排和优先级控制。
什么是幻觉?
幻觉是指模型生成了看起来合理但实际上错误、无依据或编造的信息。
常见原因:
- 模型训练知识过期
- 问题缺少必要上下文
- Prompt 诱导模型猜测
- 检索结果不相关
- 模型没有不确定性约束
常见缓解手段:
- 使用 RAG 引入外部资料
- 要求引用来源
- 检索不到就回答不知道
- 对关键任务加规则校验
- 使用人工审核或评估集
Prompt Engineering 是什么?
Prompt Engineering 是通过设计输入指令,让模型更稳定地完成任务。
常见技巧:
- 明确角色和目标
- 给出输出格式
- 给出边界条件
- 提供示例
- 拆分复杂任务
- 要求模型基于上下文回答
示例:
text
你是一个企业知识库助手。
请只根据给定资料回答问题。
如果资料中没有答案,请回答“资料中未提及”。
输出格式:结论、依据、引用来源。Prompt 不是万能的。复杂任务通常要结合检索、工具调用、工作流和评估。
微调和 RAG 有什么区别?
RAG 是在推理时检索外部知识,再把相关内容放入上下文中让模型回答。
微调是用训练数据改变模型参数,让模型学到某种风格、格式、任务模式或领域能力。
常见选择:
- 知识经常更新:优先 RAG
- 需要引用来源:优先 RAG
- 需要固定输出风格:可以考虑微调
- 需要模型学习特定任务格式:可以考虑微调
- 私有知识问答:通常先做 RAG
一句话:RAG 更像给模型查资料,微调更像重新训练模型的行为习惯。
Temperature 有什么作用?
Temperature 控制生成结果的随机性。
- 值低:输出更稳定、更保守
- 值高:输出更多样、更发散
常见选择:
- 信息抽取、分类、代码修复:低 temperature
- 创意写作、头脑风暴:可以适当提高
- 企业问答、客服:通常偏低
面试时可以补充:temperature 不是准确率开关,关键事实问题仍然要靠上下文、检索和校验。