Skip to content

AI 与大模型基础

大模型是什么?

大模型通常指参数规模大、训练数据广、具备较强泛化能力的模型。面试中说的大模型多数指大语言模型,也就是 LLM。

LLM 擅长处理文本相关任务:

  • 问答
  • 摘要
  • 翻译
  • 代码生成
  • 信息抽取
  • 对话
  • 推理和规划

但 LLM 不是数据库,也不是绝对可靠的事实来源。它的输出是基于上下文和训练分布生成的,需要结合检索、工具、规则、评估和人工审核来落地。

Token 是什么?

Token 是模型处理文本的基本单位,可以理解为文本被切分后的片段。

一个中文词、一个英文单词、一个标点,可能会被切成一个或多个 token。不同模型使用的 tokenizer 不完全一样。

Token 会影响:

  • 输入长度
  • 输出长度
  • 上下文窗口
  • 请求成本
  • 延迟

面试时可以补充:做 RAG 或 Prompt 设计时,不能只看字符数,还要考虑 token 预算。

上下文窗口是什么?

上下文窗口是模型一次请求能处理的最大 token 数,包括:

  • system prompt
  • user prompt
  • 历史对话
  • 检索到的上下文
  • 工具调用结果
  • 模型输出

窗口越大,不代表效果一定越好。塞入太多无关内容可能会降低回答质量、增加成本和延迟。

实际项目中通常会做上下文裁剪、摘要、检索、重排和优先级控制。

什么是幻觉?

幻觉是指模型生成了看起来合理但实际上错误、无依据或编造的信息。

常见原因:

  • 模型训练知识过期
  • 问题缺少必要上下文
  • Prompt 诱导模型猜测
  • 检索结果不相关
  • 模型没有不确定性约束

常见缓解手段:

  • 使用 RAG 引入外部资料
  • 要求引用来源
  • 检索不到就回答不知道
  • 对关键任务加规则校验
  • 使用人工审核或评估集

Prompt Engineering 是什么?

Prompt Engineering 是通过设计输入指令,让模型更稳定地完成任务。

常见技巧:

  • 明确角色和目标
  • 给出输出格式
  • 给出边界条件
  • 提供示例
  • 拆分复杂任务
  • 要求模型基于上下文回答

示例:

text
你是一个企业知识库助手。
请只根据给定资料回答问题。
如果资料中没有答案,请回答“资料中未提及”。
输出格式:结论、依据、引用来源。

Prompt 不是万能的。复杂任务通常要结合检索、工具调用、工作流和评估。

微调和 RAG 有什么区别?

RAG 是在推理时检索外部知识,再把相关内容放入上下文中让模型回答。

微调是用训练数据改变模型参数,让模型学到某种风格、格式、任务模式或领域能力。

常见选择:

  • 知识经常更新:优先 RAG
  • 需要引用来源:优先 RAG
  • 需要固定输出风格:可以考虑微调
  • 需要模型学习特定任务格式:可以考虑微调
  • 私有知识问答:通常先做 RAG

一句话:RAG 更像给模型查资料,微调更像重新训练模型的行为习惯。

Temperature 有什么作用?

Temperature 控制生成结果的随机性。

  • 值低:输出更稳定、更保守
  • 值高:输出更多样、更发散

常见选择:

  • 信息抽取、分类、代码修复:低 temperature
  • 创意写作、头脑风暴:可以适当提高
  • 企业问答、客服:通常偏低

面试时可以补充:temperature 不是准确率开关,关键事实问题仍然要靠上下文、检索和校验。

Built with VitePress and GitHub Pages.