Skip to content

LLMOps

LLMOps 是围绕大模型应用开发、测试、部署、监控和持续改进的一套工程实践。

核心知识点

LLMOps 关注:

  • Prompt 版本管理
  • 数据集和评估集管理
  • 模型选择和路由
  • RAG 检索链路观测
  • Agent 工具调用 trace
  • 离线评估和线上评估
  • 成本和延迟监控
  • 安全和合规
  • 回归测试
  • 人工反馈闭环

LLMOps 生命周期

开发Prompt、工具、RAG、工作流
->
评估离线数据集、自动评测、人工审核
->
部署灰度、限流、降级、版本控制
->
监控质量、成本、延迟、安全
->
迭代反馈样本进入评估集

LLMOps 和 MLOps 有什么区别?

MLOps 更关注传统机器学习模型的训练、部署、特征、模型版本和数据漂移。

LLMOps 更关注大模型应用链路:

  • Prompt 变化会影响结果。
  • RAG 检索质量会影响结果。
  • 模型输出非确定性更强。
  • 工具调用和 Agent 轨迹需要观测。
  • 成本和 token 消耗是核心指标。

LLMOps 不是替代 MLOps,而是在大模型应用场景下增加了 Prompt、上下文、检索、工具和评估治理。

LLM 应用如何做评估?

评估分为离线和线上。

离线评估:

  • 使用固定数据集。
  • 比较不同 Prompt、模型、检索策略。
  • 做回归测试。
  • 适合上线前验证。

线上评估:

  • 收集真实用户问题。
  • 监控异常输出。
  • 记录用户反馈。
  • 把线上 bad case 回流到离线评估集。

评估对象不仅是最终答案,也包括检索结果、工具选择、输出格式和安全性。

什么是 trace?

trace 是一次 LLM 应用请求的完整链路记录。

通常包括:

  • 用户输入
  • Prompt
  • 模型输入输出
  • 检索 query
  • 召回文档
  • rerank 结果
  • 工具调用参数
  • 工具返回
  • token 消耗
  • 延迟
  • 错误信息

没有 trace,很难排查“为什么这次回答错了”。

LLMOps 面试常见问题

LLMOps 和 MLOps 有什么区别?

MLOps 更关注模型训练、特征、数据集、部署和模型监控。LLMOps 除了模型本身,还特别关注 Prompt、RAG、工具调用、评估集、trace、成本和安全。

LLM 应用很多问题不是训练问题,而是上下文、检索、提示词、工具和权限问题,所以需要更完整的应用链路观测。

LLM 应用怎么做回归测试?

先准备固定问题集和期望标准,包括正常问题、边界问题、攻击问题和历史 bad case。每次改 Prompt、模型、检索策略或工具后都跑一遍。

评估可以结合规则、人工评审和 LLM-as-judge,但关键场景不要完全依赖模型自评。上线前要比较新旧版本差异。

如何评估 RAG 效果?

RAG 要分别评估检索和生成。检索看召回率、命中率、引用片段是否正确;生成看答案准确性、引用一致性、拒答能力和是否幻觉。

如果答案错,要拆开判断是文档没有、切分不好、召回错、rerank 错,还是模型生成错。

如何记录和分析 Agent 执行轨迹?

Agent trace 应记录用户输入、计划步骤、工具调用参数、工具返回、模型输出、错误、耗时和 token 消耗。高风险操作还要记录确认人和确认时间。

分析时可以看失败集中在哪一步,是工具选择错、参数错、权限错、外部服务错,还是模型循环。没有 trace 很难复盘 Agent 问题。

Prompt 如何做版本管理?

Prompt 要像代码一样管理版本,记录变更原因、适用场景、评估结果和上线时间。不要直接在线上手改不可追踪的提示词。

更成熟的做法是把 Prompt 模板、变量、模型参数和评估集关联起来,新版本先灰度,再根据效果决定是否全量。

如何监控 token 成本?

要按用户、租户、功能、模型、接口和时间维度统计 token 输入输出、调用次数、平均成本和异常峰值。

降本方式包括缓存、压缩上下文、限制历史消息长度、选择更小模型、减少无效工具调用和优化 RAG 召回数量。

如何做线上 bad case 回流?

线上 bad case 可以来自用户反馈、人工标注、低评分、异常日志和自动评估。收集后要分类:检索问题、Prompt 问题、模型能力问题、权限问题或数据问题。

修复后要进入评估集,防止同类问题回归。好的闭环是“发现、归因、修复、评估、发布、监控”。

如何灰度发布新的 Prompt 或模型?

可以按用户、租户、流量比例或功能开关灰度。发布前先跑离线评估,发布中监控质量、错误率、延迟、成本和用户反馈。

如果指标异常,要能快速回滚到旧 Prompt 或旧模型。灰度时最好保留版本标记,方便追踪线上回答来自哪个版本。

如何发现模型质量退化?

可以通过固定评估集定期测试、线上抽样评审、用户反馈、拒答率、幻觉率、命中率和转人工率观察质量变化。

质量退化可能来自模型版本变化、Prompt 修改、知识库更新、检索策略变化或业务数据变化。要用版本和 trace 帮助定位。

成熟回答要体现工程闭环:上线前有评估,上线后有监控,出现问题能回放,修复后能防回归。

Built with VitePress and GitHub Pages.