LLMOps
LLMOps 是围绕大模型应用开发、测试、部署、监控和持续改进的一套工程实践。
核心知识点
LLMOps 关注:
- Prompt 版本管理
- 数据集和评估集管理
- 模型选择和路由
- RAG 检索链路观测
- Agent 工具调用 trace
- 离线评估和线上评估
- 成本和延迟监控
- 安全和合规
- 回归测试
- 人工反馈闭环
LLMOps 生命周期
LLMOps 和 MLOps 有什么区别?
MLOps 更关注传统机器学习模型的训练、部署、特征、模型版本和数据漂移。
LLMOps 更关注大模型应用链路:
- Prompt 变化会影响结果。
- RAG 检索质量会影响结果。
- 模型输出非确定性更强。
- 工具调用和 Agent 轨迹需要观测。
- 成本和 token 消耗是核心指标。
LLMOps 不是替代 MLOps,而是在大模型应用场景下增加了 Prompt、上下文、检索、工具和评估治理。
LLM 应用如何做评估?
评估分为离线和线上。
离线评估:
- 使用固定数据集。
- 比较不同 Prompt、模型、检索策略。
- 做回归测试。
- 适合上线前验证。
线上评估:
- 收集真实用户问题。
- 监控异常输出。
- 记录用户反馈。
- 把线上 bad case 回流到离线评估集。
评估对象不仅是最终答案,也包括检索结果、工具选择、输出格式和安全性。
什么是 trace?
trace 是一次 LLM 应用请求的完整链路记录。
通常包括:
- 用户输入
- Prompt
- 模型输入输出
- 检索 query
- 召回文档
- rerank 结果
- 工具调用参数
- 工具返回
- token 消耗
- 延迟
- 错误信息
没有 trace,很难排查“为什么这次回答错了”。
LLMOps 面试常见问题
LLMOps 和 MLOps 有什么区别?
MLOps 更关注模型训练、特征、数据集、部署和模型监控。LLMOps 除了模型本身,还特别关注 Prompt、RAG、工具调用、评估集、trace、成本和安全。
LLM 应用很多问题不是训练问题,而是上下文、检索、提示词、工具和权限问题,所以需要更完整的应用链路观测。
LLM 应用怎么做回归测试?
先准备固定问题集和期望标准,包括正常问题、边界问题、攻击问题和历史 bad case。每次改 Prompt、模型、检索策略或工具后都跑一遍。
评估可以结合规则、人工评审和 LLM-as-judge,但关键场景不要完全依赖模型自评。上线前要比较新旧版本差异。
如何评估 RAG 效果?
RAG 要分别评估检索和生成。检索看召回率、命中率、引用片段是否正确;生成看答案准确性、引用一致性、拒答能力和是否幻觉。
如果答案错,要拆开判断是文档没有、切分不好、召回错、rerank 错,还是模型生成错。
如何记录和分析 Agent 执行轨迹?
Agent trace 应记录用户输入、计划步骤、工具调用参数、工具返回、模型输出、错误、耗时和 token 消耗。高风险操作还要记录确认人和确认时间。
分析时可以看失败集中在哪一步,是工具选择错、参数错、权限错、外部服务错,还是模型循环。没有 trace 很难复盘 Agent 问题。
Prompt 如何做版本管理?
Prompt 要像代码一样管理版本,记录变更原因、适用场景、评估结果和上线时间。不要直接在线上手改不可追踪的提示词。
更成熟的做法是把 Prompt 模板、变量、模型参数和评估集关联起来,新版本先灰度,再根据效果决定是否全量。
如何监控 token 成本?
要按用户、租户、功能、模型、接口和时间维度统计 token 输入输出、调用次数、平均成本和异常峰值。
降本方式包括缓存、压缩上下文、限制历史消息长度、选择更小模型、减少无效工具调用和优化 RAG 召回数量。
如何做线上 bad case 回流?
线上 bad case 可以来自用户反馈、人工标注、低评分、异常日志和自动评估。收集后要分类:检索问题、Prompt 问题、模型能力问题、权限问题或数据问题。
修复后要进入评估集,防止同类问题回归。好的闭环是“发现、归因、修复、评估、发布、监控”。
如何灰度发布新的 Prompt 或模型?
可以按用户、租户、流量比例或功能开关灰度。发布前先跑离线评估,发布中监控质量、错误率、延迟、成本和用户反馈。
如果指标异常,要能快速回滚到旧 Prompt 或旧模型。灰度时最好保留版本标记,方便追踪线上回答来自哪个版本。
如何发现模型质量退化?
可以通过固定评估集定期测试、线上抽样评审、用户反馈、拒答率、幻觉率、命中率和转人工率观察质量变化。
质量退化可能来自模型版本变化、Prompt 修改、知识库更新、检索策略变化或业务数据变化。要用版本和 trace 帮助定位。
成熟回答要体现工程闭环:上线前有评估,上线后有监控,出现问题能回放,修复后能防回归。