07
第三幕 · 作战链
建造:RAG 不是银弹,evals 才是命门
滚动开始
7 个
RAG 管道上会漏的地方
50 条
evals 评估集起步规模
3 道闸
输出端的结构/安全/来源
【开场】时间都花错了地方
两个团队,同一个预算,同一个客户。
- A 团队:三个月试了 6 个模型、调了无数 prompt、上了最新框架。演示惊艳。
- B 团队:只挑一个模型,攒了 300 条评估集,装了全套监控。演示平平。
六个月后:A 团队答错一个核心问题,信任崩塌,项目停摆。B 团队准确率从 88% 爬到 96%——每一次出错都被记录、归因、修掉了。
90% 的团队把 90% 的时间花在模型上。活下来的团队,把时间花在评估上。
【场 1】数据工程先行:先修水管,再谈泉水
AI 项目的第一行代码不是模型调用,是数据工程。三件事按顺序做:
- 数据盘点:事实源(条款、手册、价目表)和参考语料(历史工单、聊天记录)分开放。混淆两者的后果:模型把三年前某客服的随口答复当成"公司政策"讲给客户听。
- 数据合约(Data Contract):和业务部门签一张纸,写清每个字段的口径、更新频率、负责人。"销售额到底含不含退款",必须在 AI 替你回答之前就有答案。
- 审计追踪链:原始文档 → 清洗 → 切块 → 入库 → 被检索 → 进入回答,每一环留痕。金融、医疗客户迟早会问:"这回答是从哪份文件来的?"答不上来的那天,项目就结束了。
金句预埋:"垃圾进垃圾出"不是段子,是预算表——数据工程通常吃掉项目 40% 以上的工作量,不把它写进计划,计划就是假的。
【场 2】RAG 管道解剖:7 个会漏的地方
RAG 人人会讲,但生产级 RAG 死都死在细节上——7 个漏点逐个查,先查检索侧,再怪生成侧:大多数"模型不行",其实是没检索到。
【场 3】2026 决策树:提示工程 / RAG / 微调
2026 选型决策树 · 微调是最后的选项
问题到底出在哪?
↓
不懂你们的知识条款、产品、内部数据
→ RAG(+知识更新机制)
→ RAG(+知识更新机制)
不懂格式与语气报告体、客服口吻
→ 提示工程 + few-shot
→ 提示工程 + few-shot
不懂判断逻辑审单、风险分级
→ 先写规则 prompt;500+ 标注样本后再谈微调
→ 先写规则 prompt;500+ 标注样本后再谈微调
都试了还不行
→ 先怀疑评估集和数据,最后怀疑模型
→ 先怀疑评估集和数据,最后怀疑模型
客户最爱问:"要不要微调一个自己的模型?"答案八成是不需要——按下面的决策树走。
微调的真正门槛不是钱,是数据:没有数百条高质量"输入→正确输出"样本,微调是在给模型喂迷魂汤。而且微调会冻结知识、拉高维护成本——能不动它就不动它。
【场 4】evals:给系统装仪表盘
evals 最小闭环
没有评估集的项目,等于没有仪表盘的飞机——飞行员感觉良好,乘客生死看天。
evals 最小闭环,四步走(闭环图见下):
- 攒评估集:50 条起步。真实历史工单抽 30 条典型题 + 10 条边界题(信息不全、问法刁钻)+ 10 条对抗题(诱导幻觉、越权请求)。每条由业务专家写上"标准答案+不可接受的错误"。
- 定评分口径:准确率(对不对)、忠实度(有没有忠于资料)、拒答正确率(该拒的拒了没有)。能用规则判的不用模型判,能用模型判的不用人判——但人抽检永远保留 10%。
- 每次改动必跑:改 prompt、换模型、调切块,任何变更跑一遍 evals,分数掉了不许上线。这条纪律值整个项目的一半。
- 线上持续监控:准确率周趋势、转人工率、低置信度分布。准确率突然下滑,先查数据漂移(业务变了,模型没跟上),PSI 指数可量化漂移程度。
【场 5】输出端护栏:让回答可操作、可追溯
模型输出的每一个字,都要过三道闸再见人:
- 结构闸:JSON Schema 强制结构化,字段缺失直接拦截——下游系统只吃结构,不吃散文;
- 安全闸:敏感词、越权话题("帮我改一下保单受益人")、数据泄露检查,命中即拦截转人工;
- 来源闸:每个事实性陈述必须挂来源 ID,挂不上的降级为"建议咨询人工"。
三道闸的日志全部留痕。它们平时是成本,出事的那个晚上,是救命的东西。
RAG 管道 · 7 个漏点(点击排查)
1文档解析
2切块策略
3嵌入模型
4检索召回
5重排序
6提示组装
7生成校验
【速查卡】evals 起步清单:50 条评估集怎么攒
□ 30 条典型题:从最近 3 个月真实工单随机抽
□ 10 条边界题:信息不全 / 多意图 / 口语化严重
□ 10 条对抗题:诱导幻觉 / 越权请求 / 注入攻击
□ 每条标注:标准答案 + 致命错误清单 + 来源文档 ID
□ 业务专家签字确认(不是工程师自己拍脑袋)
□ 三个指标口径写进文档:准确率 / 忠实度 / 拒答正确率
□ 定死纪律:任何变更,跑分不过不上线
□ 每月新增 10 条线上错题回流
【金句海报】
"没有评估集的 AI 项目,
等于没有仪表盘的飞机。"
FDE 工程师蓝皮书
本章来源
- 数据合约、审计追踪链:改写自原书稿第 5 章 5.3
- 输入端/输出端增强、护栏:改写自原书稿第 5 章 5.2
- RAG 失效点清单:基于生产级 RAG 工程实践的通用归纳(原书 5.2.1 + 2025–2026 社区共识实践)
- 模型漂移与 PSI:改写自原书稿第 4 章 4.4.1
- 决策树与"500 条标注样本"阈值为经验值,站点标注"经验法则,供参考"