08
第三幕 · 作战链

最后 100 米:从 Demo 到生产

死亡率最高的一天
滚动开始
5 / 100
从立项走到产生 P&L 影响
4 类
必须转人工的触发条件
48 小时
每级灰度的最短观察期

【开场】死亡率最高的一天

演示会上,系统对答如流,老板带头鼓掌,客户当场说"全面推广"。

散会时,IT 经理拉住你:"生产环境的高并发、权限、审计……还没谈过。"业务主管补刀:"坐席那边,我还没想好怎么跟他们讲。"

演示成功不是终点线,是发令枪。 MIT 报告里 95% 的项目,大多不是死在技术选型那天,而是死在演示成功到真实生产之间的最后 100 米。

这一章讲这 100 米怎么跑。


【场 1】存活漏斗:100 个 PoC 出发,几个能站着

把企业 AI 项目画成漏斗:100 个立项,60 个进 PoC,30 个演示"成功",15 个试点上线,8 个全员推广——只有 5 个真正产生 P&L 影响

死因层层不同,打法也不同:上半程靠判断,下半程靠工程和组织。 只会上半程的是顾问,只会下半程的是外包,全程能打的才是 FDE。


【场 2】人工兜底:不是 AI 不行才用人,是设计里就有人

置信度路由 · 人工兜底设计图
用户提问 → 置信度评估
高 ≥ 0.85
→ AI 直接回答
中 0.6–0.85
→ AI 回答 + 标注「建议人工复核」
低 < 0.6 或敏感话题
→ 热转人工:完整上下文 + 建议答复,处理结果回流评估集

敢转人工的系统,比假装什么都会的系统更值得信任。

客户常问:"系统准确率多少?" 错误回答是报数字,正确回答是上面这张置信度路由图——答案不是一个数,是一条分流规则

兜底机制三要点

  1. 触发条件写死:低置信度、敏感话题(投诉、赔付、改约)、用户明确要求、情绪激烈——四类必转;
  2. 转接要"热":人工接手的是完整对话历史 + 已查资料 + 建议答复——用户不说第二遍;
  3. 回流要闭环:每条人工处理都变成训练/评估数据——兜底不是成本,是系统的"在职培训"。

敢转人工的系统,比假装什么都会的系统更值得信任。


【场 3】上线工程:加固清单

灰度发布节奏
5%
真实流量
20%
观察 48h
50%
四项指标达标
100%
全量 + 回滚待命

每级观察 48 小时:准确率 / 转人工率 / 延迟 / 投诉率,全达标才进下一级。

演示到生产,中间隔着一层工程加固。核心五项:

  1. 高并发低延迟:分级缓存(高频问答命中率可达 60%+)、推理加速、异步队列削峰——目标不是"快",是高峰期不崩
  2. 灰度发布:不一次全量,逐级放量(节奏见上方步骤条);
  3. 一键回滚:10 分钟内切回旧系统/纯人工,上线前真演练一次——没演练过的回滚等于没有
  4. 全链路监控:输入量、命中率、置信度分布、拦截量、转人工量、单会话成本——每条告警写明谁收到、怎么处理
  5. 安全合规:权限最小化、数据脱敏、操作留痕、备案齐全——合规不是盖章,是最后一道闸。

【场 4】变革管理:坐席为什么偷偷抵制你的系统

某项目上线两周,转人工率诡异高达 80%。排查半天,技术没问题——是坐席在引导用户说"转人工"。

为什么?没人告诉他们这系统会不会让自己失业。当员工把 AI 当对手,他们有 100 种方法让数据难看。 人心问题没有补丁可打。

上线前必做四个动作:

  1. 先讲"你会变成什么",再讲系统。 AI 接走重复咨询,你升级为复杂问题专家 + AI 训练师——岗位说明书改好再宣布;
  2. 让一线参与设计。 资深坐席参与评估集标注和验收测试——参与建设的人不拆台;
  3. 考核跟着改。 "处理复杂问题数""知识库贡献数"进 KPI——考核不变,行为不变;
  4. 找"自己人"当布道者。 班组里最被信任的老员工先用、先赢、先讲——比 CIO 的邮件管用十倍。

【场 5】规模化:一个站点成功之后

第一个场景跑通,考验才刚开始:复制到第二个场景、第二个部门。

可复制的不是代码,是配方:数据合约模板、evals 流程、护栏配置、灰度节奏、变革话术,全部文档化——新场景复用 70%,定制 30%。

同时建立运营节奏:每周看错题和准确率趋势,每月更新知识库,每季度重跑 ROI。AI 系统不是交付物,是活物——没人养,三个月就退化。


【名场面】PoC→生产存活漏斗

PoC → 生产 · 存活漏斗

各层数字为示意模型,来源:MIT NANDA 5% 终值 + 行业经验外推。

100 个立项
大多数死在娘胎里:痛点不真,跟风立项。
60 个进 PoC
数据拿不到、权限卡住——四成项目直接流产。
30 个 PoC“成功”
干净数据上的自嗨,离生产还隔着一片海。
15 个试点上线
高并发崩、护栏缺失,Demo 魔咒在此显灵。
8 个全员推广
员工抵制、流程不改,使用率阴跌。
5 个产生 P&L 影响
终值:MIT NANDA 的 5%。无人运营,效果还会衰减。

【速查卡】上线前夜检查清单

工程
□ 压测通过:峰值并发 ___ 下错误率 < 0.5%
□ 缓存、队列、降级预案就绪
□ 一键回滚演练过(真的演练过,不是文档写过)
□ 监控告警配置,且每个告警有明确处理人
护栏
□ 敏感话题拦截规则已更新到最新业务口径
□ 低置信度转人工阈值已和业务确认
□ 全部回答可溯源(来源 ID 可点击查证)
组织
□ 坐席宣讲完成,岗位变化说清楚
□ 新 KPI 已发布
□ 每个班组有"自己人"布道者
□ 第一周值守排班表(出状况 10 分钟内有人响应)
合规
□ 数据权限审计通过
□ 备案/审批手续齐全

【金句海报】

"Demo 是魔术,生产是走钢丝——
区别在于有没有防护网。"

FDE 工程师蓝皮书

本章来源

  • 存活漏斗各层死亡率:基于 MIT NANDA 报告(5% 产生 P&L 影响)及行业普遍经验的示意模型,各层数字为示意非精确统计
  • 人工兜底机制:改写自原书稿第 4 章 4.4.4、第 6 章 6.1.6
  • 高并发工程与监控:改写自原书稿第 6 章 6.1.6
  • 变革管理四动作:改写自原书稿第 6 章 6.1.6"组织变革管理"、第 5 章 5.5
  • 置信度阈值(0.85/0.6)为示例值,实际需按场景校准