先说结论:试点失败,多数败在口径
先给结论:AI 试点拿不到回报,多数不是模型不行,而是开工那天没人写下验收口径——所以项目结束时只剩「感觉还不错」这一种结论。改法只有一个:把 POC 当成一次有截止日的盲测,第 1 天先写一页纸验收卡(基线、指标、阈值、签字人),第 14 天必须给出结论。
这不是主观感受。MIT NANDA 的《The GenAI Divide: State of AI in Business 2025》梳理了 300 多个公开 AI 部署、访谈 52 家机构后给出的结论是:约 95% 的企业生成式 AI 试点没有产生可衡量的财务回报。更早的 Capgemini 调研显示 88% 的 AI 试点没能进入生产环境;S&P Global 的调研里,42% 的生成式 AI 试点被直接放弃。
| 来源 | 数字 | 说明什么 |
|---|---|---|
| MIT NANDA《The GenAI Divide》(2025,梳理 300+ 公开部署 / 52 家访谈 / 153 份高管问卷) | 约 95% 的生成式 AI 试点零可衡量回报,约 5% 拿到实质价值 | 成功的 5% 多为围绕具体工作流定制,而非套用通用工具 |
| 同上报告 | 约 60% 组织评估过定制/厂商企业系统,约 20% 进到试点,仅约 5% 到生产 | 掉队主要发生在「试点 → 生产」这一段 |
| Capgemini(2023) | 88% 的 AI 试点未能进入生产 | 不是新问题,是持续了数年的老问题 |
| S&P Global(2025) | 42% 的生成式 AI 试点被放弃 | 放弃往往发生在「看不到结论」之后 |
| MIT NANDA 报告的归因 | 主因是 learning gap(学习鸿沟):工具不适应真实工作流、不吸收反馈 | 报告明确认为不是模型质量或监管导致 |
统计边界说明:以上均为公开调研数据,样本口径各不相同(受访对象、行业结构、调研时间均不同),数字之间不可相加或直接横向比较,但指向一致。本文引用它们,只为说明「试点失败是普遍现象」,不代表任何单一企业的结果。
试点失败的三种典型死法
把失败的试点摊开看,现场表现高度相似,基本落在下面三种里:
| 死法 | 现场表现 | 根因 | 改法 |
|---|---|---|---|
| 演示成功,验收失败 | DEMO 环节一气呵成,换成自家数据就错误频出 | 跑的是准备好的干净样本,不是真实数据 | 用近 3 个月真实历史数据盲测,其中刻意留 20% 难例 |
| 指标没定义就开工 | 结束时大家说「还行」,没人能说出好多少 | 没有基线、没有阈值、没有判定标准 | 第 1 天写一页纸验收卡,签字确认后才启动 |
| 无限期试点 | 跑了三个月还在「继续优化」,预算一直在花 | 没有截止日、没有退出条件 | 硬性 2 周,到点必须从「继续 / 换法 / 停止」里选一个 |
试点最大的成本不是花了多少钱,是花完之后没有任何结论——明年还得再来一次。
两周 POC 时间表:14 天怎么排
下面这张表可以直接拿去用。关键在第 1 天:口径没写完,不要开始跑模型。
| 阶段 | 时间 | 做什么 | 产出 |
|---|---|---|---|
| 定口径 | D1(半天) | 写清基线怎么量、验收看哪几个指标、及格线是多少、谁签字 | 一页纸验收卡 |
| 备数据 | D1(半天) | 取近 3 个月真实历史数据做测试集,含边界与难例 | 测试集(含约 20% 难例) |
| 跑通 | D2–D4(3 天) | 把单点场景跑通,此阶段只看「能不能出结果」 | 可运行的第一版 |
| 盲测 | D5–D8(4 天) | 同一批测试集,不看答案跑一遍,原始输出原样留存 | 原始输出 + 运行日志 |
| 人工复核 | D9–D10(2 天) | 业务同事逐条判定「可用 / 需修改 / 不可用」,不看技术说明 | 逐条判定表 |
| 算数字 | D11–D13(3 天) | 与基线逐项对比,算出 5 个验收指标与单位成本 | 对比表 |
| 出结论 | D14(1 天) | 对照验收卡逐条判定,从三种结论里选一个 | 一页结论:继续 / 换法 / 停止 |
说明:2 周是上限而非目标。如果 D8 盲测结果明显不可用,就可以提前结束——早结束比拖着更省钱。整个过程里,业务方至少要投入 2 天(复核与判定),这是不可外包的部分。
验收只看这 5 个数字
指标越多越难有结论。建议只保留下面 5 个,都能逐条核对:
| 指标 | 怎么量 | 为什么看它 |
|---|---|---|
| 基线耗时 | 现在做这件事每单位要多久:人工计时 10 个样本取中位数 | 没有基线就没有「提升」,这是整张验收卡的锚点 |
| 单份耗时 | 用工具后,同样 10 个样本的实测耗时 | 与基线相减就是省下的时间,最直观 |
| 准确率 | 盲测样本中完全正确的比例(按业务标准判,不按技术标准) | 要同时问一句:错的那部分,是不是关键项 |
| 人工修订率 | 需人工改动的工作量占总产出比例 | 决定「省事」是真的还是把工作挪了个位置 |
| 采纳率 | 上线 2 周后,目标岗位实际使用的人数比例 | 最容易漏、也最致命:工具做出来了,没人用等于没做 |
刻意不纳入「满意度」「体验感」「智能化程度」这类无法核对的指标——它们会让一场没有结论的试点看起来很像成功。
三个最容易踩的坑
- 用供应商准备的样本:测试数据必须自己出,且要包含真实业务里最烦的那批数据(格式乱、缺字段、手写体、长表格)。对方准备的样本,永远是挑过的。
- 把「准确率 90%」当结论:要追问三个问题——在什么数据上算的 90%?错的 10% 是不是集中在关键项?这 90% 是模型自评还是业务同事逐条判的?三个问题答不上来,这个数字不能用。
- 试点期无限延长:这是最贵的坑。到 D14 必须三选一,都不选也是一种选择——等于默认继续花钱。真需要延长,就重新起一个 2 周的 POC,而不是把老的拖着。
本文要点
- 核心判断:AI 试点失败多数不是模型不行,是开工那天没写验收口径
- MIT NANDA 2025:约 95% 试点零可衡量回报,归因是 learning gap 而非模型质量
- Capgemini 2023:88% 的 AI 试点未进入生产;S&P Global 2025:42% 的生成式 AI 试点被放弃
- 两周清单核心:D1 写验收卡 → 真实数据盲测 → D9 业务同事逐条复核 → D14 必须出结论
- 验收只看 5 个数字:基线耗时、单份耗时、准确率、人工修订率、采纳率
- 最容易漏的是采纳率:工具做出来没人用,等于没做
微信内识别二维码分享此文