方法论

AI 试点的两周验收清单:
先定口径,再挑模型

95% 的试点没有拿到回报,问题大多不在模型,在开工那天没人写验收口径。

浩瀚数据晟财 · 咨询团队 发布于 2026-10-05 更新于 2026-10-08 阅读约 6 分钟

先说结论:试点失败,多数败在口径

先给结论:AI 试点拿不到回报,多数不是模型不行,而是开工那天没人写下验收口径——所以项目结束时只剩「感觉还不错」这一种结论。改法只有一个:把 POC 当成一次有截止日的盲测,第 1 天先写一页纸验收卡(基线、指标、阈值、签字人),第 14 天必须给出结论。

这不是主观感受。MIT NANDA 的《The GenAI Divide: State of AI in Business 2025》梳理了 300 多个公开 AI 部署、访谈 52 家机构后给出的结论是:约 95% 的企业生成式 AI 试点没有产生可衡量的财务回报。更早的 Capgemini 调研显示 88% 的 AI 试点没能进入生产环境;S&P Global 的调研里,42% 的生成式 AI 试点被直接放弃。

来源数字说明什么
MIT NANDA《The GenAI Divide》(2025,梳理 300+ 公开部署 / 52 家访谈 / 153 份高管问卷)约 95% 的生成式 AI 试点零可衡量回报,约 5% 拿到实质价值成功的 5% 多为围绕具体工作流定制,而非套用通用工具
同上报告约 60% 组织评估过定制/厂商企业系统,约 20% 进到试点,仅约 5% 到生产掉队主要发生在「试点 → 生产」这一段
Capgemini(2023)88% 的 AI 试点未能进入生产不是新问题,是持续了数年的老问题
S&P Global(2025)42% 的生成式 AI 试点被放弃放弃往往发生在「看不到结论」之后
MIT NANDA 报告的归因主因是 learning gap(学习鸿沟):工具不适应真实工作流、不吸收反馈报告明确认为不是模型质量或监管导致

统计边界说明:以上均为公开调研数据,样本口径各不相同(受访对象、行业结构、调研时间均不同),数字之间不可相加或直接横向比较,但指向一致。本文引用它们,只为说明「试点失败是普遍现象」,不代表任何单一企业的结果。

试点失败的三种典型死法

把失败的试点摊开看,现场表现高度相似,基本落在下面三种里:

死法现场表现根因改法
演示成功,验收失败DEMO 环节一气呵成,换成自家数据就错误频出跑的是准备好的干净样本,不是真实数据用近 3 个月真实历史数据盲测,其中刻意留 20% 难例
指标没定义就开工结束时大家说「还行」,没人能说出好多少没有基线、没有阈值、没有判定标准第 1 天写一页纸验收卡,签字确认后才启动
无限期试点跑了三个月还在「继续优化」,预算一直在花没有截止日、没有退出条件硬性 2 周,到点必须从「继续 / 换法 / 停止」里选一个
试点最大的成本不是花了多少钱,是花完之后没有任何结论——明年还得再来一次。

两周 POC 时间表:14 天怎么排

下面这张表可以直接拿去用。关键在第 1 天:口径没写完,不要开始跑模型。

阶段时间做什么产出
定口径D1(半天)写清基线怎么量、验收看哪几个指标、及格线是多少、谁签字一页纸验收卡
备数据D1(半天)取近 3 个月真实历史数据做测试集,含边界与难例测试集(含约 20% 难例)
跑通D2–D4(3 天)把单点场景跑通,此阶段只看「能不能出结果」可运行的第一版
盲测D5–D8(4 天)同一批测试集,不看答案跑一遍,原始输出原样留存原始输出 + 运行日志
人工复核D9–D10(2 天)业务同事逐条判定「可用 / 需修改 / 不可用」,不看技术说明逐条判定表
算数字D11–D13(3 天)与基线逐项对比,算出 5 个验收指标与单位成本对比表
出结论D14(1 天)对照验收卡逐条判定,从三种结论里选一个一页结论:继续 / 换法 / 停止

说明:2 周是上限而非目标。如果 D8 盲测结果明显不可用,就可以提前结束——早结束比拖着更省钱。整个过程里,业务方至少要投入 2 天(复核与判定),这是不可外包的部分。

验收只看这 5 个数字

指标越多越难有结论。建议只保留下面 5 个,都能逐条核对:

指标怎么量为什么看它
基线耗时现在做这件事每单位要多久:人工计时 10 个样本取中位数没有基线就没有「提升」,这是整张验收卡的锚点
单份耗时用工具后,同样 10 个样本的实测耗时与基线相减就是省下的时间,最直观
准确率盲测样本中完全正确的比例(按业务标准判,不按技术标准)要同时问一句:错的那部分,是不是关键项
人工修订率需人工改动的工作量占总产出比例决定「省事」是真的还是把工作挪了个位置
采纳率上线 2 周后,目标岗位实际使用的人数比例最容易漏、也最致命:工具做出来了,没人用等于没做

刻意不纳入「满意度」「体验感」「智能化程度」这类无法核对的指标——它们会让一场没有结论的试点看起来很像成功。

三个最容易踩的坑

  • 用供应商准备的样本:测试数据必须自己出,且要包含真实业务里最烦的那批数据(格式乱、缺字段、手写体、长表格)。对方准备的样本,永远是挑过的。
  • 把「准确率 90%」当结论:要追问三个问题——在什么数据上算的 90%?错的 10% 是不是集中在关键项?这 90% 是模型自评还是业务同事逐条判的?三个问题答不上来,这个数字不能用。
  • 试点期无限延长:这是最贵的坑。到 D14 必须三选一,都不选也是一种选择——等于默认继续花钱。真需要延长,就重新起一个 2 周的 POC,而不是把老的拖着。

本文要点

  • 核心判断:AI 试点失败多数不是模型不行,是开工那天没写验收口径
  • MIT NANDA 2025:约 95% 试点零可衡量回报,归因是 learning gap 而非模型质量
  • Capgemini 2023:88% 的 AI 试点未进入生产;S&P Global 2025:42% 的生成式 AI 试点被放弃
  • 两周清单核心:D1 写验收卡 → 真实数据盲测 → D9 业务同事逐条复核 → D14 必须出结论
  • 验收只看 5 个数字:基线耗时、单份耗时、准确率、人工修订率、采纳率
  • 最容易漏的是采纳率:工具做出来没人用,等于没做

常见问题

POC 一般做多长时间合适?

建议以两周为上限,单场景、单点闭环。原因不是时间不够,而是时间越长越容易失去结论——三个月还在「优化」的试点,基本等于没有结论。如果两周内确实跑不出可用结果,通常说明场景选得太大或数据条件不具备,应该换场景而不是加时间。两周做不完的,往往不是 POC 太长,是范围太宽。

怎么防止供应商拿出「表演式演示」?

三条硬约束:第一,测试数据由自己提供,且不提前交给对方;第二,盲测阶段只看原始输出,不接受现场调参;第三,判定由业务同事做,不看技术说明、只看结果能不能直接用。能做到这三条,演示环节的差距会立刻显出来。另外可以要求对方在 D1 验收卡上签字,写明及格线。

试点通过后,就能直接上生产吗?

不能直接上,但距离近了很多。试点验证的是「这条路走得通」,生产要补的是权限、数据更新机制、异常处理、责任归属和成本控制。建议把验收卡里的指标作为上线后的持续监测项,尤其是采纳率——试点期有人盯着,上线后没人盯,采纳率掉下来是常态。

团队人手不够,也要做两周 POC 吗?

越缺人越要做。没人手的团队最怕的是「花了半年、什么也没落下」,两周清单的作用正是把不可控的长周期切成可控的短周期。可以精简但不能省的两件事:第 1 天的验收卡(半天)和 D9–D10 的业务复核(2 天)。其余环节可以让服务商多做,这两件事必须自己来。

验收卡上写什么才算合格?

四件事:一件事(要解决什么、边界在哪)、一个基线(现在多久、现在多准、现在花多少)、一组指标与及格线(用上面 5 个数字,每个都写清及格线)、一个签字人(谁判定通过,避免最后集体模糊)。一页纸写完,写不完说明范围太大,先砍范围。

宋运奎 — 浩瀚数据晟财创始人
宋运奎
浩瀚数据晟财 · 创始人 / CEO
原小米之家数据负责人国际数据和人工智能管理协会中国分会理事中国电子信息行业联合会数据治理专委会委员工信人才大模型应用创新与数据要素高级人才

原小米新零售小米之家数据负责人,主导搭建业内领先的智能数据体系;曾任金山软件核心数据产品负责人,主导研发业内最早的移动端数据产品 KBOSS 平台。专注 AI 场景化应用与企业数据资产化运营,本文由其主笔并负责内容审核。

RELATED · 相关阅读

继续往下看

想让试点在第 14 天就有结论?

我们把「两周 POC 验收清单」做成了轻服务:帮你选场景、写验收卡、备测试数据、组织盲测与业务复核,到点给你一页结论——继续、换法还是停止,都有依据。

预约能力交流 看轻服务