政策解读

AI 落地卡在数据上:
国家首次系统部署行业高质量数据集,企业怎么接

AI 项目卡住的环节,已经从「选哪个模型」变成「有没有一份拿得出手的数据」。国家数据局 2026 年 6 月首次系统部署行业高质量数据集建设,门槛就写在「AI-Ready」四个字里。

浩瀚数据晟财 · 数据咨询团队 发布于 2026-10-07 更新于 2026-10-08 阅读约 6 分钟

3 分钟结论:这份文件改变了什么

先说结论:AI 项目卡住的环节,已经从「选哪个模型」变成了「有没有一份拿得出手的数据」。2026 年 6 月,国家数据局印发《关于推进行业高质量数据集建设行动的实施方案》(国数科基〔2026〕25 号,6 月 3 日印发、6 月 8 日对外发布),把行业高质量数据集从企业的「自选动作」升级为国家行动,并给出了到 2028 年底的时间表。据央视报道,这是国家层面首次对数据赋能人工智能发展作出的系统性部署。

对企业来说,这份文件真正的含义只有三句:① 你手里那份别人复制不了的行业数据,是这一轮 AI 落地真正的入场券;② 但原始数据不算数,要按「AI-Ready」的四条标准治理和标注过;③ 重点不在买什么技术,而在把数据集放进一个真实业务场景里验证。

如果你只想记一句话:别再问「我们该用哪个模型」,先回答「我们有哪些数据是别人没有的、能不能拿给模型用」。

政策原文讲了什么:六大行动一张表

文件的核心是六个专项行动,逻辑上是一条链:先有数据(强基扩容)→ 把业务知识注入进去(标注攻坚)→ 达到能喂模型的质量(提质增效)→ 放进真实场景验证(应用赋能)→ 全过程可管可控(管理服务)→ 最后变成能调用、能计价的资产(价值释放)。政策原文把这个闭环叫「数据飞轮」:场景牵引数据、数据驱动模型、模型赋能应用、应用创造价值。

专项行动一句话说清落到企业这一侧是什么
① 强基扩容拓宽供给渠道、丰富供给类型,为人工智能提供「燃料」聚焦 19 个重点领域 + 5 个创新领域建数据集;鼓励链主单位带动上下游协同共建
② 标注攻坚数据标注从「以人为主」转向「人机协同、专家深度参与」让懂业务的人参与标注,而不是把标注当廉价外包劳动
③ 提质增效建设「人工智能就绪(AI-Ready)」的数据集,推行「一次测评、全国互认」按四类质量标准整理自己的数据;将来不必为每个客户重做一遍评测
④ 应用赋能以场景为牵引,打造「数据飞轮」应用闭环每个数据集都要挂一个真实业务场景,建成之后要真的用起来
⑤ 管理服务全生命周期管理,落实数据持有权、使用权、经营权「三权分置」把数据来源、授权链条、使用边界写清楚——这是合规底座
⑥ 价值释放产品化、资产化、市场化,探索以词元(Token)为基础的价值体系数据集要能被调用、被计量,才有定价和交易的前提

文件点名的重点领域是 19 个:科学研究、工业制造、农业农村、智慧能源、交通运输、金融服务、医疗卫生、教育教学、电子商务、人力资源、文化旅游、应急管理、气象服务、绿色低碳、公共安全、城市治理、住房建设、自然资源、社会信用;创新领域 5 个:低空经济、具身智能、智能驾驶、智慧海洋、生物制造。对照一下你的行业在不在里面——在,就意味着未来两年这个方向会有配套措施、专项资金与示范项目认定。

政策的紧迫感也可以从一组数字看出来:国家数据局披露的数据显示,截至 2026 年第一季度,全国已建成高质量数据集超过 11.6 万个,总体量超过 960PB,日均词元(Token)调用量突破 140 万亿。在这样的体量下,通用模型能力正在趋同,真正拉开差距的是行业私域数据——官方解读里有一句很直接的话:公域数据红利消退,行业私域数据成为核心资源。

门槛写在「AI-Ready」四个字里

文件里对企业最实用的一句是:推动构建符合结构完整性、内容多样性、标注准确性、模型适配性等质量标准、满足人工智能就绪(AI-Ready)的高质量数据集。这四个词就是一张自查表。多数企业手里有数据却用不起来,缺的正是这四条。

AI-Ready 标准它到底在问什么不达标时的典型症状
结构完整性字段、格式、层级是否统一、可被机器解析数据散在多个系统里,同一个客户三套编号,导出即失真
内容多样性覆盖的场景和边界情况够不够常见问题答得不错,一遇到特殊情况就开始胡说
标注准确性有没有业务专家参与、标注口径是否一致标注靠外包短期培训,同一句话两个人标出两个结果
模型适配性能不能直接被模型消费、效果可验证把一份 80 页 PDF 丢给模型就当「数据给了」,回答质量全靠运气

这四个词的价值在于,它们把「我们的数据好不好」这种说不清的问题,变成了四个可以逐条回答的问题。能逐条回答,才有改进的起点。

企业要做的三件事,先做哪一件

把六大行动折到企业视角,真正要动手的只有三件。顺序很重要:先确认手里有什么,再决定怎么整,最后才是验证。反过来做——先买模型、先搭平台,是最常见的浪费。

顺序要做什么交付物参考周期谁主导
第一步私域数据盘点:哪些数据是我们有、别人没有的,权属与使用边界在哪数据资源清单 + 权属与授权说明2-4 周业务部门 + 数据负责人
第二步按 AI-Ready 四条标准治理与标注,把业务知识注入进去口径统一的数据集 + 标注规范 + 质量报告1-3 个月数据团队 + 业务专家
第三步选一个真实场景做应用验证,用业务指标验收而不是模型分数可复用的应用场景 + 效果对比数据4-8 周业务方牵头

先说第一步为什么不能跳。政策对高价值数据资源的描述是四个特征:来源独特、外部难以复制、持续供给、长期绑定具体应用场景。这四个特征没有一个是技术属性,全是业务属性——它们只能从盘点里得出来,不可能从采购里得出来。很多企业被问「你们有什么数据」时,回答是「数据都在系统里」,这等于没有盘点。

再说第二步里最容易被忽略的一点:标注必须让业务专家进场。政策把标注升级为「人机协同、专家深度参与」,并明确数据标注已从低端重复劳动变成知识密集型工作。落到企业就是一句话:你那份数据的价值,藏在老师傅的判断里,不在字段里。请一位有十年经验的业务专家参与两周,通常比多买一台服务器更有用。

政策另外给了三个抓手

除了目标和要求,文件里还有三条可以立刻对接的具体机制。

抓手政策表述对企业意味着什么
数据不等价交换鼓励数据换数据、换订单、换服务、换模型、换场景等交换方式,探索数据作价出资拿不出预算买数据的企业,可以用自己的数据去换——这对中小企业尤其实际
一次测评、全国互认创新「数据质量验证 + 模型应用反馈」测评机制,推行统一测评方案与工具数据集质量评定会标准化,将来不必为每个客户、每个项目重做一遍评测
资产化与融资开展数据资产盘点、登记、评估试点,创新数据质押融资、作价入股等模式数据集从成本项变成可质押、可作价入股的资产——与「数据资产入表」是同一方向

第三条要和另一份文件连着读。2026 年 2 月,国家数据局、工业和信息化部、公安部、证监会四部门联合印发《关于培育数据流通服务机构 加快推进数据要素市场化价值化的意见》,首次把数据流通服务机构做了体系化分类——数据交易所(中心)、数据流通服务平台企业、数据商,并提出到 2029 年底的目标。两份文件叠起来看,政策给企业画出的路径是很清楚的:把数据整理成 AI-Ready 的数据集 → 在真实场景里验证 → 通过数据流通服务机构对外流通或作价,最终进入资产表。

这里有一条实用的提醒:「数据商」已经成为一个有明确界定的角色。今后再有人拿着「全链条数据要素服务」的方案来找你,可以先问一句「你属于哪一类」。交易所管市场秩序、平台企业管流通链路、数据商管货品本身——三类不是高低之分,是分工之别。能力结构完全不同的机构,报价和交付物本来就不该长得一样。

四个容易被读偏的地方

  • 误判一:以为又是一份「要报材料」的文件。这是一份建设性部署,不是新的合规义务,重点在供给、流通与应用三个环节。它真正的信号是资源会往这个方向倾斜:地方配套措施、专项基金、示范项目认定。方案明确「鼓励地方设立专项基金,为产业发展提供持续稳定的资金支持」。
  • 误判二:等标准齐了再动手。文件写的是「支持有条件地区开展试验区建设」「以先行先试工作为抓手,打造标杆示范场景」——先做的人定义标准,后做的人适配标准。等标准齐了再开始,等于把定义权让出去。
  • 误判三:把数据集建设当成 IT 项目。官方解读点出的行业痛点是「统筹规划不足、标准不统一、治理能力滞后」,这三件事没有一件是买套系统能解决的:口径要业务部门定,标注要业务专家参与,场景要业务方牵头。
  • 误判四:数据多就等于数据好。方案对行业高质量数据集的定义是「经过采集、加工等数据处理,可直接用于开发和训练人工智能模型、能有效提升模型性能」——判断标准是能不能提升模型效果,不是有多少 TB。不经治理地堆数据,只是把噪音换了个地方放。

本文要点

  • 国家数据局 2026 年 6 月印发《关于推进行业高质量数据集建设行动的实施方案》(国数科基〔2026〕25 号),是国家层面首次系统部署「数据赋能人工智能」
  • 六大专项行动:强基扩容 → 标注攻坚 → 提质增效 → 应用赋能 → 管理服务 → 价值释放,形成「数据飞轮」
  • 真正的门槛在 AI-Ready 四条:结构完整性、内容多样性、标注准确性、模型适配性
  • 企业要做的三件事,按顺序:私域数据盘点 → 治理与标注 → 场景应用验证
  • 可直接对接的三个机制:数据换数据/换订单、一次测评全国互认、数据资产化与质押融资

常见问题

这份方案和中小企业有关系吗?

有,而且比看起来关系更大。方案聚焦 19 个重点领域和 5 个创新领域,覆盖工业制造、交通运输、金融服务等大量中小企业密集的行业,并明确鼓励各类市场主体以应用需求为牵引参与数据集建设。中小企业真正的机会不在「建大平台」,而在于把别人复制不了的那部分业务数据整理成可用数据集;方案同时鼓励数据换数据、换订单、换服务、换模型、换场景等交换方式,预算有限的企业不必只靠采购拿到数据。

高质量数据集和我们平时说的数据治理,是一回事吗?

不是。数据治理解决的是数据可用、可信、口径一致,属于基础工程;高质量数据集是在这个基础上再往前走两步——把业务知识通过标注注入进去,并验证它确实能提升模型性能。可以这样理解:数据治理让数据变干净,数据集让它可训练。这也是跳过治理直接建数据集通常失败的原因,底座不牢,标注出来的仍然是噪音。

没有能力自己建数据集,可以买吗?

可以,政策明确支持培育专业数据企业与数据流通服务机构。但要注意两点区别:一是买到的多是通用或行业通识数据,能解决冷启动,解决不了你的差异化;二是真正构成壁垒的行业专识数据通常只能自己积累,因为它来自你的业务过程和业务专家的判断。务实的组合是外购通识数据打底、自建专识数据做差异。另外,2026 年 2 月的文件把数据流通服务机构分成数据交易所、数据流通服务平台企业、数据商三类,采购前先分清对方属于哪一类,报价和交付物才好横向比较。

建设一份行业高质量数据集大概要多久?

取决于范围和数据治理基础,没有统一答案。从数据项目的一般经验看,聚焦单一业务场景并且已有一定治理基础的情况下,从盘点到完成一次应用验证通常在 3 到 6 个月;跨部门、跨系统的数据集会明显更长。方案本身给出的时间表是到 2028 年底形成一批经过应用验证的数据集,说明政策预期是以年为单位推进,不是以周为单位。建议先在一个场景里跑通,再复制到其他场景。

数据集建好之后,怎么变成收入或者资产?

政策给了三条路径。一是流通交易:通过数据交易所或数据商对外提供,方案提出推动数据交易从基础数据包交易向 API 调用、按需订阅等高附加值形态升级,并探索以词元为基础的价值体系。二是资产化:方案明确开展数据资产盘点、登记与评估试点,创新数据质押融资、作价入股等模式,这与数据资产入表是同一方向上的延伸。三是自用提效:把数据集用进自己的业务场景,用业务指标证明价值,这也是前两条路径的定价依据。无论走哪条路,前提都相同——权属清晰、成本可计量、价值可验证。

宋运奎 — 浩瀚数据晟财创始人
宋运奎
浩瀚数据晟财 · 创始人 / CEO
原小米之家数据负责人国际数据和人工智能管理协会中国分会理事中国电子信息行业联合会数据治理专委会委员工信人才大模型应用创新与数据要素高级人才

原小米新零售小米之家数据负责人,主导搭建业内领先的智能数据体系;曾任金山软件核心数据产品负责人,主导研发业内最早的移动端数据产品 KBOSS 平台。专注 AI 场景化应用与企业数据资产化运营,本文由其主笔并负责内容审核。

RELATED · 相关阅读

继续往下看

想知道你们手里的数据,离「AI-Ready」还差几步?

我们可以先做一次私域数据盘点与 AI-Ready 差距评估:标出哪些数据是你们独有、权属是否清晰、按四条标准还缺什么,并给出一个可落地的场景验证建议。我们做过上市企业的数据资产入表与数据治理项目,评估结论只对业务负责,不对工具负责。

预约数据体检 看数据能力