AI断粮危机:粮仓满了,米没淘
2025 年初,马斯克在一场直播里说了句让整个行业打寒颤的话:我们基本上已经耗尽了人类知识的累积总和。
同一年,Ilya Sutskever——那个亲手把 Scaling Law 推上神坛的人——转头说:2010 年代是规模扩张的时代,现在我们回到了惊奇与发现的时代。每个人都在找下一个突破点。
到了 2026 年,这场争论有了个统一的名词:数据墙。
中国信通院总工程师何宝宏在 5 月的一次大会上讲得更直白:互联网上的模型预训练已经撞上了数据墙,公域数据被消耗殆尽,几乎找不到新的数据源来有效拉升模型能力。
听起来很吓人。全世界的 AI 实验室都在抢同一批越来越少的原料,就像一群矿工挖到矿脉尽头。
但我在一线做了这么多年数据,看到这些报道的第一反应不是恐慌,而是一个很不合时宜的疑问:
2025 年,我国一年产生的数据总量是52.26 ZB,同比增长 27.28%,占全球数据总量的 27.44%。
52 泽字节是什么概念?1 ZB 等于 10 的 21 次方字节。这个数字还在以每年四分之一以上的速度膨胀。
一边是数据以每年数十 ZB 的速度爆炸,一边是模型厂商哭着说没东西喂了。
这不叫饥荒。这叫粮仓满了,米没淘。
AI 断的不是数据,是能直接下锅的数据。
这两者的差距,就是数据治理这门手艺存在的全部理由。
一、粮尽了:三个数字
先别急着反驳,把支持"断粮论"的证据摆全。它们不是危言耸听,是有测算依据的。
第一个数字:300 万亿
Epoch AI 的研究给出一个被广泛引用的估算:互联网上高质量、可公开获取的人类文本,总存量大约是300 万亿 token。
这个池子里装着维基百科、开源代码仓库、学术期刊、数字图书馆,还有二十多年积累下来的论坛讨论。听起来浩如烟海——但它是有限的。
过去三个训练周期,前沿模型几乎把它吃干净了。每一本被数字化的书、每一个公开的 GitHub 仓库、2008 到 2022 年的每一条 Reddit 帖子、每一篇开放获取的医学论文,都已经转化成了神经网络权重。
而人类写新书、写新论文的速度,远远跟不上下一代训练集群指数级增长的胃口。
第二个数字:25%
如果说存量有限是天灾,那这一条是人祸。
MIT 牵头的"数据溯源计划"(Data Provenance Initiative)做了一项研究,检查 C4、RefinedWeb、Dolma 三套主流训练数据集的变化。结论是:短短一年之内,5% 的全部数据、25% 的最高质量来源被施加了访问限制。
《纽约时报》、Reddit、Stack Overflow 以及大量新闻机构,要么修改了服务条款,要么直接部署了技术封锁。
注意那个 25%——被锁住的不是边角料,恰恰是质量最高的那部分。这就像粮仓没见底,但最好的那几袋被人上了锁。
第三个数字:2026—2032
Epoch AI 的测算认为,高质量人类生成文本将在2026 到 2032 年之间被完全用尽,具体时间取决于实验室"过度训练"的激进程度。
有意思的是,这个区间在往后滑。他们早先的估计更悲观,后来被推迟了。这种修正本身就说明一件事:这堵墙的位置是算出来的,不是撞出来的。
而 2022 年那篇更早的论文曾经预测,高质量英文文本会在 2026 年耗尽。站在 2026 年回头看,这个预测的准头确实让人不舒服。
二、不是没粮,是粮吃不上
现在,请允许我把那个不合时宜的疑问展开。
52.26 ZB 和 300 万亿 token 之间,差的不只是数量级,是性质。
做个粗略的换算感受一下。1 个汉字大约对应 1.5 到 2 个 token,取中间值,300 万亿 token 差不多相当于 180 万亿汉字。听着很多,但 1 ZB 是 10 的 21 次方字节——即便只算文本,几十 ZB 的数据量级也远超这个数字。
那么问题来了:剩下的数据去哪了?
答案是——它们几乎全部锁在三个地方。
第一处:企业私域。你的 ERP 里跑了多少年的订单记录、你的客服系统里存了多少通真实通话、你的研发部门沉淀了多少份故障分析报告。这些数据从未上过互联网,不可能被爬虫抓走。它们是这座星球上最大的一批"未开采粮田"。
第二处:政府与机构内部。医疗、司法、教育、气象、自然资源。这些数据体量巨大、质量极高,但出于合规和主权考虑,绝大多数不会开放给商业模型训练。
第三处:物理世界。学习时报那篇文章里有个很能说明问题的对比:支撑通用大模型实现能力跃升的训练语料规模达万亿词元量级,而全球可用于具身智能训练的高质量真机交互数据集,普遍还处在百万级轨迹的规模。差了好几个数量级。
所以真相是:地球上的数据从来没有像今天这么多,而模型能合法、低成本、高质量获取的那一小部分,正在见底。
这不是资源枯竭。这是供给侧的结构性失效——粮在仓里,但没有通道把它变成能下锅的米。
三、互联网正在被自己的排泄物污染
还有一件比"存量有限"更麻烦的事,很多人没意识到。
2023 到 2025 这两年,数以百万计的自动发布机器人、SEO 内容农场、联盟营销工具,向公共互联网灌入了数十亿页低成本机器生成的文本。
到了 2026 年,如果一家实验室去爬开放网络,它抓到的东西极有可能是去年那批模型生成的合成文本。
有个说法很刻薄但很准:AI 行业污染了自己的水源。
后果是什么?现在研究人员花在建过滤器、识别并丢弃机器生成文本上的工程时间,比花在训练真正架构上的还要多。
这形成了一个特别荒诞的局面——
为了绕开数据墙,行业大规模使用 AI 生成内容;而 AI 生成内容泛滥,又把剩下的真实数据淹没得更深。你越急着解决问题,问题变得越贵。
于是出现了商业史上最诡异的一次圈地运动:2022 年之前由真人写下的、经过验证的干净文本,成了数字黄金。
科技公司花数亿美元去收购封闭的私有人类档案——医院网络几十年的病历、电信巨头的客服通话记录、历史学会扫描的实体档案。一度被视作"传统媒体遗老"的出版商、报业集团、论坛平台,突然在授权谈判中拿到了巨大的议价权。
如果你手上握着二十年真人写的论坛讨论,讨论的都是真实物理世界里的真实故障——那你坐着的,是一件无法人工制造的、不可替代的训练资产。
四、合成数据是救兵吗?一半是,一半不是
粮食不够就自己造,这是本能反应。行业的反应规模有多大?看两个数字:
据估算,近期前沿模型训练中已有30% 到 60%的训练 token 是合成的,不是爬来的。
Gartner 预测,到2026 年底,合成数据将占 AI 开发所用全部数据的约 75%——而 2021 年这个比例大约是 1%。
五年翻 75 倍。这个曲线比任何一款模型的迭代都陡。
但代价是:模型崩塌
《Nature》上那项标志性研究,把递归训练会发生什么演示得很清楚:
第一代,微小的统计误差和边缘案例被平滑掉;第三代,模型开始遗忘罕见事实、不常见的语言细微差别、少数群体的观点;第五代,输出退化为重复的、低方差的胡言乱语。
机制其实很好懂。语言模型是个概率预测引擎,它从人类分布的中心采样,偏爱常见词和典型结构。当你用合成数据训练模型,你是在用"近似的近似"做训练——概率分布的尾部消失了。
这个过程像生物学上的近亲繁殖:每一代都把细微缺陷放大一点。
所以主流团队给出的配比高度一致:合成数据占 30% 到 50%,剩下必须是真实且经过人工策展的。永远不要用纯合成数据训练,永远保留一小撮真人生成的种子做锚点。
反方也有道理:AlphaGo 就是这么赢的
但把合成数据一棍子打死也不对。有个反例太强了,绕不过去。
AlphaGo 最初学了人类棋谱,然后开始自我对弈几百万局,最终下出了人类从未下过的棋。它超越人类,恰恰是因为它不再受限于人类数据。
把这个逻辑推广到数学和编程——AI 可以生成新的数学题和解,验证解是否正确,然后用这些经过验证的合成数据训练。由于数学和代码有客观的标准答案,有效训练数据的量级变得近乎无限。
微软亚洲研究院的 SynthLLM 就是这么干的:用图算法把现有语料中的高层概念重组成新的合成样本,专门为了减少对网络爬取的路径依赖。
那到底谁对?
合成数据的瓶颈,从来不是生成器,是验证器。
凡是存在客观判定标准的领域——代码能否编译、数学是否成立、棋局输赢——自我博弈就能成立,而且能无限扩张。凡是依赖人类判断的领域——创意写作、微妙的分寸拿捏、审美与取舍——合成数据只会加速退化,因为没人能可靠地告诉模型"这个更好"。
换句话说:你能验证多少,才能合成多少。而企业的私域数据,本质上就是一台现成的验证器。
五、中国的解法:不找新粮,把陈粮淘干净
这一节是我最想写的部分。因为面对同一堵墙,两边的应对逻辑完全不同。
硅谷的主流叙事是"找新粮"——买版权、做合成、赌多模态、押具身智能。
中国给出的答案是另一套:把已有的粮淘干净。
2026 年 6 月 3 日,国家数据局印发《关于推进行业高质量数据集建设行动的实施方案》(国数科基〔2026〕25 号)。这份文件里有句话定义得很精准——行业高质量数据集是"经过采集、加工等数据处理,可直接用于开发和训练人工智能模型,能有效提升模型性能的行业数据的集合"。
请注意"可直接用于"这四个字。它承认了我在第二节说的那件事:原始数据和可用数据之间,隔着一道加工工序。
六个专项行动
方案部署了六件事,我按自己的理解重排一下逻辑:
最后一行值得多说一句。方案明确提出"探索词元交易等新型交易模式,构建以词元为基础、可量化、可定价的数据价值体系"。
这句话的分量在于:数据的计量单位,正在从"条数"和"GB",变成模型实际消耗的词元。按数据条数卖和按智能体实际调用的词元计价,是两套完全不同的商业模式。这跟我在云栖大会上看到的那笔首例词元交易,是同一件事的两个切面。
一个季度,从 960 PB 到 1565 PB。
同期,国家数据集管理服务系统正式发布并启动试运行,目标是建成"物理分散、逻辑集中"的国家级管理体系。
再看信通院何宝宏给的三条破解路径,跟这套国家方案完全咬合:一是从公域走向私域,针对特定行业和场景的私域数据深度开发利用;二是发展合成数据,但要注意控量使用;三是提升数据质量,以先进的数据工程手段不断优化已有数据的品质。
三条里有两条,说的都是同一件事——淘米。
六、企业该干的三件事
讲了这么多宏观的,落回你自己的企业。
如果"断粮"这个判断成立,那它对不同角色的意义是完全相反的。对模型厂商是危机;对手握行业数据的企业,是一次资产重估。
第一件:把"有数据"和"有 AI 就绪数据"分开算
这是最容易自欺的一步。几乎每个企业汇报时都会说"我们有 XX 年的数据积累、PB 级的存储"。
但把这几个问题问下去,答案通常会塌:
同一个"客户",在 CRM、ERP、售后系统里是不是同一个编码?同一个"营收",财务口径和业务口径差多少?那份号称十年的设备运行记录,中间换过几次传感器、换过几次单位?这些数据的血缘说不说得清——它是从哪张表、经过哪些加工来的?
如果答不上来,那你手上不是粮,是带壳的稻谷,还混了沙子。模型吃了会坏肚子。
建议做一件事:按"AI 就绪度"重新盘一遍家底,而不是按存储量。盘出来的数字大概率会比汇报用的那个小一个数量级——但这个小的数字,才是真的。
第二件:淘米,就是那套被嫌弃了十年的活
主数据统一、元数据补齐、口径对齐、质量规则、血缘打通——这些年数据治理干的就是这些,干得很苦,而且长期看不到直接回报。
很多数据团队在汇报时最怕被问的一句话是:"你做这个,业务价值在哪?"
现在答案来了,而且来得非常硬:过去二十年你做的数据治理,一分钱没白花。它只是提前了十年,才等到自己的估值时刻。
因为数据墙的本质不是"数据不多",是"能直接喂的太少"。而把不能直接喂的变成能直接喂的,正是这门手艺的定义。
有一个坑要特别提醒:千万别为了 AI 去新建一套"AI 数据集",把它和已有的数据治理体系并成两张皮。
我见过太多这样的项目——为了赶 AI 的班车,单独拉一套数据、单独建一套标准、单独招一批标注人员。半年后模型换了、场景换了,那套东西就废了。数据集不是项目交付物,是治理体系的产物。治理体系在,数据集会自己长出来。
第三件:造循环,而不是造库存
国家方案里有个词用得特别好:数据飞轮——场景牵引数据、数据驱动模型、模型赋能应用、应用创造价值。
它点破了一件很多企业搞反的事:最有价值的数据不在你的历史库存里,在你的业务正在发生的过程中。
为什么?因为模型训练的重心正在从"静态语料"转向"动态行为数据"。智能体调用 API 的路径、规划执行的步骤、试错修正的轨迹、人类反馈的信号——这些才是突破智能体自主性不足的关键要素。
这类数据有个特点:你不上场景,它就永远不会产生。
所以正确的顺序不是"先把数据治理好,再上 AI",而是"先选一个高频场景跑起来,用场景产生的数据反哺治理"。等数据治理完美再动手的,最后往往是既没数据也没场景。
七、到底谁在断粮
回到开头那个问题。
数据墙是真的,不用怀疑。Epoch AI 的测算、MIT 的溯源研究、Orion 和 Gemini 遇到的边际收益递减,都是硬事实。
但"断粮"这个比喻,把一个供给侧的结构问题,说成了资源总量的自然极限。这两者的差别很大:
如果是资源极限,那就只能等新技术、等新星球、等多模态和具身智能慢慢攒数据。
如果是结构问题,那答案是修通道——把锁在私域里的、散在部门墙后面的、埋在物理世界里的那些数据,变成模型能吃的形态。
前者靠运气,后者靠工程。
学习时报那篇文章里有句话,我认为是这场讨论里最清醒的一句:数据供需的主要矛盾,已经从"量的不足"转向"供给的体系化支撑缺失"。
这句话值得每个数据从业者抄下来。
断粮的是模型厂商,不是企业。
过去二十年,数据治理从业者最难回答的问题是"你创造了什么价值"。现在这个问题有了答案:你负责把粮仓里的稻谷,变成能下锅的米。在一个人人都抢米的时代,这门手艺第一次有了市价。
本文来自微信公众号“数据驱动智能”(ID:Data_0101),作者:王建峰,36氪经授权发布。