300 万亿 token。这是 Epoch AI 在 2024 年论文中估算的人类公开文本数据总存量——从互联网诞生至今所有可被抓取、质量过关的自然语言内容的总和。
今天,最先进的大语言模型已经消耗了数十万亿 token,而且每年还在以约 2.5 倍的速度增长。按照这个轨迹,人类生成的高质量文本数据将在 2026 到 2032 年间被彻底耗尽。这就是业界所说的「数据墙」。

图中的蓝色曲线是各代模型实际使用的训练数据量,从 GPT-3 到 Llama 3 再到最新的前沿模型,数据集规模在对数坐标上近乎直线上升。青色区域是人类文本数据的总存量估计。两条线的交叉点,就是数据墙。
数据墙的本质:指数增长遇上有限存量
理解数据墙,需要从三个维度看。
第一个维度是数据集的增长速度。Epoch AI 的研究显示,AI 训练数据集的规模每年增长约 2.5 倍,训练算力每年增长约 4 倍。GPT-2 在 2019 年使用了约 100 亿 token 的训练数据,GPT-3 扩大到 5000 亿,到 2024 年的 Llama 3 已经训练在 15 万亿 token 上。五年间数据量增长了三个数量级。
第二个维度是数据的总存量。Epoch AI 估算,经过质量过滤和去重后,互联网上可用的人类生成公开文本约 300 万亿 token(90% 置信区间为 100 万亿到 1000 万亿)。这个数字看起来很大,但相对于模型的增长速度,消耗速度更快。关键变量在于「过训练」(overtraining)程度:Llama 3-70B 已经被过训练了约 10 倍,即用远超计算最优比例的数据量来训练。如果前沿模型按 5 倍过训练,数据墙在 2027 年到来;如果过训练 100 倍,数据墙可能已经发生在 2025 年。
第三个维度是数据可用性的加速收缩。MIT Data Provenance Initiative 对 14,000 个常用 AI 训练数据源域名进行了审计,发现 C4、RefinedWeb、Dolma 三大公共数据集中已有约 5% 的数据被通过 robots.txt 封锁,其中高质量来源封锁比例高达 25%。更严重的是,C4 数据集中 45% 的内容已受到网站服务条款的限制。这不是简单的技术限制——《纽约时报》起诉 OpenAI,Getty Images 起诉 Stability AI,Reddit、Stack Overflow、X 纷纷开始对 AI 数据抓取收费。数据市场的供给侧正在主动收缩。
模型崩溃:当 AI 开始吃自己的输出
面对数据枯竭,一个直觉方案是让 AI 自己生成训练数据——合成数据(synthetic data)。这条路在数学和编程等可验证领域确实有效,但存在一个根本性的风险:模型崩溃。
2024 年发表于 Nature 的论文(Shumailov et al., DOI:10.1038/s41586-024-07566-y)正式定义了这一现象:当生成模型在前代模型的输出上反复训练时,原始数据分布的尾部特征会逐步消失。经过若干代后,模型输出收窄到一个接近狄拉克 δ 函数的尖峰——模型丧失了生成多样化、低概率但有效输出的能力。
这是一个退化的正反馈循环。互联网正在被 AI 生成的内容加速填充,而这些内容又会被下一轮的网络爬虫抓取,成为新一代模型的训练数据。Reddit 上已经出现了企业批量植入内容以影响 AI 搜索答案的现象,从源头上污染了模型的训练语料。
2026 年 5 月发表于 Physical Review Letters 的研究提供了新视角。King's College London、挪威科技大学和阿卜杜斯·萨拉姆国际理论物理中心的团队分析了指数族模型(Exponential Families)的封闭式训练。他们发现,在完全只用模型自身输出训练的闭环中,模型崩溃不可避免。但引入哪怕一个来自真实世界的外部数据点,就能在数学上阻止崩溃——即使合成数据的数量无穷大于真实数据。这项研究为理解模型崩溃提供了严格的统计基础,并提示了解决方向:合成数据与真实数据的混合,而非替代。
数据市场的新经济
数据墙催生了一个新市场:训练数据许可。这个市场的定价跨度极大。
Reddit 与 Google 在 2024 年签署了每年约 6000 万美元的内容许可协议,允许 Google 使用 Reddit 内容训练 AI。此后 Reddit 又与 OpenAI 签署协议,两者合计每年约 1.3 亿美元。Reddit CEO Steve Huffman 在 2025 年 7 月的财报电话会上表示「自签署最初协议以来,每个变量都变了」,推动转向基于使用量的动态定价模式——数据被 AI 引用得越多,费用越高。
Reddit 的做法定义了数据市场的新范式。传统许可是一次性买断,动态定价则将数据的定价权与下游 AI 产品的实际价值挂钩。对于数据持有者而言,这是一次权力转移:从被动出售变为主动议价。彭博社报道,Reddit 正在与 Google 和 OpenAI 重新谈判,寻求更深入的利益绑定。
诉讼和封锁在另一端塑造市场边界。《纽约时报》诉 OpenAI 案仍在审理中。Anthropic 面临 Reddit 的起诉。出版社开始封锁 Wayback Machine 的爬虫,担心存档页面成为 AI 公司获取版权内容的间接来源。MIT Data Provenance Initiative 将这种趋势称为「同意危机」(consent crisis):数据提供方越来越不愿意将自己的内容无偿贡献给 AI 训练管线。
合成数据的可行边界
合成数据并非死路。关键在于区分使用场景。
2026 年的研究共识是:模型崩溃可避免,但前提是合成数据与真实数据共存而非替代。Hugging Face 的 Cosmopedia 框架、Microsoft 和 Anthropic 的生产级合成数据管线都验证了这一路径。SynthLLM 框架的缩放律研究(arXiv:2503.19551)表明,合成数据在预训练后的微调阶段表现最稳定,而在预训练阶段大规模替换真实数据时风险最高。
四种被验证有效的合成数据场景:
微调数据生成:用前沿模型生成指令-回复对,用于较小模型的指令遵循微调。OpenAI 的 Distillation API 将这一流程产品化。
评估集构建:生成特定领域的测试样本,用于评估模型在分布外场景的表现。
边缘案例增强:为罕见但重要的场景生成额外训练数据,如医疗诊断中的少见病理。
隐私替代:用统计方法生成保留原始数据分布但不包含个人可识别信息的数据,满足 GDPR 等隐私法规要求。
这些场景的共同点是:合成数据作为真实数据的补充而非替代。King's College London 在 Physical Review Letters 发表的结论从统计层面佐证了这一实践方向——保留真实世界的信号锚点,是防止退化退化的数学必要条件。
开发者和企业的影响
数据墙对不同角色的影响程度不同。
对前沿实验室(OpenAI、Google、Anthropic)而言,数据许可成本正在成为继 GPU 之后的新瓶颈。Reddit 每年 1.3 亿美元的定价设定了参考:大规模高质量对话数据的许可费已经从数百万美元跃升到数亿美元级别。实验室之间的竞争正在从「谁有更多 GPU」转向「谁有更多独占数据」。
对开源社区而言,数据墙的冲击更为严峻。开源模型依赖公共数据集(Common Crawl、Wikipedia、arXiv),而这些公共数据源正在被封锁和许可化。MIT 的审计显示,Hugging Face 上流行数据集的许可证缺失率超过 68%,错误率超过 50%——开源社区不仅面临数据减少,还面临许可证混乱带来的法律风险。
对垂直领域开发者而言,数据墙的影响反而最小。医疗、法律、金融等领域的训练数据本就属于领域专有的结构化数据。这些数据的获取门槛一直是商业壁垒,数据墙只是使这个现状更加显性。
互联网记忆的消解
数据墙有一个更深层的外部性:互联网作为集体记忆的功能正在退化。
The Walrus 的分析文章指出了几个标志性事件:FiveThirtyEight(Nate Silver 创立的数据新闻网站)在被 Disney 关闭后,整个存档被直接删除。Wikipedia 的流量因 AI 系统直接抓取内容而下降,捐赠和编辑参与随之萎缩。Internet Archive 的 Wayback Machine 同时面临法律诉讼和新闻机构的爬虫封锁——出版社担心存档页面成为 AI 获取版权内容的间接来源。
德国法院在近期判决中裁定 Google 对其 AI 概览功能生成的错误信息承担编辑责任。法院认为,搜索引擎在提取和改写原始信息时已经超出了「中立通道」的角色,它创造了全新的内容层,因此需要承担相应的编辑义务。这一判例可能为各国政府监管 AI 平台提供更大的法律空间。
这些趋势叠加的结果是:AI 系统消耗的互联网内容越多,可供未来 AI 训练用的高质量内容就越少。同时,AI 生成内容的激增正在稀释信号噪声比,使得下一代模型的训练数据质量下降。这已经超越了某个实验室的危机范围,是整个信息生态的结构性问题。
突破路径
解决数据墙的路径正在收敛到几个方向。
合成数据管线成熟化:Cosmopedia、Distilabel 等开源框架正在使合成数据的生成、过滤和验证流程标准化。SynthLLM 的缩放律研究为预测合成数据的效果提供了量化工具。前沿实验室每年在推理算力上花费千万美元级别生成预训练规模的合成数据。
数据许可市场制度化:Reddit 的动态定价模式正在被其他平台效仿。数据持有者改为持续收取使用费,AI 公司改为持续付费订阅。这个市场的年交易规模正在从千万美元向数十亿美元扩张。
非文本模态开发:视频、音频、传感器数据等模态的数据量远超文本。Google 的 Gemini 系列已经开始大量使用 YouTube 视频数据进行训练。多模态训练的重心正在向多信号融合迁移。
架构效率提升:过训练策略(用更多数据训练更小的模型以降低推理成本)本身在加速数据消耗,但稀疏激活架构(MoE)和高效架构(如 Liquid AI 的 LFM2 混合卷积+注意力架构,在 2.6B 参数下实现接近大模型的能力)提供了一条不同的路径——用更聪明的架构而非更大量的数据来提升性能。
数据墙是一个分水岭。在数据充裕的年代,进步靠规模;在数据稀缺的年代,进步将靠效率、独创性和制度设计。哪些团队能在这三个维度上同时突破,将决定下一个十年的竞争格局。