数据墙:当 AI 耗尽人类的集体记忆
300 万亿 token。这是 Epoch AI 在 2024 年论文中估算的人类公开文本数据总存量——从互联网诞生至今所有可被抓取、质量过关的自然语言内容的总和。 今天,最先进的大语言模型已经消耗了数十万亿 token,而且每年还在以约 2.5 倍的速度增长。按照这个轨迹,人类生成的高质量文本数据将在 2026 到 2032 年间被彻底耗尽。这就是业界所说…
300 万亿 token。这是 Epoch AI 在 2024 年论文中估算的人类公开文本数据总存量——从互联网诞生至今所有可被抓取、质量过关的自然语言内容的总和。 今天,最先进的大语言模型已经消耗了数十万亿 token,而且每年还在以约 2.5 倍的速度增长。按照这个轨迹,人类生成的高质量文本数据将在 2026 到 2032 年间被彻底耗尽。这就是业界所说…