AI吞噬旧书:15亿美元和解背后的数据枯竭危机

0 阅读

在人工智能产业狂飙突进的表象之下,一场关于人类知识载体的隐秘掠夺正在悄然上演。多家头部AI公司正通过中间商大规模收购二手图书,这些书籍在经历切脊、高速扫描后,往往面临物理销毁的命运。这一行为并非出于对纸质书的怀旧,而是为了获取2022年之前“未被机器污染”的纯净训练数据。随着Anthropic“巴拿马计划”的曝光以及高达15亿美元的版权和解金创下美国司法纪录,这场数据争夺战已超越商业竞争范畴,演变为对AI产业核心悖论的深刻拷问:AI越成功,其赖以生存的人类数据资源反而越稀缺。

数据污染的连锁反应与模型塌缩

理解AI公司为何不惜重金购买旧书,首先需要厘清当前互联网内容生态的结构性危机。斯坦福大学2026年发布的AI指数报告揭示了一个令人警醒的趋势:自2025年初以来,新发布的互联网内容中,AI生成的比例已突破51.72%。而在2022年ChatGPT发布之前,这一比例几乎为零。Cloudflare的数据进一步佐证了这一趋势,其托管网站的网络访问请求中,约57.4%来自人工智能和自动化程序,人类请求仅占42.6%。值得注意的是,这一数据衡量的是HTTP请求数量,考虑到AI Agent单次可访问数千页面而人类仅需几次点击,实际的人类内容产出占比可能更低。

这种由AI生成内容主导的互联网环境,直接导致了“模型塌缩”(Model Collapse)风险的加剧。牛津大学、剑桥大学等机构在《Nature》发表的研究指出,当AI模型使用由AI生成的数据进行递归训练时,输出质量会出现不可逆的退化。在一项针对Meta OPT-125m模型的实验中,仅经过九次迭代,模型关于14世纪教堂塔楼的描述便从建筑学讨论跑偏至介绍不存在的兔子物种。这种退化源于统计近似误差、函数表达误差和函数近似误差的复合效应,是数学层面的必然结果。

Epoch AI的测算显示,语言模型将在2026年至2032年间耗尽人类公开的高质量文本数据。尽管微软Phi-4、谷歌Gemma等模型已尝试混入合成数据,但研究表明,训练数据中仅0.01%的虚假文本就可能导致模型有害输出增加11.2%。这种指数级的放大效应使得合成数据难以成为彻底解药。相比之下,2022年之前印刷的纸质书在时间线上天然免疫了AI污染,成为稀缺的“干净”数据源。

隐秘的产业链与法律灰色地带

在这一需求驱动下,一个庞大的二手书收购产业链应运而生。数据中间商ISBNdb将业务重心转向AI行业,提供从1000本到100万本不等的批量采购服务。据调查媒体404 Media披露,Anthropic的“巴拿马计划”在一年内花费数千万美元购买了数百万本纸质书。这些书籍通常带有ISBN以便去重,且买家对主题、类型不加区分,甚至无视高于市场价的价格。

具体的操作流程极具破坏性:工人使用液压切割机切掉书脊,将散开的书页送入高速扫描仪转化为高清PDF,随后将纸质残骸直接送往回收公司销毁。Anthropic内部文件显示,该项目旨在对全球图书进行“破坏性扫描”,并严格保密。负责该项目的硅谷老兵汤姆·特维透露,扫描量在50万到200万本之间,完成周期约为六个月。ISBNdb在营销文案中甚至建议客户将这一行为重新包装为“数字化保存”,尽管其本质是消耗而非传播。

这一行为在法律上引发了巨大争议。2025年6月,联邦法官威廉·阿尔苏普作出双重裁定:一方面认定Anthropic的破坏性扫描属于“合理使用”,因为训练具有“变革性”;另一方面认定其在启动计划前下载盗版图书数据库LibGen的行为侵犯版权。2026年7月,最终和解协议获批,Anthropic支付15亿美元。这一判决确立了一个荒诞的激励结构:合法购买并销毁书籍被视为“规避非法复制”,而从盗版网站下载则面临巨额罚单。这种“合法但更贵”的路径,正在重塑AI训练数据的供应链逻辑。

知识黑箱与公共利益的流失

旧书争夺战背后,隐藏着更深层的伦理与社会危机。AI公司承诺“让人类知识触手可及”,却在实践中买断、拆毁人类知识最坚实的载体。扫描后的数字内容进入AI公司的私有数据库,仅用于内部训练,公众无法访问。这与图书馆数字化的使命形成鲜明对比:图书馆数字化旨在保存和传播,是知识的“放大器”;而AI公司的数字化旨在消耗和训练,是知识的“黑洞”。

在批量采购中,稀有书籍面临永久消失的风险。被大量买走的往往是地方史、小语种文献、绝版专著等“长尾”书籍,这些书籍可能已无其他存世副本。当采购规模达到百万级别且完全匿名保密时,没有任何外部机制能确保这些珍贵文化遗产不被混入销毁行列。对于中小作者而言,打击同样真实。AI公司提供的授权报价极低,每张永久AI训练许可证仅约10美元,独立作者无力通过法律途径追责,只能眼睁睁看着自己的作品被切碎化为数字比特。

对中国AI从业者而言,挑战尤为严峻。中文高质量数据在全球大模型训练数据集中占比极低,数据稀缺迫使开发者更多依赖机器翻译和合成内容,进一步加剧数据污染。DeepSeek-V3等模型需要数万亿高质量文本片段,而目前纯净的中文纸质书数据获取难度极大。这种困境使得“获取纯净中文纸质书数据”成为中国AI发展的迫切但艰难的任务。

后旧书时代的AI出路

即便AI公司今天买光了所有旧书,下一代模型训练时还能找到纯净的数据吗?每一轮AI生成的文本都在污染互联网,新一轮模型又要从这片被污染的海洋中捞取训练素材。收购旧书只是延缓了模型塌缩的速度,并未解决根本问题。学术界正在探索多条出路,如“累积”而非“替换”的数据训练范式,以及加入封闭循环之外的真实数据以阻止塌缩。然而,这些技术路径赢得的只是时间,而非永恒。

模型塌缩的根本矛盾在于,AI的成功正在毁掉它赖以成功的数据基础。我们需要建立的不仅是一套更高效的数据获取机制,更是一套让技术进步与知识传承、商业利益与公共权益、AI能力与人类尊严之间保持平衡的新契约。当AI把人类写在纸上的最后一句话也吞进去之后,互联网上剩下的将只有AI自己说过的话。这不再是一个单纯的技术问题,而是关乎人类文明如何与人工智能共存的根本命题。在这场数据枯竭的危机中,保护人类知识的公共性与多样性,或许比追求算法的极致性能更为重要。