AI吞噬人类知识?数百万纸质书“阅后即焚”背后的版权与伦理危机
在液压切纸机锋利的刀片落下瞬间,一本厚重书籍的书脊被干脆利落地削掉。原本紧密装订的书页瞬间变成整齐的一沓纸张,这种机械性的破坏过程,在短视频平台上往往被视为一种“解压”视觉享受。然而,如果剥离掉那层工业美学的滤镜,真相却令人不寒而栗:这是AI公司为了获取训练数据,对实体书籍进行的系统性、工业化销毁。
这并非某个激进极客的个人行为,而是由头部人工智能巨头主导的商业战略。为了让大模型(LLM)“读懂”人类的知识,Anthropic等公司采取了一种极端且隐秘的手段——大规模采购纸质书,扫描后将实体书粉碎或回收,仅保留数字副本。这一被称为“巴拿马计划”的秘密工程,不仅暴露了AI行业对高质量文本数据的贪婪,更将全球范围内的文化遗产推向了消亡的边缘。
数据饥渴:从互联网泥沼到实体书荒野
大语言模型的训练逻辑很简单:数据越多、质量越高,模型越聪明。然而,随着生成式AI的爆发,互联网上的数据环境发生了剧变。2022年以前,网络内容尚以人类原创为主;此后,大量由AI生成的内容充斥网络,甚至出现了专门用于干扰模型训练的“数据投毒”工具。对于追求纯净、高质量语料库的AI公司而言,现代互联网无异于一片被污染的泥沼。
相比之下,2022年以前出版的纸质书成了难得的“上上品”。这些书籍经过作者写作、编辑筛选和出版社校对,代表了经过时间检验的人类智慧结晶,且几乎未被AI生成内容污染。更重要的是,许多冷门书、绝版书在互联网上根本没有电子版,成为了AI模型知识盲区中的“黑箱”。
AI公司的策略因此不断升级。早期,它们试图通过抓取公开网页来训练模型;随后,目光转向了盗版电子书资源库,如Books3、LibGen等。法庭文件显示,Anthropic曾从这些来源下载超过700万本书籍,并长期保留在“中央图书馆”中。然而,盗版来源面临着法律风险和伦理指控。当2024年三名作家起诉Anthropic未经授权使用其作品训练Claude模型时,AI公司急需一种既能获取高质量数据,又能规避法律风险的途径。
于是,“巴拿马计划”应运而生。这一计划的核心逻辑是:既然法律上“购买”并“合理使用”实体书可能构成抗辩理由,那么通过合法渠道获取书籍,扫描后销毁实体,只保留数字副本,似乎是一条可行的技术路径。这一策略的转变,标志着AI数据获取从“网络抓取”正式延伸至“实体掠夺”。
“巴拿马计划”与司法博弈:合理使用的灰色地带
2025年6月,法官威廉·阿尔萨普在Anthropic相关的诉讼中做出了一项极具争议性的判决。法官认为,大模型读取书籍是为了学习语言模式和知识结构,而非复述或出售原书,这种用途具有强烈的“转化性”,类似于人类阅读后获得知识再进行创作,因此属于“合理使用”范畴。
更关键的是,法官接受了Anthropic的一个法律论点:既然公司是通过合法购买获得实体书,且在扫描后销毁了纸质原件,只保留一份数字副本,这就没有增加市场上的流通数量,也没有直接替代原版书的销售。在这种逻辑下,销毁纸质书反而成了证明“未造成市场损害”的一环。如果保留原书,AI公司手中既有一份实体又有一份数字复制品,才可能构成侵权;而销毁实体,仅保留用于训练的数字文件,法律风险反而降低。
这一判例为AI公司开了一扇后门:只要确保数据来源的“合法性”(即付费购买),即便手段粗暴,也可能被司法系统宽容。然而,这一逻辑忽略了实体书作为文化遗产的独特属性。法官的关注点在于版权的经济价值,而非实体书的历史、物理和文化价值。
值得注意的是,尽管法官对“合法购买的纸质书扫描”表示宽容,但对那700万本来自盗版库的电子书并未放行。法官明确指出,训练模型的合理性不能反过来证明盗版获取行为的合法性。这一区分表明,AI公司急于洗白数据源的努力,正是导致其转向昂贵且隐秘的纸质书采购的根本动因。
绝版书的悲剧:被当作一次性耗材的文化资产
随着“巴拿马计划”细节的曝光,人们震惊地发现,AI公司不仅购买畅销书,更将触角伸向了旧书店、图书馆和绝版书目录。图书数据库公司ISBNdb曾公开宣称,可以协助AI公司采购1000至100万本纸质书,并承诺签署严格的保密协议,隐藏买家身份和采购书目。
这种大规模采购对实体书市场造成了剧烈冲击。一名专营稀有图书的书商透露,自今年4月起,其每周订单从20本猛增至数百本。被买走的书主题杂乱、语言各异,唯一的共同点是拥有ISBN编号。对于书商而言,这是一次清空库存的良机;但对于文化保护主义者而言,这是一次灾难。
绝版书不等于孤本,但每一本实体书都是独一无二的文物。澳大利亚和新西兰古旧书商协会主席Dawn Albinger指出,古旧书的价值不仅在于印刷的正文,更在于其物理形态所承载的历史痕迹:书页上的批注、作者的签名、历任收藏者的题赠,甚至重新装订的封皮里可能隐藏的手稿。这些信息依附于那一张具体的纸、那一本书的特定形态。当书页被切碎、送入高速扫描仪,再被回收制成纸浆时,这些不可复制的文化记忆便永远消失了。
AI公司得到了一份适合算法训练的纯净数字文件,却毁掉了一件无法通过数字文件完整还原的实物。这是一种典型的“效率优先”思维下的文化抹杀。在AI公司的报表中,书只是数据载体;在人类的眼中,书是历史的见证。这种认知的错位,正是当前AI伦理危机中最核心的矛盾。
舆论反弹与行业退让:有限的妥协
面对公众的愤怒和媒体的深挖,科技行业开始做出反应,但这种反应更多是出于声誉管理的考量,而非对伦理问题的根本反思。
马斯克在X平台上表态,要求SpaceX AI团队在扫描稀有书籍时采用无损方式,并保存在图书馆中。这一举动看似是对文化保护的重视,但其具体执行标准——何种书算“稀有”,何种方式算“无损”——并未明确。这更像是一种姿态性的站队,旨在与竞争对手Anthropic切割,塑造更负责任的形象。
相比之下,ISBNdb的退让更为迅速。在报道发布9天后,其删除了面向AI公司的采购页面,并改口称这只是一次“市场需求测试”,从未真正开展过业务。这种“公关急救”虽然暂时平息了舆论怒火,但也暴露了行业内部的尴尬:帮助AI公司大批量采购并销毁书籍,已成为一项企业不愿承担的声誉风险。
然而,口头承诺和删除网页无法解决根本问题。目前,市场上缺乏统一的标准来判断哪些书应当被保护,哪些可以被牺牲。AI公司是否应该公开采购书目?如果某本书已绝版,是否必须采用无损扫描并捐赠给图书馆?这些问题依然悬而未决。更具讽刺意味的是,AI公司之所以珍视2022年前的纸质书,正是因为它们代表了“未被AI污染的人类知识”。但当它们将这些书籍视为一次性耗材时,恰恰违背了尊重人类创造力的初衷。
结语:重构数字时代的数据伦理
“巴拿马计划”不仅是Anthropic的丑闻,更是整个AI行业的缩影。在追求模型性能的提升过程中,数据获取的伦理边界正在被不断试探和突破。法律上的“合理使用”不能成为践踏文化遗产的借口,技术上的“效率优化”也不能凌驾于人类对知识载体的尊重之上。
我们需要建立新的行业规范和法律框架,明确AI训练数据获取的底线。这包括要求AI公司公开数据来源,对珍稀文献采用无损数字化技术,建立文化保护补偿机制,以及重新审视“合理使用”原则在数字时代的适用范围。否则,随着AI对训练数据需求的无限增长,人类文明的历史记忆可能会在算法的贪婪中被逐步吞噬,最终只剩下冰冷的代码,而失去了承载它的血肉与灵魂。