数百万本书被“阅后即焚”:AI数据饥渴背后的伦理黑洞

0 阅读

从数字贪婪到物理毁灭:AI数据获取的极端演化

在人工智能技术狂飙突进的今天,模型对训练数据的需求已呈现出一种近乎病态的贪婪。早期,科技巨头们将目光锁定在互联网上那些免费、公开且未经筛选的网页内容上。然而,随着生成式AI的普及,互联网充斥着大量AI生成的噪音、重复内容以及经过“数据投毒”处理的恶意样本。为了追求更高质量、更纯净、更由人类原创的知识燃料,AI公司的触角开始向更深、更隐秘的领域延伸——现实世界中的纸质书籍。

这一转变并非毫无预兆,但随着Anthropic公司“巴拿马计划”的细节逐渐曝光,公众才惊觉这场数据获取运动已经跨越了伦理与法律的灰色地带,演变为一种针对人类文化遗产的“工业化拆解”。为了让Claude等大模型读懂人类的历史与思想,Anthropic选择了一种极为粗暴的方式:购买、扫描、然后销毁。这种“阅后即焚”的模式,虽然在法律逻辑上试图构建一种“格式转换”的合理性,但在文化情感上,却是对书籍作为物理实体的彻底否定。

“巴拿马计划”:合法外衣下的破坏性扫描

回溯这场争议的起点,2024年8月,三名作家将Anthropic告上法庭,指控其未经授权利用他们的作品训练Claude模型。这场官司的核心最初聚焦于“合理使用”原则的边界:AI读取书籍是为了学习语言模式和知识逻辑,而非直接复述或出售原书,这与人类阅读后获得启发并无二致。2025年6月,法官威廉·阿尔萨普的判例在某种程度上支持了Anthropic的观点,认为这种具有高度“转化性”的使用属于合理使用范畴。

然而,判决中一个关键的区别在于数据获取的合法性。法官明确指出,虽然训练模型本身可能合法,但通过盗版资源库(如Books3、LibGen等)获取700多万本电子书的行为并不受此保护。为了规避法律风险,Anthropic启动了代号为“巴拿马计划”的内部工程。据《华盛顿邮报》报道,Anthropic在一年内花费数千万美元,购买了数百万本纸质书。

其操作流程极具争议性:供应商使用液压切纸机削去书脊,将散落的书页送入高速扫描仪,生成高清数字图像后,剩余的纸质残骸被直接送入碎纸机或回收管道。Anthropic内部文件坦言,这是“对全世界所有书籍进行破坏性扫描的行动”,且明确要求“不希望外界知道”。这种秘密进行、大规模物理销毁书籍的做法,与其一贯倡导的AI安全、道德和责任形象形成了尖锐反差。

稀缺资源的枯竭:为何是2022年以前的书?

值得注意的是,AI公司为何如此偏爱2022年以前出版的纸质书?这背后反映的是数据质量在AI时代的重新定义。随着生成式AI的爆发,网络空间被海量的AI生成内容淹没。对于训练下一代更强大的模型而言,这些充斥着算法痕迹的数据不仅价值降低,甚至可能产生误导。

相比之下,2022年以前出版的纸质书,尤其是那些经过传统编辑、校对和出版流程的作品,被视为“纯净”的人类知识样本。它们未被现代数据投毒工具污染,逻辑严密,语言规范。因此,这些书籍成为了AI模型提升理解力与创作力的“上上品”。

这种需求迅速传导至二手书市场。一名专营稀有图书的书商透露,自2025年4月起,他每周处理的订单从20本激增到数百本。买家购买的目标杂乱无章,语言各异,但共同点是拥有ISBN编号。这种看似繁荣的交易背后,隐藏着巨大的文化危机。书商虽因清库存而感到些许欣慰,但面对心爱的书籍最终沦为纸浆的命运,这种喜悦很快被沉重所取代。

物理形态的消亡:绝版书面临的生存危机

“巴拿马计划”最令人担忧的后果,并非仅仅在于法律层面的版权争议,而在于对书籍物理形态的不可逆破坏。法官的判例逻辑建立在“数字副本替代纸质实体”的基础上,认为只要不增加市场流通量,销毁原件即可规避侵权。然而,这种逻辑忽略了书籍作为文物和历史载体的多重价值。

对于一本印量巨大的畅销书而言,少一册确实无伤大雅。但对于冷门书、绝版书以及具有特殊历史痕迹的版本,情况则截然不同。澳大利亚和新西兰古旧书商协会主席Dawn Albinger指出,古旧书的价值不仅在于其文本内容,更在于其物理属性:书页上的批注、作者的签名、前收藏者的题赠、特殊的装帧工艺,甚至纸张的老化程度,都是研究文学史、出版史和社会文化的重要证据。

一旦书脊被切断,书页被扫描后销毁,这些依附于具体物理实体的信息便永久消失。AI获得了一份完美的数字文本文件,但人类却失去了一件无法通过数字文件还原的历史文物。这种“得此失彼”的交易,本质上是用不可再生的文化资源换取了算法的可扩展性。

行业的有限退让与未解的法律难题

舆论的强烈反弹迫使科技行业做出了一定程度的姿态性回应。马斯克在X平台上表示,要求SpaceX AI团队对稀有书籍采取无损扫描方式,并建议保存至图书馆。ISBNdb也迅速删除了面向AI公司的纸质书采购宣传页面,辩称相关服务仅为“市场需求测试”,从未真正上线。

然而,这些举动更多是危机公关手段,而非系统性解决方案。目前,行业仍面临诸多未解的法律与伦理难题:

第一,如何界定“稀有”与“普通”?判断标准是出版年份、存世数量,还是书籍本身的文化价值?

第二,透明度缺失。AI公司并未公开其大规模采购的书目,外界无法追踪哪些珍贵的文化典籍正在被系统性清除。

第三,替代方案缺失。如果某本书已绝版,是否必须采用无损扫描并在扫描后捐赠给公共图书馆?目前尚无统一规则约束。

讽刺的是,ISBNdb曾强调2022年以前纸质书的珍贵在于其“未被AI污染”。AI公司越是承认这些内容的人类价值,就越难解释为何承载这些价值的实体载体可以被视为一次性耗材。这种逻辑上的自相矛盾,揭示了当前AI发展模式中深层的人文缺失。

结语:在算法效率与文化守护之间寻找平衡

Anthropic的“巴拿马计划”是一个缩影,它暴露了AI产业在追求技术奇点的过程中,对传统知识保护体系的忽视。当书籍从承载思想的圣殿变为训练数据的矿藏,我们需要重新审视人与技术、过去与未来的关系。

法律判例或许能为AI公司提供暂时的庇护,但无法消解文化界对知识载体消亡的深层焦虑。真正的解决方案,不应止步于个案的妥协或法律的博弈,而应建立一套兼顾技术创新与文化保护的规范体系。这要求AI公司从“掠夺式”的数据获取转向“合作式”的知识共建,尊重书籍的物理价值,支持无损数字化与公共保存机制。

否则,我们可能在获得一个无所不知的数字大脑的同时,却让承载人类记忆的物理世界变得日益贫瘠。这不仅是文学界的损失,更是整个人类文明的遗憾。