为了提升大模型的训练效率,人工智能巨头 Anthropic 竟然毁掉了上百万本实体书。

7月20日(当地时间),Anthropic与作家集体诉讼达成的15亿美元和解协议正式获得法院批准。这不仅是美国版权法历史上和解金额最高的案件,更将公众视线引向了Anthropic内部一项备受争议的“毁书计划”。比起这笔天价赔偿,其背后的操作细节更令人咋舌。

法院披露的文件揭示,Anthropic在2024年初启动了代号为“巴拿马计划”的项目。该公司斥资数千万美元,从二手书商手中大量收购实体书,随后采用一种名为“破坏性扫描”的方式处理这些书籍。具体操作是用工业设备切开书脊,逐页扫描内容并录入数据库,最后将纸张销毁丢弃。据估计,已有200万册实体书因此走向终结。

这一极端行为的背后,是AI公司对高质量训练数据的疯狂渴求。相较于互联网上充斥着低质甚至由AI生成的内容,经过作者创作、编辑审核及出版流程层层筛选的书籍,无疑是训练大型语言模型的理想素材库。而在非破坏性扫描之外,破坏性扫描能显著提高效率并降低成本。

尽管法院认定Anthropic通过合法渠道购书用于大模型训练属于“合理使用”,但这种对实体书的毁坏仍激起千层浪。

作家的集体诉讼,牵出Anthropic的“毁书计划”

“巴拿马计划”之所以曝光,源于一场由作家发起的集体诉讼。

2023年,美国恐怖小说作家安德莉亚·巴茨(Andrea Bartz)意外发现自己的作品出现在一个被Anthropic等AI公司广泛使用的训练文本库中。

不甘心血成果被AI公司“盗用”以构建其价值数十亿美元的生意,巴茨于2024年8月联合其他作家,在美国作家协会的支持下,向Anthropic提起集体诉讼。

随着司法调查深入,Anthropic的数据获取手段逐渐浮出水面。事实上,如今饱受诟病的“破坏性扫描”,已是Anthropic在法律压力下采取的一种成本更高的数据获取策略。

法院文件显示,为获取高质量训练数据,Anthropic最初曾通过收集盗版电子书来建立数据库。

法官在去年6月裁定,该公司将超过700万本盗版书籍保存至“中央数据库”,此举侵犯了作家权利。但同时认定,Anthropic使用合法渠道购买书籍训练模型,构成对作家作品的“合理使用”。

换言之,破坏性扫描本身不违法,违法的是盗版行为。

今年7月,Anthropic与一批作者达成总额高达15亿美元的和解协议。根据协议,每本符合条件的书籍版权所有者平均可获得约3000美元赔偿。这场历时两年的版权纠纷暂告一段落。

“破坏性扫描”,争议不只限于法律

尽管AI模型训练被视为对书籍的“合理使用”并获法院支持,但“破坏性扫描”引发的争议已超越法律范畴。

人们最担忧的是珍贵书籍可能在此过程中遭受不可逆的破坏。虽无确凿证据表明Anthropic的项目已销毁具有特殊价值的珍稀书籍,但当涉及数百万册图书时,公众难免担心一些珍贵的历史古籍和绝版书已进入AI训练供应链。

对AI公司而言,书籍的价值仅在于其中的文字数据。扫描过程中,它们未必会区分珍贵孤本与普通书籍。但对书商、收藏家、档案学者及历史研究者来说,实体书本身即是文化的一部分,其纸张、装帧、批注及流传痕迹承载着无法被数字化替代的历史价值。

当然,也有观点支持AI公司大量扫描书籍。他们认为,与其让冷门旧书长期沉睡在世界角落,不如让它们通过人工智能系统,重新融入人类知识库。

问题在于,AI公司的书籍数字化与公共机构推动的文化保存存在本质区别。扫描后的数据进入的是AI公司内部数据库,而非面向公众的公共图书馆。

Anthropic对实体书籍的物理销毁,更给人一种“斩草除根”的感觉。这进一步加剧了人们对知识垄断的担忧,AI公司似乎正将人类共有的知识遗产私有化为独家内部数据。

Anthropic的行为引发广泛关注,或许还因“毁书”行为所具的象征意义及其带给公众的强烈负面观感。

在人类历史中,书籍长期被视为知识、记忆与文明传承的重要载体。保存书籍、传递思想与知识,某种程度上就是在延续文明。而历史上的大规模毁书事件,无论是秦始皇时期的焚书,还是纳粹德国时期的焚书运动,往往都与权力控制、思想压制紧密相连。

因此,当大量实体书被切割、扫描并最终丢弃时,极易引发负面联想——Anthropic是否正在将原本属于全人类的文化遗产,转化为自身掌控的资源?

“毁掉书籍、投喂AI”这一极具象征意味的画面,可能恰好与当下蔓延的AI恐慌产生共振。当一本本承载着人类文明的书籍被切割、扫描,并成为训练AI的“燃料”时,人们担心的或许不仅是某些书籍被销毁,而是人类自己创造的机器最终会反噬自身。

撰文 | 李俊浩

编辑 | 北塱 钱琪瑶