AI公司被曝疯狂收购大量旧书!扫描完成直接销毁,其目的让人深思
旧书市场最近出现了一批“奇怪买家”:几千册、上万册地收书,不太挑品相,也很少砍价,连冷门教材、地方志和早已绝版的专业书都照单全收。卖家原以为是图书馆补库存,或者有书商准备囤货,后来才发现,真正出钱的竟是海外人工智能企业。
更让人不解的是,这些书并不会重新流入市场。它们被统一运到加工场,机器切开书脊,拆散书页,再送进高速扫描设备。文字转成电子数据后,原书直接粉碎,连一次二次流通的机会都没有。
这听起来像电影情节,但海外媒体报道和法院公开卷宗都显示,这套“买书、扫书、毁书”的流程确实存在。AI公司为什么不直接抓取网上内容,反而花大价钱收购纸质旧书?答案,和人工智能行业眼下最头疼的数据问题有关。
生成式AI在2022年后迅速普及,网上的文章、问答、商品介绍和科普内容越来越多,其中相当一部分由AI生成,甚至是AI反复改写出来的。表面上看,网络信息变得极其丰富;实际情况却是,大量内容同质化严重,事实错误、逻辑混乱、语言空洞的问题随处可见。
如果模型继续把这些“机器写给机器看”的内容当作训练材料,结果可能不是越来越聪明,而是越来越像一台只会重复套话的机器。业内把这种风险称为“模型崩溃”:模型吸收过多低质、重复甚至错误的数据后,输出质量逐步下降,推理能力也可能受到影响。
于是,AI企业开始寻找相对“干净”的人类原创内容。2022年以前出版的纸质书,经过作者写作、编辑加工和校对审核,通常比网络碎片化内容更完整,也更少受到生成式AI的污染。对急于扩大训练数据规模的科技公司来说,这些旧书就成了现成的高质量素材库。
被披露得比较多的案例,是开发Claude大模型的Anthropic公司。根据解封的版权诉讼文件,该公司曾推动一个代号为“巴拿马计划”的项目,投入数千万美元,从全球二手书市场采购数百万册纸质图书。
书送到工厂后,处理方式相当直接:切开、扫描、识别、存储,最后销毁。书页上的文字被提取成训练数据,纸张则变成废料。原本承载知识的书,在这条流水线上被拆成一堆可供算法调用的字符。
为什么连原书也要销毁?这里牵涉美国版权诉讼中的“合理使用”争议。相关判决曾关注这样一种情形:企业合法买下纸质书,只在内部使用,扫描后销毁原件,是否能够构成合理使用;如果扫描后还继续保留原书,或者把电子版本对外传播,侵权风险就会明显上升。
对AI公司来说,销毁原件不只是节省仓储成本,也可能被当成规避版权风险的一道防线。它们试图证明,自己只是购买实体书用于内部训练,并没有继续发行电子书。问题在于,这种做法究竟是在保护创作权益,还是利用法律边界为商业扩张开方便之门,仍然充满争议。
更麻烦的是,这已经不再是几家公司临时起意的行为。市场上出现了专门撮合AI企业和二手书商的中间服务商,有机构宣称可以一次承接最高百万册的采购订单,并对买家身份严格保密,还会优先寻找几十年前出版的文史资料、专业教材和绝版著作。
二手书商看到订单暴涨,却未必知道书最终去了哪里。一些存世量本来就很少的冷门书,可能在短时间内被整批买走。对卖家来说,这是一笔生意;对文化保存来说,却可能意味着某类实体文献从市场上永久消失。
因此,很多读者把它称为“数字时代的新式焚书”。这个说法虽然刺耳,却戳中了争议核心:书的价值不只在于里面的文字。
一本旧地方志的纸张、版式、印章和装订方式,可能记录着一个时代的出版状况;书页上的批注、折痕和藏书章,也可能保存着读者与历史的交集。扫描文字可以复制内容,却很难完整还原一本书的物质信息。原版一旦被毁,消失的就不只是纸张,还有它所携带的时代痕迹。
另一个隐患,是知识被少数公司封闭占有。书籍经过扫描后形成的海量数据,通常存放在企业自己的服务器里,服务于自家模型和商业产品。普通人既看不到完整内容,也无法自由利用。人类积累几十年、上百年的知识,经过数字化处理后,可能从公共文化资源变成科技公司的私有资产。
这和图书馆、博物馆保存古籍的数字化,不能混为一谈。公共机构扫描旧书,是为了防止损毁、方便研究和扩大公众 access;AI企业扫描旧书,主要目的是训练商业模型,原件还可能被直接销毁。
目前,这种大规模采购并破坏性扫描旧书的模式,主要出现在海外AI行业。国内如果要使用图书内容训练模型,仍然要面对著作权人、出版社授权以及相关法律责任,海外这种流程很难照搬。但这件事带来的提醒并不只属于国外。
技术可以让知识传播得更快,却不能把文化保存变成一次性消耗。AI要训练得更强,不能靠把人类留下的书先变成数据、再变成垃圾;真正先进的技术,应该让知识更开放,也让原本的记忆继续存在
信息来源:2026-07-29 13:24·竹下抚茶人-AI公司被曝疯狂收购大量旧书!扫描完成直接销毁,其目的让人深思
