万益资讯网

AI 巨头们为了抢干净的训练数据,开始疯抢古董孤本书了!   因为2022年前的

AI 巨头们为了抢干净的训练数据,开始疯抢古董孤本书了!
 
因为2022年前的老书没有AI垃圾污染,AI公司通过第三方匿名买断,切掉书脊、高速扫描后直接粉碎销毁!连18世纪存世极少的植物学孤本都被绞碎了!

事情的主角之一,是开发Claude的人工智能公司Anthropic。
 
这家公司在2024年启动了一个内部项目,代号“巴拿马计划”。后来公开的文件显示,这个项目的目标非常直接,就是尽可能大规模地破坏性扫描图书,而且不希望外界知道。
 
一份承包方案甚至提出,要在半年内处理50万到200万册书。
 
这不是拿手机一页页拍照,而是一条工业流水线。液压设备负责切掉装订部分,高速扫描仪负责读取书页,剩下的纸张统一交给回收公司。

效率很高,代价也很直白,一本书进去,一份数据出来,原书从此消失。
 
AI公司为什么突然盯上旧书?
 
原因有点讽刺。互联网原本是训练人工智能最大的文本矿场,可生成式AI普及以后,网上越来越多文章、评论、商品介绍,甚至学术摘要,已经带有机器生成的痕迹。
 
模型继续抓取这些内容,就像拿自己排出的废气重新灌回发动机。数据看起来很多,真正由人写作、编辑和校订的内容却越来越难分辨。
 
2022年以前出版的实体书,因此成了一片相对干净的矿区。那时候,大规模生成式AI还没有涌入出版市场。

一本经过编辑、校对和正式出版的书,不一定观点正确,却通常有完整结构,也不会是聊天机器人东拼西凑出来的段落。
 
更重要的是,旧书里藏着大量互联网上找不到的细节。
 
地方史、早期植物分类、冷门工程手册、绝版行业年鉴、小语种文学,这些内容可能没有电子版,也不会出现在热门网页里。

对普通读者来说,它们很偏;对急着提升模型能力的公司来说,这恰恰是别人没有的数据。
 
于是,曾经服务书店和图书馆的图书数据库公司,也开始做起大宗采购生意。有平台宣称可以按照书号和年代,一次寻找数千到上百万册图书,还能替最终买家保密。
 
这就很反常了。
 
真正的藏书人会问版本、装帧、批注和保存情况。训练数据采购方在意的却只有一件事:机器能不能把字读出来。普通重印本和稀少初版本,在采购表格里可能只是两个编号。
 
我认为,问题并不在于每一本旧书都必须供起来。
 
图书馆每年会淘汰破损书,二手书市场也会处理大量卖不出去的重复版本。一本印了几十万册的普通教材,被切开扫描,未必是什么文化灾难。

把所有破坏性扫描都叫作“焚书”,反而容易把真正的风险说轻了。
 
真正危险的是采购过程不透明,而且缺少一道筛选程序。
 
如果一本书还有几万册,销毁一册影响有限。

可如果它是带有作者批注的特殊版本,是地方小印厂留下的少量样书,或者是存世数量已经很少的早期科学著作,那么书页上的纸张、颜料、水印和装订方式,本身就是信息。
 
扫描只能留下文字和图片,留不住纸张年代,也留不住修补痕迹。模型读懂了书里的句子,研究者却可能永远失去那件实物。
 
法律又让这件事变得更微妙。美国法院曾认为,把合法购买的纸质书一对一转成内部数字副本,并用于检索和训练,在相关案件中可以构成合理使用。

但从盗版资料库批量下载图书,则是另一回事。
 
也就是说,买下书再切碎,法律风险可能比直接下载盗版更低。
 
这就出现了一个荒诞场面:为了让人工智能合法地“读书”,最稳妥的办法之一,竟然是先把真正的书毁掉。
 
在我看来,AI公司并非不能使用旧书,关键是不能把文化保存责任甩给切割机。大批采购之前,至少应该检查版本稀缺程度。

普通复本可以破坏性扫描,珍本和绝版书应采用无损设备。扫描完成后,也可以把原书转交图书馆,而不是统一回收。
 
更进一步说,如果企业靠这些书训练出商业模型,那么对于已经进入公共领域的稀缺文献,数字副本也应适当向研究机构开放。

不能原书变成纸浆,扫描件又锁进公司的服务器,最后全世界只能花钱向聊天机器人提问。
 
人工智能确实需要好数据,但好数据不是凭空长出来的。它来自作者几年甚至几十年的积累,也来自编辑、印刷工人和一代代藏书人的保存。
 
最让人不舒服的,不是机器终于开始读古书,而是它读完以后,可能把书架也一起吃掉了。