亚马逊为训练新AI模型,将稀有书籍切掉书脊

23 八月 202616 视图

404 Media的记者调查显示:亚马逊大量采购稀有书籍,拆掉装订并数字化页面,以获取独特数据来训练语言模型。该公司确认此类采购旨在改进客户服务,而旧版书籍的价值在于其“人类”来源,可降低模型退化的风险。

亚马逊为训练新AI模型,将稀有书籍切掉书脊

亚马逊历史上一个安静的转折点

曾经将命运与纸书捆绑在一起的公司现在视之为消耗性资源. 根据404媒体的调查,亚马逊批量购买稀有版本,断绝装订,并通过扫描仪发送页面. 方法粗糙,但很有效:这样,页可以不停车地输入设备中——并且对将书保存为物品没有任何遗憾.

对亚马逊来说,这不是破坏行为,而是技术管道的一部分:需要文本来训练新的AI模型. 在回应记者询问时,该公司确认其"通过商业渠道购买图书以改善客户使用的产品和服务". 换句话说,稀有的叶子成为原料——几乎像炼钢厂的矿石.

记者如何追踪目的地

证据不是通过传闻收集的,而是通过追踪具体副本收集的。 404 Media将追踪装置藏在珍稀的书中,并监视其路线. 包裹最终以代号为VGT3的代号在拉斯维加斯的亚马逊设施中落成——值得注意的是,这家仓库的标志是一只恐龙在爪子里将一本书离合.

这种狩猎没有什么复杂之处:亚马逊长期以来一直是旧书经销商最大的市场,所以所需要的版本可以字面上由吨买到. 当批发买方同时取走数十本旧书时,卖方不可能怀疑有什么差错——这似乎是图书馆订单,而不是碎纸机订单。

为什么老书对神经网络有价值

它不是关于地块或印刷美。 稀有版本的主要资产是"干净"的人文文本. 2022年以前发表的任何实物都不可能由语言模型书写:在当时,基因神经网络还没有提供给普通大众. 但现代互联网有相当一部分已经通过算法创建了, 在它上培训一个新的模型意味着传递他们的错误和公式模式。

这里就是... 模型崩溃 开始游戏。 如果一个大赦国际从另一个大赦国际生成的文本中学习,那么它的反应质量就逐渐恶化。 语言变得平坦而单调,罕见的短语转折消失,精度下降. 旧书是活人言论的自然"保留地",算法还没有达到. 越是模糊, 其培训价值越高: 文本没有在网络或之前的数据集中曝光。

具有讽刺意味的是,亚马逊为旧书建造了一个巨大的市场,现在为了隐形模型而把它们作为实物破坏. 对于收藏家来说,这是一个警告标志:稀有版本的购买者可能不感兴趣于其内容,而只感兴趣其适合扫描仪. 但从商业的角度来看,逻辑是铁的——只要需要高质量的AI,就会有剪刀的需求.

常问问题

Amazon Cuts Book Roots for AI: 404 媒体调查