AI批量收购旧书:知识数字化背后的文化隐忧

图片只作辅助表达,并非真实画面,由 AI 生成
资讯来源:互联网公开资料整合

近期,加拿大企业Zoombooks在德国、西班牙、澳大利亚和新西兰等地的二手书市场引发关注。其采购订单在固定时间批量涌入,目标为二十世纪七十年代后出版、带ISBN编号的非虚构类书籍,涵盖烹饪、游记等小众题材。这些书籍未进入常规零售渠道,而是被集中收购,外界推测可能用于大型语言模型训练。

尽管涉事公司否认相关指控,且无证据表明书籍将被销毁,但事件已触及欧洲书业的文化痛点。在德国等地,书商们更惋惜的是旧书作为物质载体的命运。传统书籍文化中,旧书的价值在于通过读者间的流转延续生命,而非单纯的商品属性。然而,AI的介入可能将书籍简化为数据资源,改变其文化意义。

这一现象背后,是人工智能面临的数据瓶颈。随着高质量公共文本增长趋缓,模型训练转向尚未数字化的纸质世界。Epoch AI的分析指出,公开网络中的高价值数据正接近上限,且新增内容多为同质化或AI生成,导致模型面临“崩溃”风险。因此,旧书成为新的数据来源。

对学术研究者而言,这提供了知识获取的新契机。大量沉睡于档案馆、特藏室的文献长期无法被检索,数字化若能将其纳入公共视野,将降低学术门槛。但大模型训练与公共数字化存在本质差异:前者旨在吸收语言模式,后者则保存完整作品。目前,进入训练流程的书籍大多不会重新回到公众手中,知识被数字化并未直接等同于公共化。

当AI重构知识体系时,文化生态的韧性面临考验。书籍作为历史物件的独特性、阅读中的在场感,是算法无法复制的。若仅以“训练价值”定义书籍,可能导致价值评判权转移至技术逻辑。在追求知识高效流通的同时,保留冷门书籍的存在空间,维持人类独立思考的能力,是应对数字时代文化变迁的关键。

浏览 12299 · 资讯ID: 21885

返回首页

相关问题

Zoombooks公司收购旧书的主要特征是什么?
该公司在多地批量收购二十世纪七十年代后出版的非虚构类旧书,订单规律且集中,疑似用于AI训练。
为什么AI开始转向纸质书籍作为数据来源?
因为互联网高质量文本增长趋缓,且AI生成内容导致模型崩溃风险,迫使开发者寻找未数字化的纸质文献。
大模型训练与公共数字化有何区别?
前者旨在吸收语言模式以优化算法,后者则保存完整作品供人阅读,且训练书籍通常不会重新回到公众手中。

评论 (0)

暂无评论,快来抢沙发吧!