近期,加拿大企业Zoombooks在德国、西班牙、澳大利亚和新西兰等地的二手书市场引发关注。其采购订单在固定时间批量涌入,目标为二十世纪七十年代后出版、带ISBN编号的非虚构类书籍,涵盖烹饪、游记等小众题材。这些书籍未进入常规零售渠道,而是被集中收购,外界推测可能用于大型语言模型训练。
尽管涉事公司否认相关指控,且无证据表明书籍将被销毁,但事件已触及欧洲书业的文化痛点。在德国等地,书商们更惋惜的是旧书作为物质载体的命运。传统书籍文化中,旧书的价值在于通过读者间的流转延续生命,而非单纯的商品属性。然而,AI的介入可能将书籍简化为数据资源,改变其文化意义。
这一现象背后,是人工智能面临的数据瓶颈。随着高质量公共文本增长趋缓,模型训练转向尚未数字化的纸质世界。Epoch AI的分析指出,公开网络中的高价值数据正接近上限,且新增内容多为同质化或AI生成,导致模型面临“崩溃”风险。因此,旧书成为新的数据来源。
对学术研究者而言,这提供了知识获取的新契机。大量沉睡于档案馆、特藏室的文献长期无法被检索,数字化若能将其纳入公共视野,将降低学术门槛。但大模型训练与公共数字化存在本质差异:前者旨在吸收语言模式,后者则保存完整作品。目前,进入训练流程的书籍大多不会重新回到公众手中,知识被数字化并未直接等同于公共化。
当AI重构知识体系时,文化生态的韧性面临考验。书籍作为历史物件的独特性、阅读中的在场感,是算法无法复制的。若仅以“训练价值”定义书籍,可能导致价值评判权转移至技术逻辑。在追求知识高效流通的同时,保留冷门书籍的存在空间,维持人类独立思考的能力,是应对数字时代文化变迁的关键。
暂无评论,快来抢沙发吧!