50吨日本旧书运往美国!大模型数据告急,硅谷去旧书店找“新粮”

最近日本二手书市场出现了一桩离奇事。

大批散客账号在多地疯狂扫荡纸质旧书,从地方志到法学医籍,只要带字全部买走。

有古书店一天就能卖出上百本,单店成交量迅速破千。

更反常的是,海量包裹最终全部汇入同一个跨境物流转运站,直接发往美国。

数据显示,从去年至今已有超过50吨日本旧书被运往美国。

按每本500克估算,相当于整整10万册纸质书被买断出境。

买家绝非为了文化收藏,而是硅谷顶尖科技巨头在为AI大模型争抢最原始的“训练饲料”。

撞上数据墙的危机

估值数万亿美元的科技巨头为何去旧货摊收破烂?根本原因在于,互联网公开数据已被彻底吃秃。

过去几年,大模型以野蛮姿态吞噬了全球公网内容。

从社交媒体的骂战、网络论坛的段子,到营销号的口水文,几乎被扫荡殆尽。

然而,当算法模型的参数规模呈指数级膨胀时,人类数十年沉淀在互联网上的优质公开文本,却已经见了底。

这便是AI业界闻之色变的“数据墙”。

一旦撞墙,大模型就无法获取高质量增量信息。

更致命的是,如今的互联网上早已充斥着大量AI自身生成的合成垃圾。

如果继续让模型投喂这些衍生文本,必然会导致近亲繁殖式的智力衰退,让算法一代比一代迟钝愚笨。

面对这一死局,那些沉睡在旧书店深处、几十年从未被数字化的泛黄纸张,瞬间成了科技巨头眼里纯净且高蛋白的顶级矿藏。

跨国扫荡拆书炼丹

为了将物理文明快速转化为机器养料,硅谷早已摸索出一套高效粗暴的流水线。

此前人工智能独角兽Anthropic就被曝出类似操作:成吨购入实体书,用专业工业机械齐刷刷切掉书脊,推入高速工业扫描仪,几天之内便将数百年的人类文字积累转化为高纯度训练数据集。

硅谷巨头之所以将目光精准锁定日本旧书,背后的商业逻辑极其务实。

日本近代出版物纸质考究、排版规整,光学字符识别率极高。

更重要的是,昭和时代的法学著作与地方典籍中,蕴含着严密且未经互联网污染的思维逻辑和历史细节。

当对手的AI还在用网络热梗打嘴仗时,吃透这50吨旧书的模型,已在底层拉开认知代差。

人类耗费数百年试图用纸张抵御岁月侵蚀,却未曾料到,文明最后的归宿竟然是被机器作为算力燃料整本吞噬。

在数据荒漠化的下半场,谁能搜刮更多物理实体文本,谁就掌握了定义下一代智能的绝对底牌。

或许当下最安全的知识避难所,正是书房里那些沾满灰尘的旧书,只要它们还没被扫进数据库,人类便守住了最后一份知识独占权。

展开阅读全文

更新时间:2026-10-04

标签:科技   硅谷   日本   美国   旧书   模型   书店   数据   巨头   纸质   人类   文本

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号

Top