大型语言模型总算显露出最本真的利齿:这些 AI 正式开始啃书本了。近期日本旧书圈曝出一桩令人毛骨悚然的离奇怪事:大量不明身份的买主正在日本各地地毯式搜罗旧书。上至史学与哲学、医药与法学,下至边陲地带的地方史志,就连数十年前的政论小册子,但凡印有文字的,基本照单全收。
这事从今年八月开始不对劲。日本各地线上旧书店陆续接到大批量订单,东京有店主说一天能卖出去一百册,单日销售额直接翻了五倍。
关东一位干了几十年的旧书商已经出了上千册,他翻订单记录发现下单时间间隔特别规律,明摆着是有人写了程序在自动扫货。
更怪的是书单,平时走量的小说漫画一本没买,反倒是哲学、历史、医学、法律这些压箱底的专业书被一锅端,连 "江户时代生活文化"" 三十年前政坛轶事 " 这种没人看的冷门书都在清单上。
店主自己都懵了,说干这行半辈子,从没见过这种买法。
所有订单的收货地址都指向同一个地方 —— 冈山县的一处物流中心。
买家分散在各个平台用不同账号下单,看起来像是散户,实际上书全往一个仓库里集中。
运营这个物流中心的日本企业面对采访只回了一句 "不便对单笔交易作出答复",既不承认也不否认。
西日本还有一家旧书店直接收到海外企业的邮件,问能不能一次性订购数万册图书。
日本电视台顺着进出口数据往下查,查到了更吓人的东西。
日本一家大型图书批发商的集团子公司,从去年开始往美国出口了合计五十吨以上标注为 "日本书籍" 的货物。按厚重精装书单本五百克来算,这大概是十万册书。
十万册什么概念?一家中型图书馆的藏书量。这些书到了美国之后干了什么。
AI 公司 Anthropic 此前在美国卷入版权诉讼,法庭文件曝光了一个代号 "巴拿马计划" 的内部项目:批量购入全球二手书,用液压机切掉书脊,送进高速扫描仪,每分钟处理八十到一百二十页,扫完之后原书直接粉碎打成纸浆。
项目预算几千万美元,半年内计划处理五十万到两百万册。内部要求写得很直白 —— 尽可能降低外部关注度。
美国媒体 404 Media 还报道过,亚马逊也有类似操作,把纸质书集中运到仓库,裁开扫描之后直接销毁,其中同样包含日本书籍。
为什么好好的互联网不爬,非要去啃纸?答案说出来有点黑色幽默。
大模型这几年把互联网祸害得差不多了,网上到处都是 AI 自己生成的内容,新爬下来的数据里混着大量机器写的东西,拿这些东西再去训练新模型,就会出现一个叫 "模型坍塌" 的问题 —— 一代比一代平庸,错误越攒越多,最后连原来能表达的东西都表达不出来了。
2024 年《自然》杂志上发表过一篇论文,在实验条件下证实了这个现象。所以 2022 年之前出版的纸质书突然成了香饽饽,因为那时候生成式 AI 还没普及,纸上印的字 guaranteed 是人写的,干净,没被污染过。
法律这边也给开了绿灯。2025 年 6 月,美国法院在 Bartz 诉 Anthropic 一案中裁定,合法购买一本书、把它转成数字副本、用来训练模型,属于合理使用。判决下来之后,扫书的规模明显加速。
日本这边的著作权法也规定,将作品用于 AI 学习原则上合法,只有在不合理损害著作权人利益时才构成例外 —— 而这个 "不合理" 怎么界定,目前还在吵。
说到底,这事儿的本质不是什么技术进步的浪漫叙事,就是一场赤裸裸的资源掠夺。
硅谷的公司把互联网搅浑了,然后回过头来花钱买干净的纸,扫完就碎,连个全尸都不给你留。
日本因为孤悬海外、战乱少,保存了大量东亚地区的珍贵古籍和绝版文献,世界上最古老的纸本《论语》就在日本,这些东西本来是人类共同的文化遗产,现在被按吨称、按斤卖,变成大模型参数里的几个数字。
更讽刺的是,卖书的旧书店主还在为销售额上涨高兴,等反应过来的时候,架子上已经空了。
对中国来说,这面镜子照得人心里发毛。咱们的古籍存量、地方志、民国文献、各地方的小众出版物,数量比日本只多不少。
现在数据出境的监管主要盯着个人信息和重要数据,中文书籍的文本算不算、怎么管,没有明确说法。
中间商收书、扫描、转交境外 AI 公司这条灰色链路,技术上没有任何门槛。今天日本发生的事,明天就可能在国内重演。
大模型吃纸这事,最该警惕的不是技术本身,而是谁在定义 "干净数据" 的归属权。
你写的书、你祖上印的地方志,被人买走扫进数据库,将来别人用 AI 生成内容赚得盆满钵满,你连个署名都没有。
这跟当年殖民者跑到殖民地抢文物有什么区别?只不过这次抢的不是瓶子罐子,是字。
纸是碎了,但字被吸走了,吸进了别人的模型里,变成了别人的资产。这事搁谁身上,都不该觉得正常。
