page contents
跨境关条
Ctrl + D 收藏本站
当前位置:首页 » AI学习圈 » AI通识

AI公司开始抢旧书:2022年前的人类文字为何突然升值

mogoec 2026-08-01 12

AI公司为何抢购2022年前的旧书:机器越会写,人类数据越值钱

当人工智能能够在几秒钟内生成一篇文章时,最稀缺的东西可能不再是文字,而是能够证明“这些文字来自真实人类”的数据。

2026年7月,科技媒体404 Media报道,图书数据库公司ISBNdb曾在官网发布一组面向AI企业的营销页面,宣传批量采购实体书的服务。相关页面称,客户可以一次采购1000本至100万本图书,并把2022年以前出版的纸质书描述为不受生成式AI内容污染的训练材料。页面上的一句广告语很直接:“世界上最好的AI训练数据,正躺在书架上。”

不过,这件事随后出现了重要更新。

在报道引发争议后,ISBNdb删除了相关页面,并于2026年7月30日声明,公司从未实际购买、扫描或出售用于AI训练的实体书,那些页面只是一次“市场需求测试”,相关服务并未真正上线。也就是说,现有证据能够确认的是:ISBNdb公开探索过这门生意,而不能确认它已经为AI公司执行了大规模旧书采购订单。

但这并不意味着“AI公司买旧书”只是一个营销噱头。

法院文件已经证实,至少有一家头部AI公司曾经以工业化方式购买、拆解和扫描数百万本实体书。这家公司就是Claude背后的Anthropic。

而旧书突然成为AI行业争夺的资源,背后反映的是一个更深层的变化:内容正在变得无限廉价,可信的人类原始数据却在变得越来越昂贵。


一、为什么偏偏是“2022年以前”的书?

2022年11月30日,OpenAI正式发布ChatGPT。此后,生成式AI从实验室技术迅速进入写作、营销、搜索、客服、电商、教育和软件开发等领域。

因此,2022年经常被数据行业当成一个粗略的时间分界线:

  • 2022年以前的大部分出版物,基本可以排除由ChatGPT等现代大语言模型批量生成的可能;
  • 2022年以后出现的网页、商品描述、营销文章和自媒体内容,则越来越难判断是人写的、AI写的,还是人机共同完成的。

但需要强调,2022年并不是一个严格的科学边界

自动生成内容、机器翻译、模板文章和搜索引擎垃圾页面在ChatGPT出现之前就已经存在;同样,2022年以后出版的书也不等于由AI生成。对数据采购者来说,“2022年前”更像是一个容易执行的商业筛选条件,而不是绝对可靠的质量证明。

旧书真正重要的地方,不仅是它们“大概率由人类创作”,还包括三个更关键的属性。

第一,内容有明确的时间锚点

一本印刷于1995年的书,其文字最晚在1995年已经固定下来。后续模型无法悄悄改写它,也无法通过网站更新覆盖原始版本。

纸质出版物因此像一种“数据化石”:它保存了某个时代的人类语言、知识结构、价值判断和表达习惯。

第二,内容通常经过多层筛选

一本书从选题到出版,通常经历作者写作、资料整理、出版社立项、编辑加工、校对、印刷和市场反馈。

这套流程不能保证书中所有内容都正确,也不能阻止低质量图书出现。但与随机抓取的网页相比,出版物通常具有更稳定的结构、更完整的上下文和更高的信息密度。

第三,旧书保留了互联网中缺失的长尾知识

大量地方志、行业手册、绝版教材、小语种出版物、早期技术文档和专业研究资料,从未被完整数字化。

2025年发布的Institutional Books 1.0数据集就显示,哈佛图书馆参与数字化的公共领域藏书中,经过处理后可形成约98.3万册、2420亿个token的历史文本数据,而且涉及250多种语言。这个规模说明,传统图书馆中仍然保存着数量巨大的、尚未充分进入现代互联网的数据。


二、AI为什么不能一直用AI生成的数据训练自己?

直觉上看,AI既然能够生成无限文字,似乎也能自己生产训练材料。

现实要复杂得多。

2024年发表于《Nature》的一项研究提出了“模型崩塌”问题:当一代生成模型的输出不断进入下一代模型的训练集,并逐渐替代真实数据时,模型可能慢慢偏离原始数据分布。最先丢失的往往不是最常见的信息,而是低频事件、少数表达和分布尾部的细节。

可以把这个过程理解为反复复印一张照片。

第一次复印时,主体仍然清晰;继续用复印件复印,最先消失的是背景中的纹理、阴影和细小文字。次数越多,图像越趋向简单、平滑和雷同。

语言模型也可能出现类似现象:

常见句式被进一步强化,少见表达逐渐消失;主流观点被重复放大,边缘经验越来越难进入训练集;模型最终学到的不是现实世界,而是上一代模型对现实世界的压缩版本。

不过,“使用合成数据”并不等于一定会发生模型崩塌。

另一项研究发现,如果训练过程中持续保留真实数据,让新增的合成数据与原始数据累积使用,而不是用合成数据完全替换真实数据,模型崩塌可以被避免。经过验证、筛选和任务设计的合成数据,目前本来就是许多模型训练的重要组成部分。

因此,真正的问题不是“AI数据有没有毒”,而是:

训练者能不能识别数据来源,能不能保留足够多的真实样本,能不能发现错误和分布偏移。

今天的互联网恰恰越来越难完成这三件事。

一段文字可能由一个模型生成,被另一个模型总结,再由第三个模型改写,最后经过人工润色后重新发布。数据采集者看到的只是最终页面,很难追溯其中经历了多少次机器加工。

在这种环境中,一本已经印刷多年的实体书,反而提供了相对清晰的来源证明。


三、Anthropic的“巴拿马项目”到底做了什么?

Anthropic对实体书的需求,并不是行业传闻。

根据法院文件和《华盛顿邮报》对已解封材料的调查,Anthropic在2024年推进了一个代号为“Project Panama”的项目。内部文件将其描述为一项试图“破坏性扫描世界上所有书籍”的计划,并表示公司不希望外界知道这项工作。

所谓“破坏性扫描”,不是把一本书放在普通扫描仪上逐页翻拍,而是采用更高效的工业流程:

先使用液压切割设备切掉书脊,将书页分离;再把散页送进高速扫描设备,生成可检索的数字文件;最后把已经无法恢复的纸张送去回收处理。

法院判决书确认,Anthropic及其供应商会拆除装订、裁切书页并扫描,在创建数字副本的同时丢弃原纸书;法院记录中没有证据显示这些数字副本被提供给Anthropic以外的主体。

《华盛顿邮报》披露的供应商文件显示,相关项目曾计划在六个月内处理50万至200万本书。Anthropic最终从Better World Books、World of Books等二手书渠道批量购买图书,部分订单一次达到数万本。

这条路线解决了AI公司面临的两个问题:

一是获取互联网中没有完整数字版本的图书;二是降低直接使用盗版电子书带来的法律风险。


四、同一本书,为什么买纸书扫描和下载盗版PDF会有不同结果?

Bartz诉Anthropic案最值得关注的地方,是法官没有把Anthropic的所有行为简单归为“可以”或者“不可以”,而是把不同用途拆开判断。

1. 使用图书内容训练模型

2025年6月,美国加利福尼亚北区联邦地区法院法官William Alsup在该案的简易判决中认为,在这起案件所呈现的具体事实下,Anthropic使用图书训练特定大语言模型属于具有高度转化性的使用,因此构成合理使用。

这里的“转化性”并不是说书的版权消失了,而是法院认为,模型训练的目的不是向读者提供原书副本,而是通过分析文本规律形成一个能够生成新内容的系统。

2. 把合法购买的纸书转换成内部数字副本

法院也认为,Anthropic把已经合法购买的纸书转换为数字版本,在本案具体条件下可以构成合理使用。

这项判断依赖于几个相互关联的事实:

Anthropic已经购买了纸质副本;扫描时原书被销毁;纸质副本被一个数字副本替代,没有增加额外馆藏副本;数字文件用于公司内部存储和检索;现有记录没有显示这些数字副本被对外销售或传播。

法院将其理解为一次“格式替换”,而不是通过扫描额外制造一套可以流通的电子书库。

3. 从盗版网站下载并长期保存电子书

法院对这部分行为得出了相反结论。

Anthropic曾从Library Genesis等盗版资源中下载数百万本电子书,并计划把它们长期保存在一个通用的中央资料库中。法院认为,建立一个永久、通用的盗版图书库,本身不能因为其中部分书籍未来可能用于模型训练,就自动获得合理使用保护。

换句话说:

训练模型是否属于合理使用,和企业通过什么方式取得训练材料,是两个不同的法律问题。

一个企业不能仅仅因为最终用途可能具有转化性,就当然获得免费下载盗版原件的权利。


五、15亿美元究竟是罚款,还是训练许可费?

2026年7月20日,美国联邦法官最终批准Anthropic支付15亿美元,与相关作者和出版商达成集体诉讼和解。路透社将其称为已知金额最大的美国版权案件和解之一。

这笔钱经常被简化成“Anthropic因为拿书训练AI被罚15亿美元”,但这种说法不准确。

首先,这是诉讼和解,不是法院开出的行政罚单或刑事罚金。

其次,和解主要解决的是Anthropic获取和保存盗版图书的问题。此前的简易判决仍然认定,在该案事实框架下,使用图书训练特定模型可以属于合理使用。

再次,Anthropic并没有通过和解承认全部指控。和解的现实意义,是避免继续审理可能产生的巨额法定赔偿风险。

因此,这起案件真正画出的边界不是“只要买过书,AI公司就可以随意使用”,而是:

  • 数据来源是否合法;
  • 复制行为发生了几次;
  • 原件是否仍然保留;
  • 数字副本是否向外传播;
  • 数据库是否还被用于训练之外的其他目的;
  • 模型输出是否构成对原作品的替代或侵权。

这些条件任何一个发生变化,都可能改变法院对合理使用的判断。

而且,Bartz案只是美国一家联邦地区法院针对特定证据作出的裁判,并不是全球通用规则,也不是所有美国法院必须照搬的普遍结论。其他案件如果涉及不同的数据来源、模型输出、市场损害或传播方式,完全可能得出不同结果。


六、旧书真正出售的不是文字,而是“数据出处”

从技术角度看,一本几十年前的书也许只有几十万字。与万亿级token的模型训练集相比,单本书的体量并不起眼。

但AI公司真正看重的并不是字符数量,而是这些字符附带的元数据:

谁写的,什么时候出版,由哪家出版社发行,属于哪个版本,经过哪些编辑流程,在什么历史环境中产生,有没有被后续模型改写。

这就是所谓的数据来源链,或者数据溯源能力。

过去的数据竞争主要围绕“规模”展开。谁能抓取更多网页、储存更多文件、建立更大的语料库,谁就可能训练出更强的模型。

未来的数据竞争会越来越关注另外几个指标:

可追溯性

能否说明数据来自哪里,由谁产生,在什么时间被记录。

权利状态

企业是否拥有使用、复制、加工和训练这些数据的合法依据。

真实性

数据是否来自真实交易、真实生产、真实用户或真实实验,而不是模型模拟出来的平均答案。

判断密度

数据中是否包含人类作出的选择,例如编辑删改、专家标注、质量审核、故障判断和用户反馈。

稀缺性

数据是否包含公开互联网中缺失的长尾信息、失败案例和极端样本。

这些属性比单纯的数据量更难复制。


七、企业真正应该整理的,不只是文档,而是“真实世界记录”

旧书只是高价值人类数据的一种形式。

对于一家服装电商公司,真正有价值的数据可能不是公开商品描述,而是多年积累的买家秀、退货原因、尺码偏差、面料投诉和不同地区消费者的实际选择。

对于一家工厂,设备正常运行的数据固然重要,但停机、报废、返工和异常参数往往更稀缺。公开资料通常只告诉模型“正确答案是什么”,而企业内部的失败记录能够告诉模型“错误是怎样一步步发生的”。

对于一家医疗机构,真正重要的不只是医学论文,还包括经过脱敏和合规处理的真实诊疗路径、随访结果和不同治疗方案的长期反馈。

对于内容创作者,真正有价值的资产也不只是已经发布的文章,还包括采访录音、资料来源、修改过程、读者反馈以及哪些判断后来被证明是错误的。

这些数据之所以珍贵,不是因为它们绝对保密,而是因为它们来自真实世界,并且保留了完整的因果背景。


八、机器越会生成,为什么人类内容反而越贵?

生成式AI正在把文字、图片、代码和视频的生产成本压向接近于零。

当内容供给无限增加时,市场不会因此自动获得无限知识。相反,筛选、验证和追溯的成本会迅速上升。

未来最普通的内容可能非常便宜:

一篇结构完整的文章,一套营销海报,一份会议纪要,甚至一本形式上完整的电子书,都可以被快速生成。

但下面这些东西会越来越贵:

  • 能证明由真实专家完成的分析;
  • 有原始实验和失败记录支撑的结论;
  • 有采访对象、时间和地点的现场资料;
  • 有完整版本历史的企业知识;
  • 有明确授权范围的数据集;
  • 在生成式AI普及前就被固定下来的原始文本。

因此,AI时代的数据资产不能只看“有多少GB”,而要看能否回答三个问题:

它从哪里来?谁对它作出过判断?为什么值得相信?


寄语:纸张没有战胜互联网,出处正在战胜数量

AI公司回头寻找旧书,并不意味着纸质媒介重新战胜了互联网。

它真正说明的是,当机器开始参与生产互联网内容后,互联网不再天然等于“人类经验的集合”。我们正在进入一个必须区分原始数据、合成数据、改写数据和混合数据的时代。

一本旧书可能观点过时,可能质量普通,甚至可能充满错误。但它至少是一份已经被时间固定的人类表达。

在内容极度充裕的年代,这种确定性本身就是资产。

机器越擅长写作,人类亲自观察、判断、失败、修改和记录所留下的数据,反而越难被替代。

未来最昂贵的数据,未必最神秘,也未必数量最大。

它们只是能够清楚地证明:这件事真实发生过,这个判断由人作出过,这份记录没有被机器循环加工过。

关注本站,每天分享跨境电商前沿资讯( Ctrl + D 收藏本站/收藏为书签 )

相关推荐

评论 ( 0 )

扫码关注

qrcode

联系我们

qrcode

回顶部