英國與愛爾蘭二手書商懷疑AI公司製造「異常」批量訂單
繼Anthropic被曝斥資百萬掃描書籍以獲取數據後,英國和愛爾蘭的二手書商報告稱,近期收到大量來自神秘買家的批量訂單,外界猜測這些書籍正被AI公司收購用於訓練數據。
近期,英国和爱尔兰的二手书商群体中流传起一种不安的氛围。多位资深书商向媒体透露,自今年上半年以来,他们频繁收到来自不明身份买家的批量采购请求。这些订单具有鲜明的特征:买家通常不通过常规零售渠道,而是直接联系持有大量库存的独立书店或图书馆清仓部门,一次性购入数百甚至上千册书籍。与以往收藏家或机构采购不同,这些买家对书籍的物理状况要求极低,甚至不介意书页泛黄或书脊破损,只要文字内容完整即可。更令人警惕的是,买家往往拒绝透露其所属机构或购买目的,仅以“私人研究”或“档案保存”为由进行模糊解释。这一现象发生在 Anthropic 被曝光斥资数百万美元扫描大量书籍以获取训练数据之后,使得外界强烈怀疑,这些“异常”订单背后正是各大 AI 巨头在秘密扩充其语料库。时间线上,这种批量收购行为与主要 AI 实验室发布新模型或更新数据策略的时间点高度重合,进一步加剧了行业的猜测。对于依赖长尾库存生存的二手书商而言,这种突如其来的需求激增虽然短期内带来了现金流,但也打乱了原有的库存管理节奏,导致部分稀缺书籍迅速售罄,普通读者难以再购得心仪之物。从表面看,这似乎是一波由科技资本驱动的图书消费热潮,但深入剖析其动机,则揭示了 AI 产业对高质量、长尾文本数据的极度渴求。在大数据时代,互联网上的公开文本数据已逐渐被各大 AI 公司清洗、去重并耗尽,边际效益递减。为了突破模型性能的瓶颈,获取更具多样性、专业性和深度的数据源变得至关重要。二手书市场恰好填补了这一空白。与网络文本相比,书籍内容经过编辑审核,逻辑结构严谨,且涵盖了大量未被数字化或未被广泛爬取的领域知识,如历史档案、地方志、专业期刊及绝版文学作品。这些“长尾数据”对于提升模型在特定垂直领域的推理能力和事实准确性具有不可替代的价值。因此,AI 公司选择绕过复杂的版权授权谈判,直接通过收购实体书并进行 OCR(光学字符识别)扫描的方式获取数据,成为一种低成本、高效率的替代方案。这种商业模式的核心在于利用二手书市场的价格洼地,以远低于版权授权费用的成本获取海量文本。
然而,这种做法在技术实现上并非没有门槛。实体书的扫描质量受限于印刷清晰度、纸张材质及装订方式,后续的文本清洗、去噪及结构化处理需要投入大量工程资源。此外,如何确保扫描数据的准确性,避免 OCR 错误引入噪声,也是 AI 公司需要解决的技术难题。尽管如此,相较于与出版商进行漫长的版权谈判,直接收购实体书在时间成本和法律风险上更具优势。对于 AI 公司而言,这是一种典型的“数据套利”行为,利用信息不对称和市场分割,快速构建起自己的私有数据护城河。这种数据获取策略对出版业和二手书市场产生了深远且复杂的影响。首先,它扭曲了书籍的市场定价机制。当 AI 公司成为主要买家时,书籍的价值不再仅仅取决于其文学或学术价值,更取决于其文本数据的稀缺性和完整性。这导致某些特定领域的书籍价格被人为抬高,形成了一种“数据溢价”。对于普通读者和收藏家而言,这意味着获取这些书籍的成本增加,甚至可能面临无书可买的困境。其次,这种收购行为加剧了出版业的焦虑。传统出版商依赖版权授权和版税收入维持运营,而 AI 公司通过收购二手书绕过授权环节,实质上是对版权体系的规避。虽然目前法律上购买实体书并扫描其内容并不直接构成侵权(在部分司法管辖区存在“合理使用”或“首次销售原则”的争议空间),但这种行为在道德和商业伦理上引发了广泛争议。出版界认为,这剥夺了作者和出版商从数据使用中获益的权利,长期来看可能削弱创作激励,损害文化生态的多样性。此外,二手书商作为中间环节,也面临着角色定位的挑战。他们原本服务于文化传承和知识共享,如今却可能被视为 AI 数据供应链的一部分。
这种身份的转变不仅影响了他们的社会声誉,也迫使他们重新思考业务模式。部分书商开始主动筛选订单,拒绝向疑似 AI 公司的买家出售敏感或高价值书籍,以维护行业伦理。然而,这种抵制在巨大的经济利益面前显得脆弱,尤其是对于小型独立书店而言,拒绝大额订单可能意味着生存危机。从竞争格局来看,AI 数据获取战正在从“公开数据爬取”转向“私有数据收购”。这一转变意味着数据壁垒将越来越高,拥有更多高质量私有数据的公司将在模型竞争中占据优势。对于中小 AI 初创企业而言,资金实力不足使其难以参与这种大规模的数据收购战,可能导致行业进一步集中化,头部效应加剧。同时,这也促使出版业和 AI 产业寻求新的合作模式。一些出版商开始探索与 AI 公司直接授权数据使用,并建立透明的收益分享机制,试图将“数据流失”转化为“数据变现”。这种合作模式若能普及,可能重塑出版业的收入结构,使其从依赖销售转向依赖数据服务。然而,谈判的复杂性和利益分配的公平性仍是巨大障碍。展望未来,这一趋势可能引发更严格的监管介入。各国政府可能开始审视 AI 数据获取的合法性边界,出台针对大规模文本扫描和数据使用的专门法规。例如,要求 AI 公司披露数据来源,或对特定类型的数据使用设定补偿标准。对于行业参与者而言,接下来的观察重点包括:AI 公司是否公开承认其数据收购行为;出版界是否形成统一的应对策略或集体诉讼;以及二手书市场是否出现专门针对 AI 数据需求的交易渠道。这些信号将决定 AI 与出版业关系的走向,是走向对抗还是共生。无论如何,书籍作为知识载体的角色正在被重新定义,它们不仅是阅读的对象,更成为了算法训练的燃料。这一转变不仅关乎技术,更关乎文化、伦理和经济结构的深层调整,值得全社会持续关注和深入反思。
Sources
FAQ
英国和爱尔兰的二手书商最近遇到了什么情况?
今年上半年以来,匿名买家频繁向独立书店和图书馆清仓部门下达批量订单,一次性购入数百上千册,不顾书页泛黄或书脊破损,只要求文字完整,并拒绝透露用途。
这些“异常”批量收购为什么会引发担忧?
收购推高特定领域书籍价格,形成“数据溢价”,扭曲了定价机制。买家绕过版权授权直接扫描实体书,引发关于数据版权、商业伦理和行业可持续性的激烈争论。
接下来行业应该关注哪些动向?
重点观察 AI 公司是否公开承认收购行为、出版界是否形成统一应对或集体诉讼,以及二手书市场是否出现专为 AI 数据需求的交易渠道,各国监管也可能出台新规。