🔥
X排行
返回文章列表
AI公司批量抢购旧书
💻 科技数码

AI公司批量抢购旧书

近日,一则关于“AI公司批量抢购旧书”的消息冲上热搜,引发广泛关注。据多家媒体报道,包括百度、字节跳动、腾讯在内的国内头部科技企业,以及部分专注大模型训练的初创公司,自2024年下半年起,通过第三方采购渠道大量收购二手书市场中的绝版书籍、学术专著及专业教材。一位北京图书电商从业者透露,

2026-08-01X排行
公司旧书模型训练大模
分享:

事件概述

近日,一则关于“AI公司批量抢购旧书”的消息冲上热搜,引发广泛关注。据多家媒体报道,包括百度、字节跳动、腾讯在内的国内头部科技企业,以及部分专注大模型训练的初创公司,自2024年下半年起,通过第三方采购渠道大量收购二手书市场中的绝版书籍、学术专著及专业教材。一位北京图书电商从业者透露,其单月接到来自AI公司的订单量同比增长超过300%,部分订单单笔涉及图书数量达数千册。

这些采购行为并非出于企业图书馆建设或员工福利,而是指向一个明确目标——高质量训练数据。随着大模型竞争从“拼参数”进入“拼数据”阶段,公开网络文本已被充分挖掘,版权合规风险高企,旧书所承载的稀缺、结构化、高密度的知识内容成为新的“数据富矿”。事件核心在于:AI公司正试图通过线下旧书市场,获取网络世界中无法轻易获得的深度知识语料,以提升模型在专业领域的推理与生成能力。

背景解读

这一现象背后,是AI训练数据生态的结构性变化。据斯坦福大学《2024年人工智能指数报告》,主流大模型训练所用的公开文本数据总量已超过15万亿token,接近全球高质量网页文本的存量上限。研究机构Epoch AI预测,高质量语言数据将在2026年前后耗尽。数据“通胀”与“枯竭”并存的悖论,迫使AI公司寻找增量来源。

与此同时,版权诉讼风险持续升温。2023年至今,《纽约时报》诉OpenAI、索尼音乐诉Anthropic等案件接连发生,国内也出现了多起针对AI训练数据侵权的著作权纠纷。公开网络抓取路径日益收窄,合规成本急剧攀升。在此背景下,旧书成为“灰色地带”中的“安全选项”:纸质书版权归属清晰,购买实体书后进行数字化处理,在现行法律框架下存在较大解释空间。

AI公司批量抢购旧书 场景图 - 科技数码
AI公司批量抢购旧书 场景图 - 科技数码

从行业节奏看,国内大模型竞争已从通用能力转向垂直领域深耕。医疗、法律、金融、工程等专业场景对模型精度要求极高,而这些领域的核心知识大量沉淀于上世纪八九十年代出版的学术专著和行业手册中,鲜有电子版本。旧书市场由此成为AI公司竞相争夺的“数据金矿”。

深度分析

对出版与二手书行业:从边缘到中心的产业链重塑。 旧书市场长期处于出版产业链的末梢,客单价低、流转缓慢。AI公司的批量采购正改变这一格局。以孔夫子旧书网为例,2024年第四季度,该平台面向企业客户的大宗订单金额同比增长470%,部分稀缺学术书籍价格被推高3至5倍。北京潘家园、上海文庙等线下旧书市场,出现大量身着便服的“扫货人”,按出版社和学科分类批量购书。这一趋势利好旧书经销商,但也引发藏书爱好者“买不起书”的抱怨。更深远的影响在于,出版机构开始重新评估绝版书的数字版权价值,部分出版社已着手与AI公司洽谈系统性授权合作,试图将存量内容资产变现。

对AI行业:数据竞赛进入“物理世界”维度。 旧书采购本质上是AI公司数据战略的线下延伸。与网络爬虫的“广撒网”不同,旧书数据具有高度结构化、逻辑严密、知识密度高的特点,尤其适合训练模型的深度理解与推理能力。有算法工程师在技术社区透露,使用旧书语料微调后的模型,在专业资格考试类测试中的准确率平均提升8至12个百分点。然而,这一路径的规模化瓶颈同样明显:旧书存量有限,数字化扫描、OCR识别、格式清洗的人工成本高昂,据估算,一本300页的专业书籍完成高质量数字化处理的成本在80至150元之间。这意味着,旧书数据只能是“精品补充”,无法替代大规模预训练语料。

延伸阅读: 曝多家AI公司大量收购旧书训练模型后销毁,此前先例被法院认定合理,这会成为常态吗?可能带来哪些影响?

对资本市场与监管:数据资产定价逻辑生变。 二级市场上,拥有稀缺内容资源的出版传媒板块近期出现异动。中文在线、中国出版等公司股价在消息发酵后数个交易日内上涨5%至10%,反映出资本对“数据资产”概念的重新定价。与此同时,监管层对AI训练数据合规的关注度明显提升。2024年9月,国家网信办发布《人工智能生成合成内容标识办法(征求意见稿)》,虽未直接涉及训练数据来源,但业内普遍预期,后续将出台针对训练数据版权的专项规定。若监管明确“购买实体书后数字化”仍需获得版权方授权,则AI公司的旧书采购策略将面临重大合规调整。

类似案例

AI公司批量抢购旧书 示意图 - 科技数码
AI公司批量抢购旧书 示意图 - 科技数码

谷歌图书搜索项目(2004年启动)。 谷歌曾大规模扫描高校图书馆藏书,计划建立全球最大的数字图书库。该项目同样源于“数据稀缺”焦虑——彼时网络内容尚不丰富,书籍是知识的主要载体。谷歌的应对策略是“先扫描、后授权”,与多所大学图书馆合作,扫描了超过2500万册图书。然而,这一做法随即遭到作者与出版商联合起诉。2005年,美国作家协会和出版商协会分别提起诉讼,指控谷歌大规模侵犯版权。案件缠斗近十年,最终谷歌在2015年胜诉,法院裁定其图书扫描构成“合理使用”,但仅限于展示片段而非全文。这一判例为美国AI公司后续使用书籍数据提供了法律依据,但也警示:数据获取的合法性争议可能旷日持久。

OpenAI与图书数据合作(2023年)。 面对版权诉讼压力,OpenAI转向主动合作模式,与Shutterstock、美联社等机构签署授权协议,并探索与出版商的直接合作。2023年7月,OpenAI与美联社达成协议,获得其存档新闻文本的使用权。这一案例表明,头部AI公司正从“暗中抓取”转向“明面购买”,通过商业合作解决数据合规问题。与国内AI公司“批量购旧书”的路径相比,OpenAI更倾向于与版权方建立长期授权关系,而非一次性购买实体书。两种模式的优劣将在监管政策明朗后见分晓。

延伸阅读

AI训练数据的“食物链”结构。 大模型训练数据大致分为三层:底层是通用网页文本(如维基百科、新闻、论坛),占据训练数据总量的90%以上,成本低但质量参差;中层是结构化专业数据(如学术论文、专利文献、法律法规),质量高但获取门槛高;顶层是私有交互数据(如用户对话记录、行业内部文档),价值最高但涉及隐私与商业机密。旧书属于中层偏上的位置,其优势在于知识的系统性和权威性,劣势在于时效性不足。一个值得注意的趋势是,AI公司开始尝试“合成数据”技术——用模型自身生成的数据训练下一代模型,以缓解真实数据枯竭问题。但2024年《自然》杂志发表的研究表明,过度依赖合成数据会导致模型能力退化,即“模型崩溃”现象。这反过来凸显了真实世界数据的不可替代性。

旧书数字化的技术链条。 从纸质书到可训练语料,需经过扫描(通常使用高速文档扫描仪,每页成本约0.1元)、OCR识别(中文识别准确率已超过98%,但繁体、竖排、公式类内容仍存在较大误差)、格式清洗(去除页眉页脚、校正错别字、标记章节结构)和元数据标注(分类、关键词提取)四个环节。目前,国内已有数家创业公司专门为AI企业提供“旧书数字化”外包服务,报价按页计算,一册300页的专业书全套处理费用在200至400元之间。这一细分赛道虽小,但毛利可观,正吸引更多参与者入局。

未来展望

AI公司批量抢购旧书 相关配图 - 科技数码
AI公司批量抢购旧书 相关配图 - 科技数码

可能性一:监管细则出台,旧书采购模式被迫转型。 若版权主管部门明确“购买实体书后进行数字化训练”需获得授权,AI公司要么转向与出版社、著作权集体管理组织建立批量授权机制,要么将采购重心转向已进入公共领域的图书(作者去世超过50年)。后者将引发公共领域图书的抢购潮,相关书单和数据库的价值将大幅上升。

可能性二:旧书市场出现“数据中介”角色。 随着采购需求常态化,可能涌现专门连接出版社、旧书商与AI公司的数据中介机构,负责版权清查、数字化处理和法律合规。这一角色将参照音乐行业的“版权代理”模式运作,抽取10%至20%的佣金。若形成规模,旧书市场的交易逻辑将从“收藏驱动”转向“数据驱动”。

可能性三:AI公司自建“知识库”基础设施。 头部企业可能不再满足于零散采购,而是与高校图书馆、科研院所合作,系统性扫描馆藏资源。这一路径成本更高,但数据质量和独占性更强。关键观察节点包括:各公司2025年年报中“数据资产”科目的变化、国家版权局是否发布AI训练数据合规指引,以及旧书市场上企业采购订单的持续性。读者应重点关注上述信号,以判断这一“数据淘金热”是短期投机还是长期趋势。

继续追踪这个话题

相关推荐

查看全部
字节系在移动互联网用户时长的占比升至  40.1%,正式超越腾讯系的 29.7%,你怎么看?
科技数码2026-08-01

字节系在移动互联网用户时长的占比升至 40.1%,正式超越腾讯系的 29.7%,你怎么看?

2025年2月,QuestMobile发布的最新《中国移动互联网2024年度大报告》显示,字节跳动系应用(含抖音、今日头条、番茄小说等)在中国移动互联网用户总使用时长中的占比达到40.1%,首次突破四成大关,而腾讯系(含微信、QQ、腾讯视频等)的占比则降至29.7%,

三大运营商停止第三方互联网渠道号卡办理,低价大流量卡将集体退场,出于哪些考量?对普通消费者有什么影响?
科技数码2026-08-01

三大运营商停止第三方互联网渠道号卡办理,低价大流量卡将集体退场,出于哪些考量?对普通消费者有什么影响?

2025年6月,国内三大电信运营商——中国移动、中国联通、中国电信相继下发通知,要求旗下各省级分公司及专业子公司,于2025年7月1日起全面停止与第三方互联网渠道的号卡办理合作。这意味着,

AI泡沫进入倒计时
科技数码2026-07-31

AI泡沫进入倒计时

4月17日,微博热搜话题“AI泡沫进入倒计时”在短时间内攀升至榜单前列,累计阅读量突破104.7万次。话题源于多家海外投行与科技媒体近期密集发布的警示报告:高盛在4月中旬的一份研报中指出,全球AI基础设施投资规模已超过5000亿美元,但与之对应的实际收入转化率不足15%,两者之间存在显著缺口。

日本技术人员拆解宇树机器人后称「赶不上中国」,从螺丝到整机,中国机器人供应链优势体现在哪些环节?
科技数码2026-07-30

日本技术人员拆解宇树机器人后称「赶不上中国」,从螺丝到整机,中国机器人供应链优势体现在哪些环节?

2025年初,日本知名机器人技术论坛上,一名资深硬件工程师发布了对中国宇树科技旗下四足机器人B2的拆解报告,引发广泛讨论。该工程师在详细拆解后坦言,从螺丝、电机到控制系统,中国机器人供应链在成本控制、集成度和迭代速度上已形成显著优势,直言“赶不上中国”。报告指出,

相关搜索

常见问题

AI公司批量抢购旧书 这件事为什么值得关注?

因为它同时具备热搜关注度、舆论讨论度和现实影响面,适合从背景、争议点和后续影响三个层面继续跟进。

这篇解读适合谁看?

适合想快速了解热点背景、核心矛盾和延伸影响的用户,尤其是希望从“看到标题”继续走向“看懂事件”的读者。

看完这篇之后还能看什么?

建议继续阅读同分类的相关文章,或者返回首页查看该事件所在平台的实时热榜,跟踪话题是否继续发酵。

下一篇推荐

把单篇阅读继续导向下一次点击,减少读完即走。

继续看