算力之后是语料:AI新瓶颈重塑内容产业定价权,高质量文本缺口或达99%
高质量原生语料正从免费午餐变为稀缺矿产,但传统出版商的定价权并非自动获得,而是取决于确权、计价、分润体系能否跑通以及能否持续生产合规可溯源数据资产。
2026年8月A股AI语料板块集体爆发,读客文化涨停、中信出版等跟涨,资本押注高质量文本数据即将成为大模型的新瓶颈。
缺口
99%
具身智能所需多模态数据量:至少1000万小时
据2026机器人全产业链接会披露,当前国内真实物理交互场景合规数据仅50万小时,缺口超99%。
窗口
2020s末—30s初
高质量公开文本预计紧缺时间窗口
Epoch AI等机构预测,当前公开文本的消耗速度远快于自然增长,若大模型参数持续膨胀,稀缺将提前到来。
比喻
AI就像数据的精炼厂,竞争力从来不在于炉子多大,而在于矿石的品位有多高。
交易
覆盖约48.2万至50万部作品,折合每部约3000美元,是美国版权史上最大和解协议。
AI生成内容大量涌入互联网后,被下一代模型抓取训练可能导致模型坍缩——模型逐渐偏离真实世界分布,失去对罕见事件的理解能力。
模型坍缩的严重程度取决于数据治理策略:
高风险路径
不加筛选、大规模纯AI生成数据循环训练 → 严重坍缩
抑制退化路径
严格过滤、数据清洗、去重、混合原生人类数据 → 有效抑制退化
"巴拿马计划是指我们破坏性扫描世界上所有书籍……我们不希望外界知道我们在做这件事。"
Anthropic内部文件 · 据《华盛顿邮报》报道
Anthropic版权诉讼和解金额
15亿美元
覆盖约48.2万至50万部作品,折合每部约3000美元,是美国版权史上最大和解协议。
地区法院审前意见认定合法购入图书扫描用于训练属合理使用,但该意见不构成全国判例,且不能推导出破坏性销毁书籍的正当性,更无法平移至中国著作权环境。
AI企业采购版权文本有两种截然不同的用途(预训练/SFT vs RAG检索),法律授权范围与价格天差地别,目前大量采购仅做检索,不能简单预期所有版权内容都能以训练语料高价出售。
哈珀·柯林斯 × 微软
图书授权协议
仅限精选非虚构旧书,作者自愿加入、对半分成,且设置文本引用比例上限。
¥5,000 / 单本·三年
泰勒-弗朗西斯
学术内容授权协议
部分交易带有版权诉讼和解背景,价格不代表常态化市场化定价。
$10,000,000
全球训练数据授权市场
规模预测(2034年)
MarketIntelo预测,统计口径覆盖多类型训练数据集,不局限文字版权。
$22,600,000,000
国内AI公司已开始向传统内容机构采购合规数据集,国家数据局提出以词元(Token)为基础的数据集价值体系,但中文语料面临版权权属复杂、数据分散、深层标注能力不足等现实约束,多数大众通俗文本单Token价值很低,只有专业、独家、稀缺垂类内容才可能获得高溢价。
语料短缺并非不可逾越的硬约束,AI公司拥有多条备选路径:合成数据在数学、代码等领域已部分替代真实数据;模型架构改进(MoE)、训练方法优化(课程学习)降低单位智能所需数据量;RAG与持续学习扩展模型获取信息边界。
AI公司的六条备选数据供给路径
合成数据在数学、代码等领域已部分替代真实数据
模型架构改进(MoE)降低单位智能所需数据量
训练方法优化(课程学习)提升数据利用效率
RAG与持续学习扩展模型获取信息边界
自建人工标注团队、采购专业数据服务商
抓取开放合规公共数据、海外多语种数据集采购、直接签约作者
传统图书版权只是数据源之一,并非不可替代。AI公司还可自建人工标注团队、采购专业数据服务商、抓取开放合规公共数据、海外多语种数据集采购,以及直接签约作者。
中文高质量公开文本分散,专业出版、学术、行业报告数据流通机制不成熟,出版机构有内容资产但未必有数据工程能力。
从拥有版权库到掌握定价权,需跨越三重现实壁垒:版权权属错综复杂、Token计价体系尚未成熟、AI公司的替代供给正在成形。
版权确权困境
出版社大多仅拥有出版版式权和信息网络传播权,文字著作权归属作者。
Token计价体系尚未成熟
当前海外大多采用打包授权(年费、整库采购),按Token计价的精准交易模式距离落地还有距离。
替代供给成形 + 分层稀缺
语料稀缺是分层稀缺,非全局性紧缺:
若国内推出AI训练数据的法定许可机制(统一费率、无需一对一谈判),出版社的独家议价权将被大幅削弱。
编辑判断
8月A股语料板块暴涨反映的是资本对AI语料新叙事的饥渴,而非业绩兑现。在确权体系、计价规则、分润机制尚未跑通之前,出版企业的AI语料收入大概率仍停留在意向协议层面。长期来看,AI竞争向多模态演进,纯文本版权语料的战略权重会逐步被稀释。
语料稀缺是真实存在的,但并非全局性紧缺,而是分层稀缺。传统出版商不能仅靠囤积存量文字建立护城河,真正决定议价能力的是:持续生产高质量原创内容的能力、将版权资产转化为合规可溯源数据资产的能力,以及在AI公司、平台、作者之间建立稳定分润机制的能力。单纯手握存量文字,不等于护城河。
综合公开信息整理