大模型碳排全景对比出炉:训练一次 GPT-3 级模型,等于 120 辆燃油车跑一整年
一篇新发布的综述性研究,用统一生命周期口径重新核算了 80+ 个主流模型的碳排放。最扎眼的结论:训练一次 GPT-3 级大模型释放约 552 吨 CO2e——相当于 120 辆燃油车开满一整年。
一篇新发布的综述性研究,用统一生命周期口径重新核算了 80+ 个主流模型的碳排放。最扎眼的结论:训练一次 GPT-3 级大模型释放约 552 吨 CO2e——相当于 120 辆燃油车开满一整年。
研究团队爬取了近五年公开的 200+ 项训练实验,按统一口径重新核算。先看最直观的对比:
注:数值跨度超过 800 倍,柱形按平方根比例缩放以保证小值可见,实际数值以右侧标注为准。数据为论文对公开实验的重新核算结果。
但是,数字只是故事的一半。
碳排数字之所以长期难以横向比较,是因为各家统计口径完全不同。有的只算训练时 GPU 功耗,有的把冷却和电网损耗也算进去,结果自然千差万别。
只看训练阶段 GPU 的 TDP 估算,忽略冷却、数据中心 PUE、电网传输损耗与硬件生产碳排,不同研究之间无法对比。
覆盖芯片制造、训练、推理、冷却、PUE 与电网碳强度,统一功能单位,首次让"模型碳排"可以跨模型直接比较。
三个核算阶段:训练(一次性)、推理(持续性)、全生命周期(含硬件生产与回收)。电网碳强度数据覆盖 40+ 个国家和地区的发电结构。
一个诚实的注脚:这份综述依赖各家论文自报的硬件配置与运行时长,早期实验无法逐一复现,存在系统性误差。但它是目前口径最统一的公开对比。
口径统一之后,结论才真正有了分量。
这些发现,正在被现实加速验证。
碳排议题从学术论文走向监管合规,只用了不到七年。
学界首次量化 NLP 模型碳排:Strubell 等算出 BERT 训练排放 1,438 lbs CO2e,第一次为"一次训练"贴上碳价签。
大模型被"标价":GPT-3 训练被核算为 552 吨 CO2e,"规模暴力"第一次有了环境成本。
低碳路径被验证:BLOOM-176B 借助法国核电,把训练碳排压到 25 吨,证明选址与电网的价值。
用电曲线陡峭化:国际能源署预测,2026 年全球数据中心用电将达 800-1,000 TWh,AI 是主要增量。
合规时代开启:欧盟 AI 法案分阶段实施,高算力通用模型被要求披露能耗;本论文提供了统一的核算框架。
当监管开始要求"报碳",算不清自己排了多少的团队,会先被市场淘汰。
模型能力的军备竞赛正在撞上环境天花板。当各家 benchmark 分数差距缩小到一两个百分点,碳效率就会成为下一轮竞争的主战场——谁先建立"每吨碳换多少智能"的核算体系,谁就握住了通往合规市场的门票。
论文全文已开放获取,在学术预印本平台检索论文标题 Towards Sustainable Artificial Intelligence 即可阅读。给团队的建议:把"训练一次排放多少吨 CO2e"写进模型卡,与 benchmark 分数一起发布——这正在从倡议变成行业默认动作。
检索标题 · 阅读全文