🌍 可持续 AI · 研究报告

大模型碳排全景对比出炉:训练一次 GPT-3 级模型,等于 120 辆燃油车跑一整年

一篇新发布的综述性研究,用统一生命周期口径重新核算了 80+ 个主流模型的碳排放。最扎眼的结论:训练一次 GPT-3 级大模型释放约 552 吨 CO2e——相当于 120 辆燃油车开满一整年。

来源:综合公开信息整理 2026-07-22 全文约 3 分钟读完
#可持续 AI #碳足迹 #大模型 #生命周期评估
552 吨 CO2e · GPT-3 级模型单次训练排放
22× 同代 175B 级模型碳排最大差距
60%+ 已部署模型推理能耗占比,仍在上升

⚡ 30 秒速览

  • 口径统一:首次用全生命周期(LCA)框架横向对比 80+ 模型、200+ 项训练实验,覆盖芯片制造、训练、推理、冷却与电网损耗。
  • 核心数字:GPT-3 单次训练 552 吨 CO2e ≈ 120 辆燃油车一年;BERT 仅 0.65 吨——差距来自规模,更来自架构搜索。
  • 反直觉结论:电网选址比模型结构更关键。BLOOM-176B 借法国核电做到 25 吨,比 GPT-3 低 95%。
  • 趋势警报:推理能耗占比已超 60%,模型一旦部署就每天持续"烧碳",不只是训练一次的事。
  • 行动信号:欧盟 AI 法案已要求高算力通用模型披露能耗,碳效率正从道德议题变成合规门槛。

01横向对比 主流模型训练碳排,吨 CO2e

研究团队爬取了近五年公开的 200+ 项训练实验,按统一口径重新核算。先看最直观的对比:

GPT-3OpenAI · 175B 参数
552
GopherDeepMind · 280B 参数
400
NAS 架构搜索Transformer 实验 · 8×GPU
284
OPT-175BMeta · 175B 参数
75
BLOOM-176B法国核电 · 176B 参数
25
BERT baseGoogle · 110M 参数
0.65

注:数值跨度超过 800 倍,柱形按平方根比例缩放以保证小值可见,实际数值以右侧标注为准。数据为论文对公开实验的重新核算结果。

但是,数字只是故事的一半。

02怎么测才可信 一份综述的核算口径

碳排数字之所以长期难以横向比较,是因为各家统计口径完全不同。有的只算训练时 GPU 功耗,有的把冷却和电网损耗也算进去,结果自然千差万别。

传统口径

只看训练阶段 GPU 的 TDP 估算,忽略冷却、数据中心 PUE、电网传输损耗与硬件生产碳排,不同研究之间无法对比。

本研究的全生命周期 LCA

覆盖芯片制造、训练、推理、冷却、PUE 与电网碳强度,统一功能单位,首次让"模型碳排"可以跨模型直接比较。

80+覆盖模型
200+纳入实验
3核算阶段
40+电网碳强度区域

三个核算阶段:训练(一次性)、推理(持续性)、全生命周期(含硬件生产与回收)。电网碳强度数据覆盖 40+ 个国家和地区的发电结构。

一个诚实的注脚:这份综述依赖各家论文自报的硬件配置与运行时长,早期实验无法逐一复现,存在系统性误差。但它是目前口径最统一的公开对比

口径统一之后,结论才真正有了分量。

03三个关键发现 每一项都在挑战"堆算力"叙事

📈 规模暴力,第一次有了环境标价发现一

  • 从 BERT 到 GPT-3,参数量增长约 1600 倍,训练碳排增长约 850 倍——规模每上一个台阶,环境账单同步膨胀。
  • 隐藏大户是架构搜索(NAS):一次搜索排 284 吨 CO2e,是 BERT 训练本身的 400 多倍。
论文直言:"模型规模与碳排的强相关,让'越大越好'第一次有了环境标价。"

📍 在哪里训练,比用哪个模型更关键发现二

  • 同样 175B 级参数:GPT-3 在常规电网下训练排 552 吨,BLOOM 在法国核电下仅 25 吨
  • 报告测算:同一模型迁往低碳电网,可减少 60%-90% 的训练碳排。
结论:在模型结构不变的前提下,"选址"可能是性价比最高的减排手段

⏳ 推理是不断累积的长期负债发现三

  • 已大规模部署的模型,推理阶段能耗占比超 60%,且随用户量线性膨胀。
  • 一个日活百万的对话产品,一年推理碳排可达单次训练成本的 2-3 倍
训练是一次性支出,推理是分期付款——而且利率不低

这些发现,正在被现实加速验证。

04为什么是现在 碳排议题从论文走向合规

碳排议题从学术论文走向监管合规,只用了不到七年。

2019

学界首次量化 NLP 模型碳排:Strubell 等算出 BERT 训练排放 1,438 lbs CO2e,第一次为"一次训练"贴上碳价签。

2021

大模型被"标价":GPT-3 训练被核算为 552 吨 CO2e,"规模暴力"第一次有了环境成本。

2022

低碳路径被验证:BLOOM-176B 借助法国核电,把训练碳排压到 25 吨,证明选址与电网的价值。

2024

用电曲线陡峭化:国际能源署预测,2026 年全球数据中心用电将达 800-1,000 TWh,AI 是主要增量。

2026

合规时代开启:欧盟 AI 法案分阶段实施,高算力通用模型被要求披露能耗;本论文提供了统一的核算框架

当监管开始要求"报碳",算不清自己排了多少的团队,会先被市场淘汰。

编辑核心判断

模型能力的军备竞赛正在撞上环境天花板。当各家 benchmark 分数差距缩小到一两个百分点,碳效率就会成为下一轮竞争的主战场——谁先建立"每吨碳换多少智能"的核算体系,谁就握住了通往合规市场的门票。

现在就能做

论文全文已开放获取,在学术预印本平台检索论文标题 Towards Sustainable Artificial Intelligence 即可阅读。给团队的建议:把"训练一次排放多少吨 CO2e"写进模型卡,与 benchmark 分数一起发布——这正在从倡议变成行业默认动作。

检索标题 · 阅读全文