🌍 地球观测 · 平台发布

OlmoEarth 平台:一天跑完一个洲级推理,把卫星 AI 的算力成本压到零点几分钱

非营利研究机构 Ai2 发布 OlmoEarth 平台——一套从微调、评估到大规模推理的地理空间基础设施。它能在约 24 小时内完成洲际级卫星图像推理,处理数十 TB 数据,单平方公里成本仅不到一美分。首批应用已落地森林砍伐监测、食品安全与野火风险评估。

来源:官方发布 全文约 4 分钟读完 i>
#Ai2 #地球观测 #卫星AI推理 #OlmoEarth
~24小时 洲际级卫星图像推理端到端耗时
155× 并行加速比,4737 小时串行压缩至 30.5 小时
<$0.01/km² 单平方公里推理成本,处理数十 TB 级影像

⚡ 30 秒速览

  • 解决了什么痛点:环境机构有应用需求但缺工程团队,OlmoEarth 把数据标注、微调、大规模推理的全生命周期封装成即用基础设施。
  • 技术硬指标:北美野火风险图实测动用 19,600 个 CPU 与 994 个 GPU 并行,网络吞吐超 168 GB/s。
  • 底层模型:OlmoEarth 系列地球观测基础模型,预训练于约 10 TB 多模态卫星数据。
  • 数据策略:自建元数据索引,只对云优化格式(COG/Zarr)做窗口化读取,避免下载完整影像。
  • 工程哲学:任务可重入、幂等,分布式计算常规失败自动重试,监控进程独立重启停滞任务。

01为什么可信 十年运营级平台的工程沉淀

这不是一份纸面架构图。Ai2 此前已运营 SkylightEarthRanger 等平台十余年,供全球用户日常依赖。这段经历教会他们一件事:模型必须在正确的时间与地点、以可承受的成本运行,原始输出必须转化为可执行洞察,并验证这些输出确实驱动了合作方想要的结果。

多数环境机构的现实

有应用场景(保护、粮食、气候),但缺基础设施与工程团队,无法独立管理标注、微调、大规模推理的全生命周期。

OlmoEarth 平台的定位

把地理空间模型从微调、评估一路推到大规模推理,封装成即用基础设施,让环境团队专注应用而非运维。

02它到底能做什么?首批落地场景

🌲 森林砍伐监测政府 / NGO 在用

  • 依托预训练于约 10 TB 多模态卫星数据的 OlmoEarth 基础模型,识别森林覆盖变化。
  • 机构可基于平台微调适配本地生态,无需自建推理管线。

🔥 野火风险制图北美全境实测

  • 近期生成覆盖全北美的野火风险图,峰值动用 19,600 个 CPU 与 994 个 GPU 并行。
  • 网络吞吐超 168 GB/s,将约 4,737 小时串行计算压缩至 30.5 小时墙钟时间。

🌾 食品安全评估机构适配中

  • 面向政府、NGO 等任务驱动型组织开放适配,模型与基础设施打包交付。

03洲际级推理怎么跑出来的

地球观测推理与普通 ML 任务量级完全不同:单次微调可搬运 TB 级数据、运行数小时;输入跨多光谱波段、多传感器、多时间步;输出是地图,每个预测必须与相邻区域的投影和坐标网格精确对齐

核心做法是按硬件档位拆分流水线,让最贵的 GPU 只做它该做的事:

① 数据获取(CPU)② 重投影与重采样(CPU)③ 模型前向推理(GPU)

多进程数据加载器持续喂数据给 GPU,输出直接流式写入对象存储,避免 GPU 空等 I/O。

3a分区与并行 把洲际任务切成数千独立窗口

OlmoEarth Run 执行层把地理区域切成分区,再细分为窗口——每个窗口独立做一次前向推理,互不等待。一个州级区域约切出上百个分区,洲际级可切出数千个。相邻分区略有重叠,拼接时消除接缝。

19,600峰值并行 CPU 数
994峰值并行 GPU 数
168+ GB/s峰值网络吞吐
155×串行 vs 并行加速比

注:并行度并非无上限,受云配额约束;输出分辨率、模型大小、原始影像缓存均可按任务与预算逐项调节。

3b数据获取 自建索引,不冲击公共服务

一次大推理可瞬间生成数千条元数据查询,远超 ESA、Microsoft Planetary Computer 等公共 STAC API 的承受力。平台因此自建元数据索引:对 AWS Open Data 数据集订阅 SNS 通知,无变更流则每隔几分钟轮询上游索引。对外部服务的请求节奏跟随新影像发布节奏,而非推理任务的突发洪峰。

每条索引项存储场景元数据与所有可用像素位置的指针。运行时仅对 COG / Zarr 等云优化格式做窗口化读取,只取分区所需字节,不下载整幅影像。

3c容错机制 把"分布式常规失败"当常态设计

  • 每个任务动态拉起虚拟机运行 runner 容器,执行完毕即销毁。
  • 所有任务可重入、幂等,间歇性失败可安全重跑。
  • 提供商慢响应、影像波段缺失、云量过多、任务崩溃——均按可重试与致命错误分类处理,可重试时自动回退备用提供商。
  • 独立监控进程检测停滞或停止的 runner,自动重启其任务。
编辑视角

本文源自 Ai2 官方技术博客,属单方披露,文中的 155× 加速、24 小时洲际推理等性能数据未见第三方独立复测。读者宜将其视为工程能力展示而非基准评测结论——关注其架构取舍(按硬件档位拆流水线、自建元数据索引避免冲击公共 API、任务幂等容错),而非单一数字。

当基础模型趋同,"把模型在正确时间、正确地点、以可承受成本跑起来"的工程层,正在成为地球观测 AI 落地的真正护城河。

获取与使用

OlmoEarth 模型与平台面向政府、NGO 等任务驱动型组织开放适配;具备工程能力的团队可直接获取开源模型自行部署。

Hugging Face · Ai2 模型主页 → 获取 OlmoEarth