⚙️ 架构观察 · 企业级 AI 降本
智能体请求狂飙 9.4 倍但账单平稳:Uber 披露 AI 软件工厂降本 52% 的工程解法
随着 AI 深入融入软件开发全生命周期,Uber 内部智能体周请求量在半年内暴增 9.4 倍。然而通过托管工厂架构与 Token 级别的工程切除,其 AI 总支出自 4 月起保持平稳,单会话成本较峰值锐降 52%。
来源:综合企业工程团队公开技术报告整理•
2026-08•
全文约 4 分钟读完
#Uber工程
#AIAgent
#软件工厂
#Token优化
#上下文工程
-52%
单会话成本降幅 · 较 6 月峰值
9.4倍
周智能体请求增长 · 半年跨度
70%+
代码合并请求由智能体生成
⚡ 30 秒速览
- 规模与成本脱钩: 2026 年 2 月至 8 月,周活跃用户增长 7 倍,智能体请求增长 9.4 倍,但总支出自 4 月起成功封顶。
- 同模型对照验证: 在固定模型的严格对照组中,每千次请求成本下降 34%,单次会话成本相比峰值降低 52%。
- 切除上下文开销: 将 1000+ 个 MCP 工具封装为 Shell CLI,避免预加载 5 万~7 万 Token 架构信息;引入代码模式,将多轮查询精简为自动化脚本,Token 节省达 50%~90%。
- 事实图谱精准锚定: 构建包含 2400 万节点、8000 万条边的 AI 上下文图谱,将复杂数据定位耗时从 20 分钟(产生 2 个子智能体与 3 次报错)压缩至 38 秒。
- 从对话到托管: 放弃“人手一个聊天框”的低效模式,转向完全托管的智能体软件工厂,主模型负责任务拆解,子智能体分发给高性价比模型。
01业务规模暴涨,账单为何能归于平缓?
大模型进入企业实际工作流后,算力成本常常呈指数级飞涨。但 Uber 公布的数据展示了完全不同的走势曲线:
周智能体请求量增幅趋势(2026.02-08)
+9.4 倍
数据边界:以上降幅均在 Uber 内部标准定价与固定模型版本对照组下测算得到。控制变量旨在剔除供应商主动降价或模型版本更替带来的扰动。
02把 AI 从“聊天工具”升级为“托管工厂”
关键的突破在于系统定位的转变。Uber 将 AI 应用划分为了四个层级,越向高级演进,对成本与质量的掌控力就越强:
初级阶段:交互式 AI (L1-L2)
工程师在终端手动对话。每一轮交互都需重新上传全部代码上下文与工具定义,极易导致 Token 浪费。
高级阶段:托管软件工厂 (L3-L4)
自动化托管智能体自主接管代码评审、CI 故障修复与告警分级,全流程由工程 Harness 统一路由。
3,600+智能体技能
30,000+日执行技能次数
1,000+集中路由 MCP
16 种成本反模式自动诊断
在托管架构下,绝大多数工作会话不再由人工发起,而是由后端触发。这使得团队能够对 Harness 执行路径与 Token 路由施加严格控制。
03Token 级别的极致切除术
在高频智能体交互中,膨胀的上下文与无效轮次是最大的资金黑洞。Uber 采取了四项关键工程干预:
🛠️ 杀招一:MCP 协议改写为 Shell CLI 上下文减负 5-7 万 Token
- 痛点: 传统 MCP 会把所有工具 Schema 加载到会话中,安装 100 个工具就会产生 5万~7万 Token 的初始开销。
- 解法: 统一 MCP 网关,将 1000+ 工具封装为命令行 Shell CLI,让智能体按需检索加载,直接把工具 Schema 踢出初始上下文。
实测效果: 即使第三方 SaaS 办公套件暴露 49 个工具,也不会在用户提问前挤占窗口。
💻 杀招二:代码模式(Code Mode)批处理 Token 节省 50% ~ 90%+
- 痛点: 查询数据仓库需要发起请求、轮询 2-5 次状态并检索输出,每一轮中间结果都充斥着上下文。
- 解法: 智能体编写 Python 脚本并在子进程中运行循环,只有最终摘要被返回给模型。
实测效果: 消除 Schema 初始化与冗余轮询,批量工作流下 Token 节省达 90% 以上。
⏳ 杀招三:差异化提示词缓存 (TTL) 策略 读取成本降至 0.1 倍
- 交互式会话: 工程师经常闲置超时,缓存有效时间从 5 分钟延长至 1 小时,避免重新传输全额上下文。
- 子智能体会话: 短生命周期任务保留 5 分钟 TTL,以最低溢价获取缓存命中。
🔀 杀招四:主/子智能体分层模型路由 架构级降本
- 主智能体: 采用前沿推理模型,专注任务拆解与最终验证。
- 子智能体: 执行边界明确的单一任务,默认路由至性价比高但稍弱的模型,绝不浪费顶级算力。
04事实图谱锚定:拒绝无意义的盲目搜索
缺少事实依据的智能体不会低成本快速失败,而是会在膨胀的上下文里不断尝试搜索,带来高昂的试错开销。
为此,Uber 整合 30 多个内部系统,构建了包含 2400 万个节点与 8000 万条边 的 AI 上下文图谱:
❌ 无图谱锚定(纯模型盲搜)
检查服务代码→耗时 20 分钟→衍生 2 个子智能体→报错 3 次→误判无法查询
✅ 有图谱锚定(Uber 图谱查询)
查询历史记录→定位 50+ 分析师常用表→耗时 38 秒交付
此外,运行时状态行内置成本计数器,并在后台监控 16 种低效反模式(如在简单任务滥用 Opus、缓存失效恢复等),将成本控制精确到每一次提交。
EDITORS' JUDGMENT · 编辑核心判断
Agent 时代的算力账单,不再只是 LLM 供应商的定价博弈,而是一场系统工程的攻坚战。单纯等待底层大模型降价无异于坐以待毙;通过工具 CLI 化、上下文图谱化与路由分层,企业完全可以在使用规模激增数倍的同时,将单位交付成本砍去一半。
注:上述架构方法论已在 Uber 内部基准测试集 Uber SWE Benchmark 中全量落地。