🔥 Token经济 · 行业震荡

连卖AI的微软也扛不住了:Token成本失控,硅谷巨头集体踩刹车

2026年8月初,微软执行副总裁Jay Parikh向全体员工发内部信:即日起各部门设AI Token预算目标,员工可在仪表盘实时查看支出。一家市值3.5万亿美元、刚在OpenAI身上砸了130亿美元的巨头,开始勒令自家员工省着用AI。这只是一个开始。

综合公开信息整理 2026-08-10 全文约 4 分钟读完
#微软 #Token成本 #AI预算 #硅谷 #商业困局
🚨 集体刹车 微软 / Uber / Meta / 亚马逊 同期收紧AI预算
18¢ 每投入1美元Token,仅18美分产生实际价值
98% Token单价降幅 · 但用量暴涨1000倍

⚡ 30 秒速览

  • 微软内部信:2026年8月,各部门设Token预算目标,员工可实时监控AI支出,内部默认模型换为更便宜的GPT-5.6。
  • Uber四个月烧光全年预算:5000名工程师月使用率84%-95%,人均月账单150-2000美元,CTO一次演示耗掉1200美元Token。
  • Meta与亚马逊同样失血:Meta内部测算AI年支出将达数十亿美元;亚马逊一套Claude Sonnet系统耗资180万美元处理琐事。
  • 某科技巨头一个月狂烧5亿美元:因忘记给员工Claude许可证设上限,单月AI支出高达5亿美元,舆论直指亚马逊。
  • 根源:单价降了98%,用量涨了1000倍,Agent类任务让单次消耗暴涨数十倍——总支出只涨不跌。

01硅谷巨头集体踩刹车 从微软到Uber,无一幸免

这不是一家公司的偶发问题。2026年春夏之交,从西雅图到旧金山,AI成本失控的连锁反应集中爆发。

执行副总裁Jay Parikh发内部信:设Token预算目标,员工可实时查看AI支出。此前已取消大部分员工的Claude Code许可,近10万工程师被要求迁移到自家Copilot CLI——因为账单太贵
预算管控
四个月烧光2026年全年AI预算。5000名工程师月使用率84%-95%,人均月账单150-2000美元。CTO一次两小时演示消耗1200美元Token。COO Andrew Macdonald得知数字时"震惊得说不出话"。
4个月烧穿全年
内部测算:若维持当前调用速度,2026年仅内部AI使用一项支出就将达数十亿美元。已向约6000名核心员工发放备忘录,明确全员Token配额限制。
数十亿美元
高管公开告诫员工"不要为了使用AI而使用AI"。一套基于Claude Sonnet搭建的匹配系统耗资180万美元,最终只处理了一些简单琐事。另有未具名科技巨头一个月AI支出高达5亿美元,舆论指向亚马逊。
180万美元·单系统

注:以上数据均来自各公司内部备忘录、高管公开言论及经核实的内部报道。未具名案例按行业共识指向标注。

如果连市值万亿的巨头都在算不过来账时踩刹车,中小企业呢?

02Token经济账 单价降98%,总账单却翻了几倍

这里有一个反直觉的现象:Token单价在降,但企业的AI账单在涨。

2024年的叙事

"卖Token不如卖矿泉水"——每百万输入Token几毛钱,贵一点的模型不过一两美元。行业沉浸在"成本将持续下降"的乐观里。

2026年的现实

主流大模型Token单价较2023年初降幅最高达98%,但全球周度Token消耗量从2.1T激增至24.5T,同比增幅280%

小学数学就能算出来:98%的降幅,乘以1000倍的用量增长,总支出只会涨,不会跌。哪怕微小的单位成本,乘以海量规模后,总成本就是一个天文数字。

98%单价降幅
1000×用量增长
3.4×算力供给增速/年
10×Token需求增速/年

供给增速3.4倍 vs 需求增速10倍,缺口逐年撕裂。HBM高带宽内存被三星、SK海力士、美光三寡头垄断,扩产周期24-36个月。英伟达B200芯片租赁费用已翻番至接近6美元/小时。

更致命的是,AI智能体(Agent)类应用的爆发,让单次任务的Token消耗暴涨了数十倍。以前让AI写一段代码,消耗可控;现在让AI Agent自主执行一个任务,可能要调用模型几十次、上百次。

03每投入1美元,只有18美分产生价值

如果Token贵但产出高,那也认了。问题是——产出呢?

开发者生产力平台Entelligence.AI汇总了2444家企业的数据,得出了一组令人警醒的数字:

实际用户价值
18¢
修复AI引入的Bug
44¢
返工成本
27¢
审查摩擦
11¢

注:每投入1美元Token费用,仅18美分产生触达用户的实际价值,剩余82美分消耗在修复、返工和审查环节。数据来自Entelligence.AI,覆盖2444家企业。

Uber首席运营官说得更直白:Token消耗的增长与产品的实质改善之间,"这条线还不存在"。

企业推动全员AI落地的初衷很清楚:用AI替代重复性人力、压缩人力成本、抢占转型红利。但现实是,企业非但没有实现人力成本缩减,反而新增了一笔难以预估的巨额算力账单。员工只是从"生产者"变成了"审核者"——企业并没有真正解放人力。

04定价困境:卖得贵用不起,卖得便宜亏不起

微软Copilot就是最典型的例子。原本对用户收取固定费用,Pro版月费10美元,Pro+收39美元。但AI Agent出现后,数据吞吐量更大,推理成本越来越高,几十美元的月费根本承载不了

2026年6月初,微软改政策了:超出一定数量后按量收费。全球开发者社群哀鸿遍野——重度依赖顶尖AI模型的工程师,基础额度几天就用完,AI使用费从39美元飙升至数百甚至数千美元。

💸 一个死循环 用户越多,亏得越多

  • AI公司不敢定高价——怕吓跑客户;但定低价又覆盖不了成本,用户越多亏得越多。
  • 卖Token不等于稳赚不赔——当算力是固定成本而收入是变量时,每一笔订单都在赌客户会不会用满。
  • 华尔街已经开始调转枪口——Token成本飙升对计划IPO的AI企业构成估值杀手,毛利率和盈利路径被严格审视。
  • 降价也无法解决问题——2026年7月30日,OpenAI宣布GPT-5.6 Luna降价80%,DeepSeek V4降至四分之一。但降价红利很快被用量吞噬。
OpenAI 2026年算力支出将达500亿美元。谷歌、微软、亚马逊、Meta四家2026年AI总投入预计7250亿美元,同比大增77%。目前唯一有望实现季度运营盈利的头部AI厂商是Anthropic

Token正在沿着IaaS的老路滑向零毛利。通用推理Token加速商品化,利润越来越薄。

05为什么说这不是技术问题,而是商业问题?

微软2026年5月取消大部分员工的Claude Code内部许可,8月出台Token预算目标——三个月内连出两记重拳。说明问题不是突发的,而是积累到一定程度后的集中爆发。

更深一层看,微软取消Claude Code还有一个不能明说的原因:Claude Code在微软内部太受欢迎了,风头盖过了自家的GitHub Copilot CLI。在开放Claude Code前,微软91%的工程团队用GitHub Copilot;开放后,使用率遭到"严重蚕食"。

一边是自家产品被竞品碾压,一边是竞品按Token计费、每用一次都要给Anthropic付钱。微软给OpenAI砸了130亿美元,还在Azure上为Anthropic搭建了大部分算力底座。结果自家工程师大规模调用Claude Code,等于在给最直接的竞品输血。看完账单后,这家市值3.5万亿美元的巨头决定不再当这个"冤大头"。

但即便是"内部核算成本"的GitHub Copilot,边际成本再低,也架不住海量消耗。所以才有了8月份的Token预算目标。

这一切指向一个残酷的结论:Token这门生意,巨头们自己都玩不转。不是技术不行,不是产品不好,是经济账算不过来。

编辑核心判断

Token成本失控的本质,不是AI不行,而是商业规律在发挥作用——任何技术从实验室走向大规模商业化,都要经历成本与价值重新匹配的阵痛。当每投入1美元只有18美分产生实际价值时,踩刹车不是退步,而是理性。

写在最后

IDC预测,2026年中国MaaS市场Token消耗量将达40000万亿,较2025年增长约20倍。用量还在涨,而且涨得飞快。
但问题是——谁来买单?

Token作为AI时代的核心资源,相当于互联网时代的网络流量、工业时代的能源。这些生产要素必须普惠低价,不能构成企业的主要运营成本。但现实是,Token还没有便宜到那个程度。也许再过几年,随着芯片产能释放、模型效率提升,Token真的会便宜到可以忽略不计。但至少现在,连卖AI的微软都扛不住了。