⚡ Token 经济 · 转折点

Token 经济转折点:从每天 400 美元账单到本地开源,Agent 进化三阶段揭示性价比拐点

去年年底硅谷掀起 Token Maxing 风潮,科技公司争相比拼 Token 消耗量。今年年中,Uber 四个月烧穿全年预算,Meta 被迫设定使用上限——转折点已至。亲历者黄东旭的账单从每天 400-500 美元降至 200-300 美元,关键变量是本地开源模型的崛起与 Agent 架构的系统性进化。

综合公开信息整理 2026-07-24 全文约 4 分钟读完
#Token经济 #AI Agent #OpenClaw #开源模型 #杰文斯悖论
🔻 转折 从 Token Maxing 到 Token Efficient
400200 日账单降幅,单位:美元
10× Token 成本每年降幅,超摩尔定律

⚡ 30 秒速览

  • 转折点已至:Uber 四个月烧穿全年 AI 预算,Meta 设 Token 上限,从"无脑用最强"到精打细算。
  • Agent 进化三阶段:OpenClaw(本地优先·极客火种)→ Hermes(Skill 沉淀·团队打磨)→ Slock/Raft(多 Agent 协同·动力学)。
  • 本地开源崛起:DeepSeek V4 在 Mac Studio 上跑出 30 Token/s,月电费仅二三十美元——日常任务可"只烧电费,不烧 Token"。
  • 杰文斯悖论:技术越成熟、价格越低,消耗量反而越大——Agent 的 Token 消耗不会停止,只会升级。
  • 编辑判断:系统工程能力正在超过参数比拼,但 Token 的"性价比赛跑"是一场永无止境的进化。

01从烧钱到精打细算 Token Maxing 的退潮

去年年底,硅谷掀起一股 Token Maxing 热潮——创始人与工程师争相晒出天价账单,以此彰显对 AI 的全力押注。黄东旭是亲历者之一:"我当时属于'无脑用最强',每天账单 400-500 美元,用 Opus 从 0 到 1 构建分布式数据库。"

但转折来得比预期更快。

Uber 在四个月里烧穿了全年的 AI 预算,Meta 被迫给员工设定 Token 使用上限,Stripe 内部弹窗提醒"Opus 4.8 很贵,可以先试试其他模型"。成本失控与虚假生产力,让这场烧钱竞赛到达了转折点。

Token Maxing 模式

永远选最强模型,不惜代价。适合探索边界,但成本不可控,容易产生大量无效调用。

Token Efficient 模式

前沿模型 + 本地开源模型协同分工。日常任务用本地模型"只烧电费",复杂任务才调最强 API。

注:两种模式并非替代关系,而是场景分化。Token Maxing 在探索性任务中仍有价值,Token Efficient 更适合规模化日常使用。

张宏江从宏观视角给出了判断:"Token 成本过去几年一直是每年降 10 倍,远超摩尔定律。技术成熟时成本会大规模降低,但使用量增长远超成本降低——市场反而越来越大。"

但真正让黄东旭转变的,不是成本压力,而是模型能力的结构性变化。

02Agent 进化三阶段 从 OpenClaw 到多 Agent 协同

过去半年,Agent 产品经历了三次迭代,每一次都重新定义了"智能体能做什么"。

🔥 OpenClaw · 普罗米修斯之火 本地优先·开源

  • Peter 一人一周做出——大模型能力过坎的标志:让架构师级别的工程师能在极短时间内做出一个系统。
  • Local-first 理念:所有隐私数据配置在本地,极客圈子天然拥抱。如同当年的 Linux,开源传播力极强。
  • 历史使命已完成:把"Agent 连接现实世界"的产品形态带给世人,但配置复杂、稳定性不足,且缺乏持续资源投入。
张宏江评价:「当大势准备好之后,需要一个人捅破一张纸,OpenClaw 正好捅破了这张纸。」

🧠 Hermes · Skill 沉淀者 团队打磨·Web3 基因

  • 巧妙绕过记忆难题:通过持续总结成功经验变成 Skill,用一段时间会发现 Agent 长出了很多"最佳实践"。
  • 精心设计的软件架构:上手流程与稳定性远超 OpenClaw,是团队系统打磨的产物,而非极客实验。
  • 商业模式清晰:用户量即议价权——帮模型厂商带 Token 消耗,以更低折扣获取算力,成为"兵家必争的入口"。
黄东旭:「Hermes 的 Agent 框架里有一个很强的倾向——不停地总结成功经验变成 skill,这一点很关键。」

🌐 Slock / Raft · 多 Agent 动力学 协同涌现·深度审查

  • 10 个顶级模型 Agent 组队:互相不分享运行上下文,只在聊天频道交换信息——80-90% 是"车轱辘话",但偶然的 insight 会触发新一轮讨论。
  • 复杂代码审查场景:多 Agent 协同挑刺,互相启发,迭代深度远超单个模型 One-shot 的效果——代价是 Token 消耗量提升 10 倍。
  • "Agent 动力学":如何让一个 Agent 在特定任务上持续不停地干活,同时让多个 Agent 之间产生有价值的涌现行为。
黄东旭:「你会发现它比单个模型在 One-shot 上 review 代码挑出的问题和改进深度完全不一样。」

注:三款 Agent 并非线性替代关系,而是代表了不同设计哲学——OpenClaw 极简主义、Hermes 工程化、Slock 群体智能。当前生态中三者并存。

03成本账:从每天 400 美元到 200 美元 本地模型解锁了什么

让黄东旭账单大幅下降的,是两件事同时发生:Fable 5 等前沿模型的绝对智商碾压,以及 DeepSeek V4 等开源模型在本地跑出了可用质量。

"不是前沿模型用不起,而是本地开源 + 前沿模型的搭配,成本可控,更具性价比。"

400-500美元/天 · 纯 API 时期
200-300美元/天 · 混合模式
20-30美元/月 · 本地电费成本
30Token/s · 本地推理速度

注:以上数据为黄东旭个人实测,基于 Mac Studio 运行 DeepSeek V4 Flash 模型。本地推理速度与硬件配置强相关,电费按满载运行估算。

开源模型解锁了两类以前"不敢做"的事:大量重复性日常工作(邮件处理、信息汇总),以及 高消耗的批量任务(如通读 CVPR 几百篇论文并用工作流持续跑)。"并不是掏不起几百美金,而是觉得不受控制——你不知道它会跑出多少 API 调用。"

"以前我不敢让 Opus 放开干的事情,现在在本地模型上跑一个工作流,让它持续跑着就行。成本在它完成的任务面前,可以忽略不计。"

—— 黄东旭,Llama Ventures 合伙人

但一个诚实的注脚是:Agent 的 Token 消耗总量不会下降。黄东旭强调:"Agentic Loop 让 Token 消耗比 Chatbot 时代涨了 100 倍不止。未来面对更复杂的问题,必然出现多 Agent 协同与分层架构,Token 消耗还会上台阶。"

注:Agentic Loop 即智能体内部循环——每轮循环调用大模型、执行工具、将输出注入上下文。复杂长程任务可能循环几百步,每一步都有大量 Token 消耗。

04为什么是现在?模型能力的结构性跨越

张宏江认为,智能的转折点——奇点已经到来。"过去 6 个月发布的模型,在 IQ 测试上已经站在人类平均值的右边。机器的学习能力超越了人的学习能力,你赶不上它了。"

这一判断有三个现实支撑:

Fable 5 绝对智商碾压 DeepSeek V4 本地可用 GLM-5.2 开源再突破 GPT 5.5 能力跃升

黄东旭用一个具体场景说明了这种跨越:一群 Agent 讨论了半天没有结论的问题,直接丢给 Fable 5,一次就精准搞定了。"它甚至没有之前的上下文,是绝对的智商碾压。"

这种能力分层催生了 管理学意义上的分工:顶级模型做决策与复杂推理,本地开源模型做执行与批量处理。两者协同,既保质量又控成本。

"今天做 Agent 是好时机,但关键是:别做容易被大模型碾压的应用。你的护城河应该是垂直数据、企业 know-how、或者基础设施层的工程能力。"

—— 张宏江,Llama Ventures 高级技术合伙人

黄东旭补充了一个判断标准:Agent Native 的试金石——把 AI 或 Agent 的元素去掉,如果这件事仍然成立,那你就不是 AI Native。真正 native 的企业,去掉 Agent 后成本会涨一千倍,或者根本做不成。

编辑核心判断

Agent 时代,系统工程能力正在超过模型参数比拼——但 Token 消耗的杰文斯悖论告诉我们,每一次成本优化都会解锁新的消耗场景,这场"性价比赛跑"没有终点,只有不断升级的智能复杂度。