💰 AI基础设施 · 成本深度

Agent 成本失控背后:Token 单价降了,企业账单为何反而涨了?

WAIC 2026 期间,两位技术专家拆解了 Agent 从 Demo 到生产环境的成本真相。结论是:企业真正需要控制的不是 Token 数量,而是一次有效任务所消耗的全部资源。

综合公开信息整理 2026-07-22 全文约 4 分钟读完
#AI Agent #成本控制 #WAIC2026 #企业基础设施
3 笔 隐性账单:上下文膨胀 / 人工审核 / 维护成本
2 位 技术专家:优刻得 × 焱融科技 CTO 深度对话
1 个 核心原则:先看任务成功率,再看 Token 单价

⚡ 30 秒速览

  • 单价降了,总账涨了:Token 价格持续下降,但 Agent 任务链变长、上下文膨胀、人工审核与维护成本同步上升,企业总账单不降反升。
  • 三笔隐性账单:上下文累积导致的计算资源膨胀、AI 生成代码的审查与验收、长期可维护性的持续投入——每一项都不在 Token 账单上。
  • 先看成功率,再看单价:失败的调用不仅浪费模型费用,更让人沿着错误方向重复试错。企业应先跑通流程,再逐环节优化。
  • 治理不能只发一个 Key:用量可见、日志审计、多 Key 管理和预算分配是成本可控的前提。企业不能对使用情况一无所知。

01传统聊天 vs Agent 任务 成本结构完全不同

一次普通对话只调用一次模型,但一次 Agent 任务背后,往往包含目标理解、任务拆解、信息检索、工具调用、上下文读取、记忆存储和结果验证。任何一个环节出偏差,Agent 都可能重新规划、重新调用,甚至从头执行。

两种模式的成本结构,差异巨大:

传统聊天

一问一答,单次调用,无状态。上下文极短,无需人工审核,失败成本低——答错了重问一次即可。

Agent 任务

目标拆解→工具调用→上下文累积→结果验证→失败重试。多重调用链,上下文持续膨胀,每次失败都浪费整条链路的资源

注:一次 Agent 任务的平均 Token 消耗可能是单次聊天的 10–50 倍,且失败后重试的边际成本几乎与首次持平。

02三笔隐性账单 企业最容易漏算的成本

Token 账单至少是可见的。更难处理的是那些没有直接出现在云平台账单里的隐性成本。两位专家一致认为,以下三笔最容易被低估:

🧠 上下文膨胀 计算资源推高

  • 记忆持续累积:对话历史、任务状态、外部数据不断写入 Memory,每次模型调用携带的上下文越来越长。
  • KV Cache 压力激增:上下文叠加推动计算资源快速增加,同一任务后期的调用成本远高于初期。
  • 缺少压缩机制:如果缺少记忆压缩、摘要提取和缓存策略,成本会随任务链指数级上升。
王凯判断:上下文管理将成为推理基础设施的关键环节,谁先解决膨胀问题,谁就掌握了成本优化的主动权。

👁️ 人工审核 人没有离开

  • 代码审查不可跳过:AI 生成代码后,工程师仍需进行审查、测试、安全检查和结果验收。
  • 错误判断成本最高:失败的调用不仅浪费 Token,更让人沿着错误方向继续重试,时间成本远超模型费用。
  • 「车里的人还没有离开」:AI 已产生成本,但原有人员和流程并未减少——企业同时承担两份支出。
张文涛指出:不能因为有了 AI 就认为所有事情都应该很快、很容易,人仍然是成本结构中不可替代的一环。

🔧 维护成本 长期可维护性

  • AI 代码需要 AI 维护:生成式代码的长期可维护性存疑,企业必须建立评价、更新和纠错的完整体系。
  • 流程固化前的试错成本:目标尚未确定、流程尚未稳定时的重复试错,是账单失控的最大源头。
  • 工具链依赖风险:Agent 框架、模型和工具可能停止维护或版本更新,企业需沉淀可迁移的 Skill。
核心共识:企业引入 AI 的第一阶段,核心问题是任务能否真正完成,而不是完成得是否足够便宜。

03先跑通,再优化 任务成功率才是第一指标

当企业面对多个模型时,一个常见问题是:应该选择单价更低但成功率一般的模型,还是选择价格更高但任务完成率更高的模型?两位嘉宾的答案都很明确:先看成功率。

更合理的路径,是一条清晰的优化链路:

定义任务目标用强模型跑通流程拆解环节识别"智力过剩"替换为小模型/规则持续度量 ROI

以信用审核为例:图片识别和信息提取已经是相对成熟、固定的任务,没必要每次都调用最强的大模型;只有最终的综合分析和结论生成,才需要能力更强的模型。成本优化不是简单地将所有模型替换为低价模型,而是在任务成功的前提下,为每个环节配置合适的工具。

注:张文涛建议,企业应先使用能力较强的模型跑通工作流,证明 AI 确实能解决问题;随后再拆解流程,判断哪些环节存在「智力过剩」,可以替换成更便宜的小模型、传统程序或固定规则。

王凯用一个类比做了总结:如果一辆无人车价格为 50 万元,但仍然需要一名司机全程坐在车内,那么企业同时承担了车辆和人员两份成本,自然显得昂贵。当前许多企业使用 AI 的状态,正类似于「车里的人还没有离开」——AI 已经产生了成本,但原有人员和流程并未减少。

04企业不能只发一个 Key 治理是成本可控的前提

当 AI 从个别员工的实验变成企业级工具,成本问题也会逐渐转化为治理问题:谁来承担费用,如何分配预算,是否限制 Token,以及怎样判断一个团队用得过多还是过少。

「企业不能只向所有员工发放同一个 Key,之后既不知道谁在使用,也无法在成本异常时关闭水龙头。」 —— 王凯

📊

用量可见 + 日志审计

企业至少需要具备用量可见、日志审计、多 Key 管理、限速和限流等基础能力。没有这些,成本优化无从谈起。

🎯

不同类型团队,不同管理方式

传统企业转型初期可适度鼓励使用;AI 制药等创新研发应采用项目预算管理,允许试错但设置上限;稳定生产流程需持续计算单位产出和单位成本。

🔄

可替换性比多模型更重要

企业真正需要的不是为了「多模型」而多模型,而是一套清晰的编排架构,确保某项服务被替换后,其他环节仍能正常运行。模型本身高速迭代,切换将成为常态化操作。

张文涛补充:企业应将自身积累的工作流程、提示词、规则和操作经验沉淀为可迁移的 Skill,而不是将核心能力完全绑定在某一款工具中。

编辑核心判断

Agent 越来越聪明并不必然意味着企业成本越来越低。只有当任务目标被定义清楚、工作流程可以被评价、模型能够被替换、使用成本可以被看见,并且 AI 真正替代了原有环节,Token 单价的下降才可能转化为企业实际成本的下降。否则,企业购买的可能不是生产力,而是一场不断追加预算的试验。

对于大多数企业而言,更稳妥的办法是逐环节拆解:先找到可以被清晰评价和稳定替代的任务,再逐步引入 AI。

而不是一开始就将全部生产流程交给模型。

先定义成功,再衡量成本