Agent 成本失控背后:Token 单价降了,企业账单为何反而涨了?
WAIC 2026 期间,两位技术专家拆解了 Agent 从 Demo 到生产环境的成本真相。结论是:企业真正需要控制的不是 Token 数量,而是一次有效任务所消耗的全部资源。
WAIC 2026 期间,两位技术专家拆解了 Agent 从 Demo 到生产环境的成本真相。结论是:企业真正需要控制的不是 Token 数量,而是一次有效任务所消耗的全部资源。
一次普通对话只调用一次模型,但一次 Agent 任务背后,往往包含目标理解、任务拆解、信息检索、工具调用、上下文读取、记忆存储和结果验证。任何一个环节出偏差,Agent 都可能重新规划、重新调用,甚至从头执行。
两种模式的成本结构,差异巨大:
一问一答,单次调用,无状态。上下文极短,无需人工审核,失败成本低——答错了重问一次即可。
目标拆解→工具调用→上下文累积→结果验证→失败重试。多重调用链,上下文持续膨胀,每次失败都浪费整条链路的资源。
注:一次 Agent 任务的平均 Token 消耗可能是单次聊天的 10–50 倍,且失败后重试的边际成本几乎与首次持平。
Token 账单至少是可见的。更难处理的是那些没有直接出现在云平台账单里的隐性成本。两位专家一致认为,以下三笔最容易被低估:
当企业面对多个模型时,一个常见问题是:应该选择单价更低但成功率一般的模型,还是选择价格更高但任务完成率更高的模型?两位嘉宾的答案都很明确:先看成功率。
更合理的路径,是一条清晰的优化链路:
以信用审核为例:图片识别和信息提取已经是相对成熟、固定的任务,没必要每次都调用最强的大模型;只有最终的综合分析和结论生成,才需要能力更强的模型。成本优化不是简单地将所有模型替换为低价模型,而是在任务成功的前提下,为每个环节配置合适的工具。
注:张文涛建议,企业应先使用能力较强的模型跑通工作流,证明 AI 确实能解决问题;随后再拆解流程,判断哪些环节存在「智力过剩」,可以替换成更便宜的小模型、传统程序或固定规则。
王凯用一个类比做了总结:如果一辆无人车价格为 50 万元,但仍然需要一名司机全程坐在车内,那么企业同时承担了车辆和人员两份成本,自然显得昂贵。当前许多企业使用 AI 的状态,正类似于「车里的人还没有离开」——AI 已经产生了成本,但原有人员和流程并未减少。
当 AI 从个别员工的实验变成企业级工具,成本问题也会逐渐转化为治理问题:谁来承担费用,如何分配预算,是否限制 Token,以及怎样判断一个团队用得过多还是过少。
「企业不能只向所有员工发放同一个 Key,之后既不知道谁在使用,也无法在成本异常时关闭水龙头。」 —— 王凯
企业至少需要具备用量可见、日志审计、多 Key 管理、限速和限流等基础能力。没有这些,成本优化无从谈起。
传统企业转型初期可适度鼓励使用;AI 制药等创新研发应采用项目预算管理,允许试错但设置上限;稳定生产流程需持续计算单位产出和单位成本。
企业真正需要的不是为了「多模型」而多模型,而是一套清晰的编排架构,确保某项服务被替换后,其他环节仍能正常运行。模型本身高速迭代,切换将成为常态化操作。
张文涛补充:企业应将自身积累的工作流程、提示词、规则和操作经验沉淀为可迁移的 Skill,而不是将核心能力完全绑定在某一款工具中。
Agent 越来越聪明并不必然意味着企业成本越来越低。只有当任务目标被定义清楚、工作流程可以被评价、模型能够被替换、使用成本可以被看见,并且 AI 真正替代了原有环节,Token 单价的下降才可能转化为企业实际成本的下降。否则,企业购买的可能不是生产力,而是一场不断追加预算的试验。
对于大多数企业而言,更稳妥的办法是逐环节拆解:先找到可以被清晰评价和稳定替代的任务,再逐步引入 AI。
而不是一开始就将全部生产流程交给模型。