🧠 AI Infra · 趋势洞察

Agent 形态一年三变,Infra 该为谁而建?WAIC 2026 给出的答案是:先做好 Token

7 月 18 日,清程极智联合创始人师天麾在 WAIC 2026 上提出一个相对谨慎的判断:Agent Infra 长期看一定会变得重要,但现在还没有到真正爆发的阶段。当前 AI Infra 最确定的方向,仍然是围绕每一次模型调用,提高 Token 生产和交付的效率

综合公开信息整理 2026-07-22 全文约 4 分钟读完
#AI Infra #Agent #WAIC2026 #Token #推理引擎
≈82% 20 次连续调用成功率
(单次 99% 时)
1/10 缓存命中 vs 重新计算的成本比
6+ Agent 核心开发环节数

⚡ 30 秒速览

  • 核心矛盾:模型迭代过快,企业投入数月搭建的 Agent 可能被下一代模型能力覆盖,工程折旧加速,投资回收期不确定。
  • 当前最确定方向:提高 Token 生产和交付效率,而非过早押注一套通用 Agent Infra——后者仍面临范式未定的风险。
  • 缓存杠杆:命中率从 90% 降至 80%,未命中比例翻倍,实际成本增加远超数字本身——这是最容易被低估的变量。
  • 任务差异:Coding 场景长输入短输出,数学推理短输入长输出,两类任务需要不同的 Prefill/Decode 资源配置。
  • 国产芯片机会:Token 化交付将底层硬件差异封装为标准化服务,芯片竞争从"能不能跑模型"转向"单位成本能产出多少 Token"。

01两难境地 模型迭代太快,Agent 反而不敢投

过去一年,Agent 几乎成为大模型行业最密集的关键词。但与市场期待的"Agent 元年"相比,真正进入稳定生产环境的项目仍然有限。问题并不完全出在 Agent 的能力上——模型迭代过快,正在制造一种新的投资风险。

传统认知

Agent 落地慢是因为模型能力不足,需要更强的通用模型来支撑复杂任务。

现实矛盾

模型迭代太快,企业刚搭好的 Agent 工作流可能被新模型的原生能力覆盖,投资回收期高度不确定。

一个 Agent 系统通常需要经过以下环节才能稳定上线:

任务拆分将目标分解为可执行子任务
提示词设计为每个步骤撰写指令模板
工具接入集成搜索、代码执行、API 等
工作流编排设计步骤间的依赖与流转
评测建立自动化验证与评分体系
异常处理覆盖超时、失败、边界情况

每个环节都需要专业团队投入数周至数月。模型升级可能使部分环节失去意义——企业需要不断判断哪些能力应固化在 Agent 中,哪些将直接被通用模型提供。

02Agent 的压力,最终落在 Token 上

在普通聊天场景中,一次模型调用可能只包含一轮输入和输出。但在 Agent 系统中,一个用户请求可能触发十几次甚至更多模型调用。单次调用中的轻微延迟和失败,经过长链路放大后,会直接影响任务完成率。

从基础设施角度看,Agent 并没有创造一套完全不同的计算指标。真正发生变化的是这些指标的规模

并发量提高 多个 Agent、多个子任务同时运行,对集群调度和请求排队提出更高要求。
上下文变长 历史对话、工具描述、代码仓库和中间结果持续累积,输入 Token 数量不断增加。
调用链变长 单次请求可能触发数十次模型调用,链路可靠性成为瓶颈。
成本结构复杂 长上下文输入、失败重试、跨服务商切换,都可能带来额外成本。

假设一个任务需要连续调用模型 20 次,且每次成功率为 99%,在各次请求相互独立的简化情况下,完整链路一次成功的概率只有约 82%。Agent 的普及正在迫使推理服务从"平均可用"走向真正的工程级高可用。

03缓存:最被低估的成本杠杆

在大模型推理中,Prefill 阶段处理用户输入并生成 KV Cache,Decode 阶段根据已有状态逐个生成输出 Token。如果新一轮请求能够复用此前的 KV Cache,就无需重新计算全部输入——这是当前最直接、也最容易被低估的成本优化手段。

📉 缓存命中率从 90% 降至 80%,实际影响有多大?成本翻倍

  • 命中部分成本约为重新计算的 1/10,是当前最有效的降本杠杆。
  • 命中率从 90% 降至 80%,表面只下降 10 个百分点,但未命中比例从 10% 增至 20%,实际翻倍。
  • 由于未命中部分需要执行完整 Prefill 计算,成本增加通常显著高于命中率数字本身的变化
  • 缓存也限制了路由策略:频繁切换节点或供应商,KV Cache 可能无法复用,系统需要保持会话黏性。
关键判断:低价 Token 并不一定意味着更低的最终成本——如果服务商频繁超时、请求失败或无法复用缓存,企业可能需要不断重试,最终承担更高的实际费用。
命中缓存成本
10×未命中重新计算
90%高命中率场景
80%低命中率场景

缓存命中率是影响实际成本的关键变量,但常被采购环节忽略。企业在评估推理服务时,应关注缓存策略和会话亲和性,而不仅仅是单价。

04不同任务,需要不同的资源配置

随着推理模型通过更长的思考过程换取更高准确率,企业开始尝试为任务设置 Token、时间和调用次数上限。但真正进入生产环境后,单纯设置一个统一上限并不够——不同业务的输入输出比例存在明显差异。

💻

Coding 场景:长输入,短输出

模型需要读取大量代码、依赖关系和上下文,但最终只修改少量内容。输入输出比例可能达到 数十比一。Prefill 阶段压力大,需要更多计算资源处理上下文。

🧮

数学推理:短输入,长输出

输入相对简短,但模型需要进行较长的推理和结果生成,Decode 阶段的计算压力更大。输出 Token 数量远超输入。

这两类任务需要不同的 Prefill 与 Decode 资源配置。如果集群采用分离架构,就需要根据业务负载决定多少机器处理输入、多少负责生成输出。当 Prefill 资源不足时,长输入请求会排队,即使 Decode 资源空闲也无法完成任务。

企业从试验转向生产必须经历的一步:明确服务等级目标,包括首 Token 延迟(TTFT)、输出速度、并发能力、超时比例和高分位延迟,而不是管理一个模糊的"模型速度"。

05国产芯片的机会:把硬件变成 Token

过去,国产芯片落地面临的核心问题是使用门槛。企业购买服务器后,不仅要完成模型适配,还需要解决驱动、框架、算子、通信、精度和性能调优等一系列问题。即使芯片价格更低,如果部署周期长、稳定性不足,企业仍然可能选择软件生态更成熟的产品。

推理服务正在改变这一逻辑。当算力以 API 和 Token 的形式交付后,终端用户不再需要直接管理芯片。国产芯片与英伟达 GPU 产生的 Token,在调用方式上可以保持一致,底层硬件适配和性能优化则由专业服务商完成。

Token 化交付封装底层差异标准化服务降低使用门槛

从用户视角看,采购对象由一批服务器变成了具有明确价格、延迟和可靠性指标的模型服务。国产硬件的使用难度被封装在基础设施内部,芯片竞争也由"能不能运行模型",逐渐转向"单位成本能够稳定生产多少有效 Token"。

师天麾表示,从其接触的项目看,2026 年以来部分国产芯片的闲置情况已经明显改善,一些新型号在较大规模集群中甚至出现供应紧张。不过,Token 化交付并不会自动解决生态问题——模型兼容性、量化精度、推理吞吐和集群通信,仍然决定一款芯片能否获得持续负载。

对于国产算力而言,推理市场提供的真正机会,不是用户降低了对性能的要求,而是专业基础设施团队可以集中解决适配问题,再把底层差异封装成标准服务。

编辑核心判断

Agent 的普及不会让 Infra 变简单,反而会暴露推理基础设施中被单轮对话掩盖的所有问题。当一次请求扩展为数十次调用,平均延迟变成长链路等待,偶发失败变成任务中断——行业竞争的重点将落在推理效率、缓存管理和单位成本能交付多少可靠 Token 上。大模型决定了能力的上限,而基础设施决定了这种能力能否以企业可以承受的成本持续运行下去。

关注 AI Infra 方向

推理效率、缓存策略、服务路由与软硬件联合优化,正在成为 AI 基础设施竞争的核心赛点。Token 的稳定、可评估与规模化交付,是 Agent 时代真正到来的前提。

订阅 AI 基础设施深度分析