AI·快讯
🧠 基础设施 · 现场直击

Agent Infra 还没到爆发期,Token 效率才是当前最确定的方向

7月18日,清程极智联合创始人师天麾在WAIC 2026现场提出一个冷静判断:Agent Infra 长期看一定会变得重要,但现在还没有到真正爆发的阶段。当前AI Infra最确定、也最值得投入的方向,仍然是围绕每一次模型调用,提高Token生产和交付的效率

WAIC 2026 现场报道 2026-07-22 全文约 4 分钟读完
#Agent Infra #Token效率 #推理缓存 #国产芯片 #WAIC2026
⏳ 未到爆发期 Agent Infra 长期重要,但当前焦点在 Token 效率
10× 缓存命中 vs 未命中,输入成本差距
82% 20 次连续调用,99% 单次成功率下的完整链路成功率

⚡ 30 秒速览

  • 核心判断:Agent Infra 尚未到爆发期,当前最确定的方向是提高 Token 生产与交付效率。
  • 为什么谨慎:模型迭代过快,企业投入数月搭建的 Agent 可能被下个版本的原生能力覆盖,工程折旧速度加快。
  • 压力落在 Token 上:Agent 场景下并发量、上下文长度、调用链长度和成本结构都发生量级变化。
  • 缓存被低估:命中率从 90% 降到 80%,未命中比例翻倍,实际成本增加远超 10 个百分点。
  • Token 不是标准化商品:相同模型、硬件、框架,不同团队部署结果差异显著,行业缺少统一质量标准。

01模型越强,Agent 投资反而越谨慎

过去一年,Agent 从工作流编排、低代码平台,到 Coding Agent、多 Agent 协作,形态不断变化。但真正进入稳定生产环境的项目仍然有限。

问题并不全出在模型能力上。恰恰相反——模型迭代过快,可能抑制企业和创业公司对 Agent 的长期投入。

团队投入数月完成的系统,可能在下一代模型推出后,被模型原生的推理、工具调用或代码能力部分替代。

传统认知

Agent 发展不及预期,是因为模型能力还不够强,无法完成复杂任务。

现场判断

模型升级带来的不确定性,正在提高 Agent 项目的工程折旧速度。企业需要不断判断哪些能力该固化在 Agent 中,哪些未来会由模型直接提供。

但师天麾认为,Agent 仍然具有两个现实优势:稳定成本可控。企业可以选择规模更小的开源模型,叠加行业数据、知识库和微调,在特定任务上接近大模型水平,同时显著降低推理成本。

注:Agent 的价值未必来自绝对能力超过通用模型,而可能来自对特定场景的约束、稳定输出和成本控制。

02Agent 带来的压力,最终落在 Token 上

在普通聊天场景中,一次模型调用只包含一轮输入和输出。但在 Agent 系统中,一个任务被拆解成多个步骤,涉及规划、工具选择、搜索、代码执行、校验和反思——一个用户请求可能触发十几次甚至更多模型调用。

从基础设施看,Agent 没有创造完全不同的计算指标,但四个维度的规模发生了量级变化:

⬆ 并发多个 Agent 与子任务同时运行,集群调度压力倍增
⬆ 上下文历史对话、工具描述、代码仓库、中间结果,输入 Token 持续增加
⬆ 调用链单次 99% 成功率,20 次后完整链路成功率降至约 82%
⬆ 成本结构长上下文输入、重复计算、失败重试,成本构成趋于复杂

注:四个维度相互叠加——并发放大了延迟敏感度,长上下文增加了 Prefill 计算量,长调用链使偶发失败变成系统性问题,复杂成本结构让单纯的 Token 单价失去参考意义。

师天麾特别指出,缓存命中率是最容易被低估、却直接影响成本的一项指标。在代码生成或多轮对话中,新一轮请求往往保留前一轮大部分内容。如果 KV Cache 能够复用,就不需要重新计算全部输入。

03缓存:最被低估的成本杠杆

大模型推理分为 Prefill 和 Decode 两个阶段。Prefill 处理用户输入并生成 KV Cache,Decode 基于缓存逐 Token 输出。缓存命中的输入成本,可能只有重新计算的约十分之一

一个反直觉的数字:

📉 缓存命中率从 90% 降到 80%,实际成本影响远超 10%

  • 表面变化:命中率下降 10 个百分点,从 90% 到 80%。
  • 实际变化:未命中比例从 10% 增加到 20%,翻了一倍。未命中部分需要执行完整 Prefill 计算。
  • 成本放大:假设缓存命中成本为 1,未命中成本为 10,总成本从 1.9 升至 2.8,增幅约 47%
关键洞察:缓存命中率的小幅下降,会因未命中部分的成本杠杆效应,被显著放大。

缓存也限制了路由策略。系统可以把请求实时发送给最空闲、最便宜的服务商,但如果频繁切换节点或供应商,原有 KV Cache 可能无法复用。一个成熟的多模型路由系统需要同时考虑实时负载、成功率、模型质量和缓存亲和性,在一段时间内保持会话黏性。

注:缓存命中率从 90% 降至 80%,未命中比例翻倍,实际成本增幅接近 50%。这是 Agent 场景下最容易被忽视的成本陷阱。

04Token 还不是标准化商品

当前市场按模型名称和 Token 数量报价,容易让用户产生错觉:同一个模型、同样数量的 Token,在不同服务商之间是可以相互替换的。

但现实并非如此。

即便使用相同硬件、相同模型权重和相同推理框架,不同团队部署出的服务在延迟、吞吐和模型精度上也可能存在显著差异。批处理策略、并行方式、算子实现、采样参数、缓存管理和量化方式,都会影响最终结果。

师天麾将当前模型服务形容为一种"黑盒":用户在测试前很难知道服务的真实水平,而个人开发者和中小企业通常缺少系统测试能力。

⚙️ 量化是最典型的变量FP8 → INT8 / INT4
精度下降
批处理策略动态 batching vs 静态 batching
吞吐差异
缓存管理LRU vs 前缀感知
命中率差距
采样参数temperature / top_p 不同
输出分布偏移

注:柱形为各变量对最终服务表现的影响程度示意,非精确量化。实际差异因部署场景和模型类型而异。

清程极智搭建的 AI Ping 评测平台,持续监测 30 多家服务商、600 多个模型服务,覆盖延迟、吞吐和可靠性等指标。这类评测的存在本身说明:大模型服务仍缺少被广泛接受的统一质量标准。

对于 Agent 而言,可靠性尤其重要。单轮聊天 98% 的成功率可能尚可接受,但在连续多步任务中,任意一次失败都可能导致整个流程重试或中断。Agent 的普及,正在迫使推理服务从"平均可用"走向真正的工程级高可用。

05国产芯片的机会:把硬件变成 Token

推理框架是连接模型和硬件的关键中间层。目前 vLLM、SGLang 等开源框架主要围绕英伟达 GPU 的软件栈和内存体系设计。国产芯片可以对这些框架进行移植,但"能够运行"不等于"能够充分发挥硬件性能"。

师天麾将其比喻为:为烤面包设计的烤箱经过改造后也许能够蒸馒头,但与其持续改造,不如针对目标需求重新设计蒸锅。

推理服务正在改变国产芯片的落地逻辑。当算力以 API 和 Token 的形式交付后,终端用户不再需要直接管理芯片。国产芯片与英伟达 GPU 产生的 Token,在调用方式上可以保持一致,底层适配和性能优化则由专业服务商完成。

芯片硬件推理引擎Token 服务API 调用用户应用

从用户视角看,采购对象从一批服务器变成了具有明确价格、延迟和可靠性指标的模型服务。国产硬件的使用难度被封装在基础设施内部,芯片竞争也由"能不能运行模型",逐渐转向"单位成本能够稳定生产多少有效 Token"

师天麾表示,从其接触的项目看,2026 年以来部分国产芯片的闲置情况已经明显改善,一些新型号在较大规模集群中甚至出现供应紧张。不过,Token 化交付并不会自动解决生态问题——模型兼容性、量化精度、集群通信和长期稳定性,仍然决定一款芯片能否获得持续负载。

编辑核心判断

Agent 的快速发展没有让 AI Infra 变得不再重要,反而暴露了推理基础设施中此前被单轮对话掩盖的问题:当一次请求扩展为数十次调用,平均延迟会变成长链路等待,偶发失败会变成任务中断,较低的缓存命中率会演变为显著的成本差异。Agent Infra 当前最迫切的任务,不是构造一个全新的概念层,而是先把 Token 变成真正稳定、可评估和可规模交付的基础资源。大模型决定了能力的上限,而基础设施决定了这种能力能否以企业可以承受的成本,持续运行下去。

了解 Token 服务的真实水平

清程极智 AI Ping 评测平台持续监测 30+ 服务商与 600+ 模型服务,覆盖延迟、吞吐、可靠性和缓存效率等关键指标,帮助开发者和企业看清 Token 服务的真实表现。

访问 AI Ping 平台 → 查看实时评测