Agent Infra 还没到爆发期,Token 效率才是当前最确定的方向
7月18日,清程极智联合创始人师天麾在WAIC 2026现场提出一个冷静判断:Agent Infra 长期看一定会变得重要,但现在还没有到真正爆发的阶段。当前AI Infra最确定、也最值得投入的方向,仍然是围绕每一次模型调用,提高Token生产和交付的效率。
7月18日,清程极智联合创始人师天麾在WAIC 2026现场提出一个冷静判断:Agent Infra 长期看一定会变得重要,但现在还没有到真正爆发的阶段。当前AI Infra最确定、也最值得投入的方向,仍然是围绕每一次模型调用,提高Token生产和交付的效率。
过去一年,Agent 从工作流编排、低代码平台,到 Coding Agent、多 Agent 协作,形态不断变化。但真正进入稳定生产环境的项目仍然有限。
问题并不全出在模型能力上。恰恰相反——模型迭代过快,可能抑制企业和创业公司对 Agent 的长期投入。
团队投入数月完成的系统,可能在下一代模型推出后,被模型原生的推理、工具调用或代码能力部分替代。
Agent 发展不及预期,是因为模型能力还不够强,无法完成复杂任务。
模型升级带来的不确定性,正在提高 Agent 项目的工程折旧速度。企业需要不断判断哪些能力该固化在 Agent 中,哪些未来会由模型直接提供。
但师天麾认为,Agent 仍然具有两个现实优势:稳定和成本可控。企业可以选择规模更小的开源模型,叠加行业数据、知识库和微调,在特定任务上接近大模型水平,同时显著降低推理成本。
注:Agent 的价值未必来自绝对能力超过通用模型,而可能来自对特定场景的约束、稳定输出和成本控制。
在普通聊天场景中,一次模型调用只包含一轮输入和输出。但在 Agent 系统中,一个任务被拆解成多个步骤,涉及规划、工具选择、搜索、代码执行、校验和反思——一个用户请求可能触发十几次甚至更多模型调用。
从基础设施看,Agent 没有创造完全不同的计算指标,但四个维度的规模发生了量级变化:
注:四个维度相互叠加——并发放大了延迟敏感度,长上下文增加了 Prefill 计算量,长调用链使偶发失败变成系统性问题,复杂成本结构让单纯的 Token 单价失去参考意义。
师天麾特别指出,缓存命中率是最容易被低估、却直接影响成本的一项指标。在代码生成或多轮对话中,新一轮请求往往保留前一轮大部分内容。如果 KV Cache 能够复用,就不需要重新计算全部输入。
大模型推理分为 Prefill 和 Decode 两个阶段。Prefill 处理用户输入并生成 KV Cache,Decode 基于缓存逐 Token 输出。缓存命中的输入成本,可能只有重新计算的约十分之一。
一个反直觉的数字:
缓存也限制了路由策略。系统可以把请求实时发送给最空闲、最便宜的服务商,但如果频繁切换节点或供应商,原有 KV Cache 可能无法复用。一个成熟的多模型路由系统需要同时考虑实时负载、成功率、模型质量和缓存亲和性,在一段时间内保持会话黏性。
注:缓存命中率从 90% 降至 80%,未命中比例翻倍,实际成本增幅接近 50%。这是 Agent 场景下最容易被忽视的成本陷阱。
当前市场按模型名称和 Token 数量报价,容易让用户产生错觉:同一个模型、同样数量的 Token,在不同服务商之间是可以相互替换的。
但现实并非如此。
即便使用相同硬件、相同模型权重和相同推理框架,不同团队部署出的服务在延迟、吞吐和模型精度上也可能存在显著差异。批处理策略、并行方式、算子实现、采样参数、缓存管理和量化方式,都会影响最终结果。
师天麾将当前模型服务形容为一种"黑盒":用户在测试前很难知道服务的真实水平,而个人开发者和中小企业通常缺少系统测试能力。
注:柱形为各变量对最终服务表现的影响程度示意,非精确量化。实际差异因部署场景和模型类型而异。
清程极智搭建的 AI Ping 评测平台,持续监测 30 多家服务商、600 多个模型服务,覆盖延迟、吞吐和可靠性等指标。这类评测的存在本身说明:大模型服务仍缺少被广泛接受的统一质量标准。
对于 Agent 而言,可靠性尤其重要。单轮聊天 98% 的成功率可能尚可接受,但在连续多步任务中,任意一次失败都可能导致整个流程重试或中断。Agent 的普及,正在迫使推理服务从"平均可用"走向真正的工程级高可用。
推理框架是连接模型和硬件的关键中间层。目前 vLLM、SGLang 等开源框架主要围绕英伟达 GPU 的软件栈和内存体系设计。国产芯片可以对这些框架进行移植,但"能够运行"不等于"能够充分发挥硬件性能"。
师天麾将其比喻为:为烤面包设计的烤箱经过改造后也许能够蒸馒头,但与其持续改造,不如针对目标需求重新设计蒸锅。
推理服务正在改变国产芯片的落地逻辑。当算力以 API 和 Token 的形式交付后,终端用户不再需要直接管理芯片。国产芯片与英伟达 GPU 产生的 Token,在调用方式上可以保持一致,底层适配和性能优化则由专业服务商完成。
从用户视角看,采购对象从一批服务器变成了具有明确价格、延迟和可靠性指标的模型服务。国产硬件的使用难度被封装在基础设施内部,芯片竞争也由"能不能运行模型",逐渐转向"单位成本能够稳定生产多少有效 Token"。
师天麾表示,从其接触的项目看,2026 年以来部分国产芯片的闲置情况已经明显改善,一些新型号在较大规模集群中甚至出现供应紧张。不过,Token 化交付并不会自动解决生态问题——模型兼容性、量化精度、集群通信和长期稳定性,仍然决定一款芯片能否获得持续负载。
Agent 的快速发展没有让 AI Infra 变得不再重要,反而暴露了推理基础设施中此前被单轮对话掩盖的问题:当一次请求扩展为数十次调用,平均延迟会变成长链路等待,偶发失败会变成任务中断,较低的缓存命中率会演变为显著的成本差异。Agent Infra 当前最迫切的任务,不是构造一个全新的概念层,而是先把 Token 变成真正稳定、可评估和可规模交付的基础资源。大模型决定了能力的上限,而基础设施决定了这种能力能否以企业可以承受的成本,持续运行下去。
清程极智 AI Ping 评测平台持续监测 30+ 服务商与 600+ 模型服务,覆盖延迟、吞吐、可靠性和缓存效率等关键指标,帮助开发者和企业看清 Token 服务的真实表现。
访问 AI Ping 平台 → 查看实时评测