Agent 形态一年三变,Infra 该为谁而建?WAIC 2026 给出的答案是:先做好 Token
7 月 18 日,清程极智联合创始人师天麾在 WAIC 2026 上提出一个相对谨慎的判断:Agent Infra 长期看一定会变得重要,但现在还没有到真正爆发的阶段。当前 AI Infra 最确定的方向,仍然是围绕每一次模型调用,提高 Token 生产和交付的效率。
(单次 99% 时)
7 月 18 日,清程极智联合创始人师天麾在 WAIC 2026 上提出一个相对谨慎的判断:Agent Infra 长期看一定会变得重要,但现在还没有到真正爆发的阶段。当前 AI Infra 最确定的方向,仍然是围绕每一次模型调用,提高 Token 生产和交付的效率。
过去一年,Agent 几乎成为大模型行业最密集的关键词。但与市场期待的"Agent 元年"相比,真正进入稳定生产环境的项目仍然有限。问题并不完全出在 Agent 的能力上——模型迭代过快,正在制造一种新的投资风险。
Agent 落地慢是因为模型能力不足,需要更强的通用模型来支撑复杂任务。
模型迭代太快,企业刚搭好的 Agent 工作流可能被新模型的原生能力覆盖,投资回收期高度不确定。
一个 Agent 系统通常需要经过以下环节才能稳定上线:
每个环节都需要专业团队投入数周至数月。模型升级可能使部分环节失去意义——企业需要不断判断哪些能力应固化在 Agent 中,哪些将直接被通用模型提供。
在普通聊天场景中,一次模型调用可能只包含一轮输入和输出。但在 Agent 系统中,一个用户请求可能触发十几次甚至更多模型调用。单次调用中的轻微延迟和失败,经过长链路放大后,会直接影响任务完成率。
从基础设施角度看,Agent 并没有创造一套完全不同的计算指标。真正发生变化的是这些指标的规模:
假设一个任务需要连续调用模型 20 次,且每次成功率为 99%,在各次请求相互独立的简化情况下,完整链路一次成功的概率只有约 82%。Agent 的普及正在迫使推理服务从"平均可用"走向真正的工程级高可用。
在大模型推理中,Prefill 阶段处理用户输入并生成 KV Cache,Decode 阶段根据已有状态逐个生成输出 Token。如果新一轮请求能够复用此前的 KV Cache,就无需重新计算全部输入——这是当前最直接、也最容易被低估的成本优化手段。
缓存命中率是影响实际成本的关键变量,但常被采购环节忽略。企业在评估推理服务时,应关注缓存策略和会话亲和性,而不仅仅是单价。
随着推理模型通过更长的思考过程换取更高准确率,企业开始尝试为任务设置 Token、时间和调用次数上限。但真正进入生产环境后,单纯设置一个统一上限并不够——不同业务的输入输出比例存在明显差异。
模型需要读取大量代码、依赖关系和上下文,但最终只修改少量内容。输入输出比例可能达到 数十比一。Prefill 阶段压力大,需要更多计算资源处理上下文。
输入相对简短,但模型需要进行较长的推理和结果生成,Decode 阶段的计算压力更大。输出 Token 数量远超输入。
这两类任务需要不同的 Prefill 与 Decode 资源配置。如果集群采用分离架构,就需要根据业务负载决定多少机器处理输入、多少负责生成输出。当 Prefill 资源不足时,长输入请求会排队,即使 Decode 资源空闲也无法完成任务。
企业从试验转向生产必须经历的一步:明确服务等级目标,包括首 Token 延迟(TTFT)、输出速度、并发能力、超时比例和高分位延迟,而不是管理一个模糊的"模型速度"。
过去,国产芯片落地面临的核心问题是使用门槛。企业购买服务器后,不仅要完成模型适配,还需要解决驱动、框架、算子、通信、精度和性能调优等一系列问题。即使芯片价格更低,如果部署周期长、稳定性不足,企业仍然可能选择软件生态更成熟的产品。
推理服务正在改变这一逻辑。当算力以 API 和 Token 的形式交付后,终端用户不再需要直接管理芯片。国产芯片与英伟达 GPU 产生的 Token,在调用方式上可以保持一致,底层硬件适配和性能优化则由专业服务商完成。
从用户视角看,采购对象由一批服务器变成了具有明确价格、延迟和可靠性指标的模型服务。国产硬件的使用难度被封装在基础设施内部,芯片竞争也由"能不能运行模型",逐渐转向"单位成本能够稳定生产多少有效 Token"。
师天麾表示,从其接触的项目看,2026 年以来部分国产芯片的闲置情况已经明显改善,一些新型号在较大规模集群中甚至出现供应紧张。不过,Token 化交付并不会自动解决生态问题——模型兼容性、量化精度、推理吞吐和集群通信,仍然决定一款芯片能否获得持续负载。
对于国产算力而言,推理市场提供的真正机会,不是用户降低了对性能的要求,而是专业基础设施团队可以集中解决适配问题,再把底层差异封装成标准服务。
Agent 的普及不会让 Infra 变简单,反而会暴露推理基础设施中被单轮对话掩盖的所有问题。当一次请求扩展为数十次调用,平均延迟变成长链路等待,偶发失败变成任务中断——行业竞争的重点将落在推理效率、缓存管理和单位成本能交付多少可靠 Token 上。大模型决定了能力的上限,而基础设施决定了这种能力能否以企业可以承受的成本持续运行下去。
推理效率、缓存策略、服务路由与软硬件联合优化,正在成为 AI 基础设施竞争的核心赛点。Token 的稳定、可评估与规模化交付,是 Agent 时代真正到来的前提。
订阅 AI 基础设施深度分析 →