Agnes 大模型单周处理量破 8 万亿 Token,Pro Alpha 旗舰模型冲进全球前十
Agnes AI 今日公布最新产品矩阵升级:旗舰文本模型 Agnes-2.5 Pro Alpha 在 Artificial Analysis 智能指数中得分 39,位列同类模型全球第 9;与此同时,其全模态模型单周 Token 处理量已达 8.16 万亿,商业化规模跻身全球前列。
Agnes AI 今日公布最新产品矩阵升级:旗舰文本模型 Agnes-2.5 Pro Alpha 在 Artificial Analysis 智能指数中得分 39,位列同类模型全球第 9;与此同时,其全模态模型单周 Token 处理量已达 8.16 万亿,商业化规模跻身全球前列。
纸面参数与榜单分数有参考价值,但真实线上 Token 消耗结构是更硬核的落地检验标准。根据全球 AI 模型聚合平台 OpenRouter 最新周调用榜单,Agnes 的单周处理量已跻身全球前列。
注:T 代表万亿 Token;柱形按最大值 10.2T 等比例缩放。Agnes 8.16 万亿 Token 中,文本 5.1 万亿(62.5%),多模态 3.06 万亿(37.5%)。
多模态占比近四成释放出清晰信号:其图像、视频模块已具备独立可用的产品能力,而非仅作文本模型的附加演示。用户实际业务场景实现了从文本对话、代码编写到图片处理、视频解析的全覆盖。
Agnes-2.5 Pro Alpha 在两个公开评测中拿出的成绩,恰好对应了当下 AI 落地的两个核心维度:综合智能水平与真实工程执行。
得分 39,同类模型排名第 9。由 9 项评测构成,覆盖 Agent 任务、代码执行、科学推理、知识可靠性和长上下文理解——其中 Agent 与 Coding 占据较高权重,更注重模型在真实任务中的综合表现。
得分 67%。全程在隔离 Docker 沙箱环境运行,固定保留 89 项真实工程任务,修复了 28 项环境配置、指令匹配、资源配额的底层问题——分数反映的是模型在模拟终端环境中完成工程任务的能力。
这两个榜单的共同点是拒绝纸面答题:一个考综合智能能不能应对复杂任务编排,一个考模型能不能在沙箱里把代码工程跑通。Pro Alpha 在两个维度上均进入可用区间。
Agnes AI 的打法是分层模型矩阵搭配自研专属工具,兼顾日常与专业场景:
7 月 28 日上线后,开发者登录部署即可在本地项目文件夹用自然语言完成代码解析、文件修改、故障排查、测试编译;授权后可直接运行终端指令、安装项目所需依赖。
行业竞争重心正向下游推理基建转移,SGLang 作为支撑万亿级 Token 流转的核心开源框架,成为技术团队打磨硬核工程能力的关键。Agnes 团队已提交 4 项代码贡献,其中 3 项已正式合并。
本次报道的调用量数据(8.16 万亿 Token/周)由 Agnes AI 单方披露,未见第三方独立审计或复测;两个评测榜单的得分虽来自公开平台,但 Artificial Analysis 智能指数的「同类模型」分类口径未在原报道中明确界定,读者宜将排名视为参考而非定论。
抛开数据精度,这则通稿真正值得关注的信号是:头部大模型厂商的竞争叙事,已从「跑分」转向「调用量」。当厂商开始用 Token 消耗量而非榜单分数证明自身价值,意味着 AI 行业正从技术验证期跨入商业兑现期——模型能力是否匹配真实业务需求,正在成为新的硬通货。
Agnes-2.5 Flash API 与 AgnesCode 已全面上线且不限期免费;Pro Alpha 为首款付费模型(输入 $0.45/百万 Token、输出 $0.90/百万 Token),登录 AgnesCode 可领取免费积分体验。
AgnesCode → 登录领取积分