📊 模型 · 商业化速递

Agnes 大模型单周处理量破 8 万亿 Token,Pro Alpha 旗舰模型冲进全球前十

Agnes AI 今日公布最新产品矩阵升级:旗舰文本模型 Agnes-2.5 Pro Alpha 在 Artificial Analysis 智能指数中得分 39,位列同类模型全球第 9;与此同时,其全模态模型单周 Token 处理量已达 8.16 万亿,商业化规模跻身全球前列。

来源:公开报道 全文约 3 分钟读完
#AgnesAI #大模型评测 #AI编程 #商业化
8.16万亿 单周 Token 处理总量
67% Terminal-Bench v2.1 测试得分
100 Pro Alpha 上下文窗口 (Token)

⚡ 30 秒速览

  • 模型双线升级:Agnes-2.5 Flash 主打日常高频编程且不限期免费;Pro Alpha 为首款付费旗舰,支持百万 Token 上下文,面向复杂工程任务。
  • 榜单硬指标:Pro Alpha 在 Artificial Analysis 智能指数同类模型排第 9,在 Terminal-Bench v2.1 终端工程基准拿 67%。
  • 调用量级:单周 8.16 万亿 Token 中,文本占 62.5%,多模态占 37.5%——多模态已非陪跑,具备独立可用产品力。
  • 开发工具链:AgnesCode 优化首字时延,7 月 28 日上线 CLI 命令行,支持在本地终端用自然语言完成代码解析与调试。
  • 开源贡献:Agnes 团队向 SGLang 推理框架提交 4 项代码,其中 3 项已合并。

018 万亿 Token 意味着什么?全球周调用流量对比

纸面参数与榜单分数有参考价值,但真实线上 Token 消耗结构是更硬核的落地检验标准。根据全球 AI 模型聚合平台 OpenRouter 最新周调用榜单,Agnes 的单周处理量已跻身全球前列。

MiMo-V2.5小米
10.2T
Agnes 全模态Agnes AI
8.16T
DeepSeek V4 Flash深度求索
6.01T

注:T 代表万亿 Token;柱形按最大值 10.2T 等比例缩放。Agnes 8.16 万亿 Token 中,文本 5.1 万亿(62.5%),多模态 3.06 万亿(37.5%)。

多模态占比近四成释放出清晰信号:其图像、视频模块已具备独立可用的产品能力,而非仅作文本模型的附加演示。用户实际业务场景实现了从文本对话、代码编写到图片处理、视频解析的全覆盖。

02两个榜单,测的是哪门子能力?

Agnes-2.5 Pro Alpha 在两个公开评测中拿出的成绩,恰好对应了当下 AI 落地的两个核心维度:综合智能水平真实工程执行

Artificial Analysis 智能指数

得分 39,同类模型排名第 9。由 9 项评测构成,覆盖 Agent 任务、代码执行、科学推理、知识可靠性和长上下文理解——其中 Agent 与 Coding 占据较高权重,更注重模型在真实任务中的综合表现。

Terminal-Bench v2.1

得分 67%。全程在隔离 Docker 沙箱环境运行,固定保留 89 项真实工程任务,修复了 28 项环境配置、指令匹配、资源配额的底层问题——分数反映的是模型在模拟终端环境中完成工程任务的能力。

这两个榜单的共同点是拒绝纸面答题:一个考综合智能能不能应对复杂任务编排,一个考模型能不能在沙箱里把代码工程跑通。Pro Alpha 在两个维度上均进入可用区间。

03它到底能做什么?两组实测案例

💻 Flash 版:一句话生成原生 macOS 桌面日常高频

  • 输入提示词:「搭建一个 macOS 桌面界面,自带文件管理、浏览器、笔记这类常用基础功能。」
  • 模型生成的界面贴合原生 macOS 经典 UI 风格:顶部菜单栏、桌面常驻图标、底部 Dock 栏元素齐全。
  • 配齐了文件管理器、浏览器、备忘录、日历、相机、音乐、黑屏终端、系统设置等刚需程序,点击日历可查看对应提醒事项。
另一题「响应式科幻风格个人博客网站」同样直出:主标题白紫渐变字体,文章卡片半透明深色背景,主次分明。

🏢 Pro Alpha:直出企业级多租户 SaaS 平台复杂工程

  • 输入提示词:「设计并实现一个企业级多租户 SaaS 项目管理平台。」
  • 登录页完整设计了账号、密码、租户标识(Tenant Slug)输入框,精准对应多租户体系的登录鉴权逻辑。
  • 后台界面采用左侧导航栏、右侧内容区的企业后台布局,组件化拆分、表单、筛选、卡片布局均属成熟企业前端写法。
作为先行体验版本,Pro Alpha 在复杂平台的构建方面已展现出应用价值,配合百万 Token 上下文窗口,可承接大型项目协作。

04为什么能做到?分层模型 + 工具链 + 推理基建

Agnes AI 的打法是分层模型矩阵搭配自研专属工具,兼顾日常与专业场景:

Agnes-2.5 Flash
日常编程 · 不限期免费
AgnesCode 工作台
TTFT 优化 · CLI 上线
Pro Alpha 旗舰
百万上下文 · 首款付费
⌨️

AgnesCode CLI:在终端里用自然语言写代码

7 月 28 日上线后,开发者登录部署即可在本地项目文件夹用自然语言完成代码解析、文件修改、故障排查、测试编译;授权后可直接运行终端指令、安装项目所需依赖。

🔧

SGLang 开源贡献:万亿 Token 的底层支撑

行业竞争重心正向下游推理基建转移,SGLang 作为支撑万亿级 Token 流转的核心开源框架,成为技术团队打磨硬核工程能力的关键。Agnes 团队已提交 4 项代码贡献,其中 3 项已正式合并

编辑视角

本次报道的调用量数据(8.16 万亿 Token/周)由 Agnes AI 单方披露,未见第三方独立审计或复测;两个评测榜单的得分虽来自公开平台,但 Artificial Analysis 智能指数的「同类模型」分类口径未在原报道中明确界定,读者宜将排名视为参考而非定论。

抛开数据精度,这则通稿真正值得关注的信号是:头部大模型厂商的竞争叙事,已从「跑分」转向「调用量」。当厂商开始用 Token 消耗量而非榜单分数证明自身价值,意味着 AI 行业正从技术验证期跨入商业兑现期——模型能力是否匹配真实业务需求,正在成为新的硬通货。

谁能率先把模型能力转化为稳定的高频调用流量,谁就能在 AI 应用生态的下一轮卡位中拿到定义规则的权力。

现在就能用

Agnes-2.5 Flash API 与 AgnesCode 已全面上线且不限期免费;Pro Alpha 为首款付费模型(输入 $0.45/百万 Token、输出 $0.90/百万 Token),登录 AgnesCode 可领取免费积分体验。

AgnesCode → 登录领取积分