🧠 模型 · 匿名竞技

神秘 Ox Alpha 模型 OpenRouter 限免,DeepSWE 跑分 80% 碾压 Claude,线索指向智谱

8 月 20 日,一个来历不明的匿名模型 Ox Alpha 登上全球最大 AI 聚合平台 OpenRouter,免费开放一周。开发者实测其 DeepSWE 代码修复得分约 80%,远超 Claude Fable 5 的 65% 与 GPT-5.6 Sol 的 52%,上下文窗口达 104 万 token,支持多模态输入。种种线索指向中国公司智谱。

综合公开信息整理 2026-08-23 全文约 3 分钟读完
#Ox Alpha #DeepSWE #匿名模型 #智谱 #OpenRouter
🔍 匿名上线 OpenRouter · 免费 1 周 · 来源不明
80% DeepSWE 跑分,领先 Claude 15 个百分点
1,048,576 上下文窗口(token),支持文本/图像/视频

⚡ 30 秒速览

  • 跑分碾压:DeepSWE 十项测试综合得分约 80%,Claude Fable 5 为 65%,GPT-5.6 Sol 为 52%——差距达 15 个百分点以上。
  • 规格惊人:上下文窗口 1,048,576 token,最大输出 131,072 token,支持文本、图像、视频多模态输入,完全免费预览。
  • 身份成谜:OpenRouter 匿名上线,不披露任何背景信息;开发者 Ben Davis 测试后表示「结果令人困惑」,目前线索指向智谱。
  • 免费可用:OpenRouter 提供免费调用,终端编程智能体 OpenCode 也已接入,声称每日可处理 100 万亿 token。

01跑分对决 DeepSWE 基准:Ox Alpha 一骑绝尘

开发者 Ben Davis 让 Ox Alpha 完成了 DeepSWE 基准的十项代码修复任务。结果令人瞩目:

🥇 Ox Alpha匿名模型 · 线索指向智谱
80.0
Claude Fable 5Anthropic
65.0
GPT-5.6 SolOpenAI
52.0

注:柱形自 48 分起缩放,非零起点;分差以标注分数为准。Ox Alpha 领先第二名 Claude Fable 5 达 15 个百分点,差距显著。

Davis 本人表示,鉴于该模型来源不明,这一结果「令人困惑」。但数据本身是公开的——OpenRouter 的在线测试记录可查,十项任务逐一执行,结果可复现。

02DeepSWE:测的是真正的工程能力

DeepSWE 与 MMLU、GPQA 等传统基准的区别非常直接:

传统基准(MMLU / GPQA)

考「模型知不知道」——知识问答与选择题,与现实软件工程交付距离较远。

DeepSWE

考「AI 能不能读取真实代码库、识别漏洞、生成有效补丁」——端到端工程能力。

DeepSWE 的测试任务涵盖:bug 修复、安全漏洞修补、代码重构、测试用例生成、跨文件依赖分析等。每个任务要求模型读取完整的代码仓库,定位问题,生成可合并的补丁文件,并通过自动化验证。

这不是「答题」,而是交付可运行的结果。因此,DeepSWE 高分意味着模型在真实开发场景中具备实用价值。

10测试任务
5+代码语言覆盖
80%Ox Alpha 得分
15pts领先第二名

注:DeepSWE 基准由独立社区维护,测试任务来自真实开源仓库的 issue 与 PR。

03它到底能做什么?三个典型工程场景

基于 DeepSWE 测试任务类型,Ox Alpha 展现出在以下场景中的工程能力:

🐛

复杂 bug 定位与修复

读取数千行代码的仓库,定位导致崩溃的边界条件错误,生成最小修复补丁,并通过已有测试套件验证。

🛡️

安全漏洞挖掘与修补

识别代码中的 SQL 注入、XSS、RCE 等漏洞,生成带上下文的安全补丁,并补充相应的回归测试。

🔧

跨文件重构与依赖分析

理解多个文件之间的调用关系,完成接口变更后的全局重构,确保所有依赖方同步更新。

注:以上场景基于 DeepSWE 基准测试任务类型整理,具体表现以官方评测结果为准。

04身份谜团:为什么指向智谱?

Ox Alpha 在 OpenRouter 上匿名上线,不披露任何公司或团队背景。但开发者社区已经梳理出多条线索:

🔎 指向智谱的若干证据

  • API 行为特征:Ox Alpha 的响应格式、错误处理方式、token 编码风格与智谱此前公开的 GLM 系列模型高度一致。
  • 上下文窗口规格:104 万 token 的上下文与智谱 2025 年底发布的「长上下文基线」技术路线吻合,业内仅少数团队具备此能力。
  • 多模态能力栈:同时支持文本、图像、视频输入,且输出长度达 131K token,与智谱在多模态领域的布局匹配。
  • OpenRouter 上线模式:智谱此前曾通过 OpenRouter 进行过模型灰度测试,运营路径有迹可循。
以上线索均为社区分析,截至发稿时智谱未作官方回应。

一个诚实的注脚:

这些线索都属于间接证据,不排除其他团队的可能性。但 Ox Alpha 的出现本身说明了一件事——中国 AI 模型在工程能力维度已经达到世界领先水平,无论它是否来自智谱。

1M 上下文 多模态输入 131K 输出 DeepSWE 80% 免费预览 匿名上线
编辑核心判断

匿名模型以 80% 的 DeepSWE 跑分震撼行业,但比分数更值得关注的是信号本身:中国 AI 模型的工程交付能力已悄然来到全球第一梯队。当模型不再需要「自报家门」就能凭实力登顶,说明真正的竞赛已经从参数宣发转向了实打实的代码落地能力。谁在匿名,也许并不重要;重要的是,那个水平已经在那里了。

现在就能体验

Ox Alpha 目前通过 OpenRouter 免费开放,终端编程智能体 OpenCode 也已接入该模型。登录 OpenRouter 选择 Ox Alpha 即可直接调用,预览期免费。

openrouter.ai → 选择 Ox Alpha

移动端也可直接访问,支持文本/图像/视频输入,无需注册即可体验基础功能。