神秘 Ox Alpha 模型 OpenRouter 限免,DeepSWE 跑分 80% 碾压 Claude,线索指向智谱
8 月 20 日,一个来历不明的匿名模型 Ox Alpha 登上全球最大 AI 聚合平台 OpenRouter,免费开放一周。开发者实测其 DeepSWE 代码修复得分约 80%,远超 Claude Fable 5 的 65% 与 GPT-5.6 Sol 的 52%,上下文窗口达 104 万 token,支持多模态输入。种种线索指向中国公司智谱。
8 月 20 日,一个来历不明的匿名模型 Ox Alpha 登上全球最大 AI 聚合平台 OpenRouter,免费开放一周。开发者实测其 DeepSWE 代码修复得分约 80%,远超 Claude Fable 5 的 65% 与 GPT-5.6 Sol 的 52%,上下文窗口达 104 万 token,支持多模态输入。种种线索指向中国公司智谱。
开发者 Ben Davis 让 Ox Alpha 完成了 DeepSWE 基准的十项代码修复任务。结果令人瞩目:
注:柱形自 48 分起缩放,非零起点;分差以标注分数为准。Ox Alpha 领先第二名 Claude Fable 5 达 15 个百分点,差距显著。
Davis 本人表示,鉴于该模型来源不明,这一结果「令人困惑」。但数据本身是公开的——OpenRouter 的在线测试记录可查,十项任务逐一执行,结果可复现。
DeepSWE 与 MMLU、GPQA 等传统基准的区别非常直接:
考「模型知不知道」——知识问答与选择题,与现实软件工程交付距离较远。
考「AI 能不能读取真实代码库、识别漏洞、生成有效补丁」——端到端工程能力。
DeepSWE 的测试任务涵盖:bug 修复、安全漏洞修补、代码重构、测试用例生成、跨文件依赖分析等。每个任务要求模型读取完整的代码仓库,定位问题,生成可合并的补丁文件,并通过自动化验证。
这不是「答题」,而是交付可运行的结果。因此,DeepSWE 高分意味着模型在真实开发场景中具备实用价值。
注:DeepSWE 基准由独立社区维护,测试任务来自真实开源仓库的 issue 与 PR。
基于 DeepSWE 测试任务类型,Ox Alpha 展现出在以下场景中的工程能力:
读取数千行代码的仓库,定位导致崩溃的边界条件错误,生成最小修复补丁,并通过已有测试套件验证。
识别代码中的 SQL 注入、XSS、RCE 等漏洞,生成带上下文的安全补丁,并补充相应的回归测试。
理解多个文件之间的调用关系,完成接口变更后的全局重构,确保所有依赖方同步更新。
注:以上场景基于 DeepSWE 基准测试任务类型整理,具体表现以官方评测结果为准。
Ox Alpha 在 OpenRouter 上匿名上线,不披露任何公司或团队背景。但开发者社区已经梳理出多条线索:
一个诚实的注脚:
这些线索都属于间接证据,不排除其他团队的可能性。但 Ox Alpha 的出现本身说明了一件事——中国 AI 模型在工程能力维度已经达到世界领先水平,无论它是否来自智谱。
匿名模型以 80% 的 DeepSWE 跑分震撼行业,但比分数更值得关注的是信号本身:中国 AI 模型的工程交付能力已悄然来到全球第一梯队。当模型不再需要「自报家门」就能凭实力登顶,说明真正的竞赛已经从参数宣发转向了实打实的代码落地能力。谁在匿名,也许并不重要;重要的是,那个水平已经在那里了。
Ox Alpha 目前通过 OpenRouter 免费开放,终端编程智能体 OpenCode 也已接入该模型。登录 OpenRouter 选择 Ox Alpha 即可直接调用,预览期免费。
openrouter.ai → 选择 Ox Alpha移动端也可直接访问,支持文本/图像/视频输入,无需注册即可体验基础功能。