🐂 神秘模型 · 匿名测试

神秘模型 Ox Alpha 突袭 OpenRouter,性能超越 Fable 5?全网盲猜智谱或小米

一款代号 Ox Alpha 的神秘模型悄然上线 OpenRouter,以 免费 API100 万 Token 上下文和持续 Agent 任务能力引发社区狂热。在第三方 10 项任务测试中通过率达 80%,超越 Fable 5、GLM-5.3 等前沿模型,但身份至今成谜。

综合公开信息整理 2026-08-20 全文约 4 分钟读完
#Ox Alpha #Stealth Model #OpenRouter #Agent #匿名测试
💰 免费 输入输出均为零 · 持续一周
100 Token 上下文窗口
80% 10 项 Agent 任务通过率
4 社区主要归属猜测
⚡ 30 秒速览
  • 免费 API,力度空前:输入输出均免费,持续一周,每日容量 100T Token,适合大规模压力测试。
  • 百万上下文 + 多模态输入:100 万 Token 上下文窗口,支持文本、图片、视频输入,最大输出 13 万 Token。
  • 测试表现亮眼:10 项 Agent 任务通过率 80%,超越 Fable 5(65%)、GLM-5.3(62%)、Grok-4.6(62%)等模型。
  • 身份四种猜测:小米 MiMo V3、腾讯混元 HY 4、Google Gemini、智谱 GLM-5.3 均为候选,尚无定论。
  • 发布机制革新:Stealth Model 先匿名测试后揭晓身份,正在成为行业新范式。

01神秘模型亮相 OpenRouter 只给了一个忍者表情

没有发布会,没有技术报告,OpenRouter 用一个忍者表情放出了一款代号 Ox Alpha 的神秘模型。介绍只有一句话:面向高效编程、长时间 Agent 任务和真实生产环境的前沿模型,拥有 100 万 Token 上下文,支持文本、图像和视频输入。

模型参数、训练数据、架构、基准成绩、开发团队——全部保密。OpenRouter 只负责路由,背后的第三方供应商选择在预览期间保持匿名。

这与传统模型发布方式截然不同。

传统发布流程

先公布名称和技术报告,展示基准成绩,再向开发者开放 API。用户知道自己正在测试谁,但容易受品牌影响。

Stealth Model 模式

模型先匿名进入平台,开发者在不知道品牌、参数的情况下直接使用。提供方获得更真实的环境评价,表现好再揭晓身份。

100上下文窗口
13最大输出 Token
1.95s中位首 Token 延迟
49/s输出速度

注:延迟与速度数据采样周期短、调用规模有限,后续可能变化。模型支持工具调用与 JSON 结构化输出,但暂不支持严格 JSON Schema 约束。

02能力边界 为持续 Agent 工作而生

Ox Alpha 并非面向单次聊天或代码补全,而是为 Coding Agent 设计的执行模型。长时间 Agent 任务对模型的要求截然不同:不仅要生成正确代码,还需要持续读取文件、调用工具、跟踪修改状态、运行测试,并在失败后重新规划。

其核心能力标签:

长周期软件工程 复杂推理 文本+视觉 Agent 工具调用 JSON 结构化输出 百万级上下文

一个诚实的注脚:OpenRouter 没有公布任何 SWE-bench、Terminal-Bench 或其他编程与 Agent 基准成绩。模型使用了 "frontier model" 这一定位,但目前还没有公开证据证明其性能已进入 GPT、Claude 或 Gemini 旗舰模型所在的第一梯队。

03社区测试 10 项任务通过率 80%,超越 Fable 5

模型放出后,国外技术社区迅速展开测试。最受关注的一组对比:在 10 个具体 Agent 任务中,Ox Alpha 通过 8 个,成功率 80%,在参测模型中排名第一。

🥇 Ox Alpha匿名模型
80%
Fable 5
65%
GLM-5.3智谱
62%
Grok-4.6xAI
62%
GPT-5.6 SolOpenAI
52%

注:每项任务测试 1 次,其他模型每项任务测试 4 次取均值。样本量有限,结果仅供参考,不构成全面排名。

但数据只是故事的一部分。另一组测试揭示了更微妙的特征。

🦩 鹈鹕骑自行车 SVG 测试 推理档位对照

  • low 档:13–21 秒完成,推理字段几乎为空,图像结构基本正确,但脚与踏板偶有错位。
  • high 档:19–23 秒,细节与结构一致性有所改善,但提升幅度有限。
  • max 档:推理字段飙至 1.7 万–6.2 万字符,耗时 124–355 秒,Token 消耗超 2.6 万。图像增加了云朵、头盔等装饰,但核心构图未同等提升,个别样本仍存在脚与踏板错位。
核心发现:最高推理档位存在明显的"过度思考"倾向——数十倍的推理字符与十几倍的时间,换来的主要是装饰细节,而非结构准确性的根本改善。

04归属猜测 它到底是谁?

匿名模型上线后,社区最关心的问题不是怎么用,而是"它到底是谁"。目前主要出现了四类猜测,各有线索,但均无确凿证据。

📱 小米 MiMo V3

时间点接近(8 月 18 日 CFO 透露新模型训练中),小米此前在 OpenRouter 匿名测试过 Hunter Alpha(即 MiMo-V2-Pro),且同样拥有百万上下文。

线索:历史先例 + 时间窗口
🐧 腾讯混元 HY 4

能够支撑如此大规模免费调用的厂商不多,腾讯在算力和推理基础设施上具备条件,且可能在正式发布前需要收集真实 Agent 数据。

线索:算力规模 + 测试需求
🔮 Google Gemini

百万上下文 + 原生支持图片和视频输入,两个特征与 Gemini 高度吻合。有用户让模型自报身份得到"Gemini"回答,但模型自述不可靠。

线索:能力特征 + 自述(不可靠)
🧠 智谱 GLM-5.3

分词器匹配度测试中,Ox Alpha 与 GLM-5.3 的匹配度最高(50/50 对抗字符串测试),而 Gemini、DeepSeek、Kimi 匹配度仅 18–22%。

线索:分词器指纹 + API 特征

注:让模型"自报家门"不是可靠的鉴别方法。模型可能从训练数据或系统提示中生成看似合理的答案,不同询问方式下可能给出完全不同的身份。

几乎每一家正在准备新模型的公司,都可以被套进 Ox Alpha 的身份猜测中。这本身就说明了一个问题。

编辑核心判断

Stealth Model 正在改变模型发布逻辑:下一代模型可能不再先开发布会,而是先悄悄进入开发者的终端,工作一周,消耗数万亿 Token,再带着真实反馈正式亮相。匿名身份遮住了厂商的名字,却把行业从"营销驱动"拉回"产品驱动"的趋势暴露了出来。

现在就能用

Ox Alpha 在 OpenRouter 平台免费开放一周,输入输出均为零。搜索 "stealth/ox-alpha" 即可开始测试。

OpenRouter → 搜索 Ox Alpha