神秘模型 Ox Alpha 突袭 OpenRouter,性能超越 Fable 5?全网盲猜智谱或小米
一款代号 Ox Alpha 的神秘模型悄然上线 OpenRouter,以 免费 API、100 万 Token 上下文和持续 Agent 任务能力引发社区狂热。在第三方 10 项任务测试中通过率达 80%,超越 Fable 5、GLM-5.3 等前沿模型,但身份至今成谜。
一款代号 Ox Alpha 的神秘模型悄然上线 OpenRouter,以 免费 API、100 万 Token 上下文和持续 Agent 任务能力引发社区狂热。在第三方 10 项任务测试中通过率达 80%,超越 Fable 5、GLM-5.3 等前沿模型,但身份至今成谜。
没有发布会,没有技术报告,OpenRouter 用一个忍者表情放出了一款代号 Ox Alpha 的神秘模型。介绍只有一句话:面向高效编程、长时间 Agent 任务和真实生产环境的前沿模型,拥有 100 万 Token 上下文,支持文本、图像和视频输入。
模型参数、训练数据、架构、基准成绩、开发团队——全部保密。OpenRouter 只负责路由,背后的第三方供应商选择在预览期间保持匿名。
这与传统模型发布方式截然不同。
先公布名称和技术报告,展示基准成绩,再向开发者开放 API。用户知道自己正在测试谁,但容易受品牌影响。
模型先匿名进入平台,开发者在不知道品牌、参数的情况下直接使用。提供方获得更真实的环境评价,表现好再揭晓身份。
注:延迟与速度数据采样周期短、调用规模有限,后续可能变化。模型支持工具调用与 JSON 结构化输出,但暂不支持严格 JSON Schema 约束。
Ox Alpha 并非面向单次聊天或代码补全,而是为 Coding Agent 设计的执行模型。长时间 Agent 任务对模型的要求截然不同:不仅要生成正确代码,还需要持续读取文件、调用工具、跟踪修改状态、运行测试,并在失败后重新规划。
其核心能力标签:
一个诚实的注脚:OpenRouter 没有公布任何 SWE-bench、Terminal-Bench 或其他编程与 Agent 基准成绩。模型使用了 "frontier model" 这一定位,但目前还没有公开证据证明其性能已进入 GPT、Claude 或 Gemini 旗舰模型所在的第一梯队。
模型放出后,国外技术社区迅速展开测试。最受关注的一组对比:在 10 个具体 Agent 任务中,Ox Alpha 通过 8 个,成功率 80%,在参测模型中排名第一。
注:每项任务测试 1 次,其他模型每项任务测试 4 次取均值。样本量有限,结果仅供参考,不构成全面排名。
但数据只是故事的一部分。另一组测试揭示了更微妙的特征。
匿名模型上线后,社区最关心的问题不是怎么用,而是"它到底是谁"。目前主要出现了四类猜测,各有线索,但均无确凿证据。
时间点接近(8 月 18 日 CFO 透露新模型训练中),小米此前在 OpenRouter 匿名测试过 Hunter Alpha(即 MiMo-V2-Pro),且同样拥有百万上下文。
线索:历史先例 + 时间窗口能够支撑如此大规模免费调用的厂商不多,腾讯在算力和推理基础设施上具备条件,且可能在正式发布前需要收集真实 Agent 数据。
线索:算力规模 + 测试需求百万上下文 + 原生支持图片和视频输入,两个特征与 Gemini 高度吻合。有用户让模型自报身份得到"Gemini"回答,但模型自述不可靠。
线索:能力特征 + 自述(不可靠)分词器匹配度测试中,Ox Alpha 与 GLM-5.3 的匹配度最高(50/50 对抗字符串测试),而 Gemini、DeepSeek、Kimi 匹配度仅 18–22%。
线索:分词器指纹 + API 特征注:让模型"自报家门"不是可靠的鉴别方法。模型可能从训练数据或系统提示中生成看似合理的答案,不同询问方式下可能给出完全不同的身份。
几乎每一家正在准备新模型的公司,都可以被套进 Ox Alpha 的身份猜测中。这本身就说明了一个问题。
Stealth Model 正在改变模型发布逻辑:下一代模型可能不再先开发布会,而是先悄悄进入开发者的终端,工作一周,消耗数万亿 Token,再带着真实反馈正式亮相。匿名身份遮住了厂商的名字,却把行业从"营销驱动"拉回"产品驱动"的趋势暴露了出来。
Ox Alpha 在 OpenRouter 平台免费开放一周,输入输出均为零。搜索 "stealth/ox-alpha" 即可开始测试。
OpenRouter → 搜索 Ox Alpha