🕵️ 行业观察 · 模型出海

大模型公司集体搞起「匿名公测」:一个神秘代号,正在成为出海第一站

8 月 20 日,OpenRouter 上出现了一个没有名字的模型 —— Ox Alpha。100 万 token 上下文、支持图片视频、能调用工具、免费。社区为它跑测试、拆参数、猜身份,最流行的猜测是:它来自智谱 GLM-5.x 系列。但这不只是一场「猜谜游戏」。

综合公开信息整理 2026-08-22 全文约 4 分钟读完
#匿名发布 #Ox Alpha #OpenRouter #大模型出海
100 token 上下文 · Ox Alpha 免费开放
8/10 社区小样本 DeepSWE 通过率
63% 更大样本社区复测成绩

⚡ 30 秒速览

  • 发生了什么:Ox Alpha 匿名上线,身份未定。社区根据 tokenizer、推理报错等特征,猜测与智谱 GLM-5.x 关系很近,官方未认领。
  • 不是第一次:阿里的 HappyHorse、小米的 Hunter Alpha、蚂蚁的 Elephant Alpha,都是这条「匿名公测」路径
  • 为什么有效:开发者平台是选模型、比价格的入口。匿名 + 免费 + 长上下文,能快速进入真实工作流
  • 代价与风险:用户要自己猜身份、判能力、核对数据政策;企业几乎无法将匿名模型纳入合规评估
  • 核心判断:匿名公测把「发布会话语权」交给了开发者社区 —— 但这场盲测并不对等

01一个没有名字的模型,爆火在开发者圈

Ox Alpha 上线后,海外社区很快出现两种声音。一边是惊喜:流传的 DeepSWE 测试中,它在 10 个软件工程任务里通过约 8 个,成绩高过同场测试的几款知名模型。另一边是质疑:10 个任务的样本太小,每多过或少过一道题,分数就浮动 10 个百分点。

惊喜与质疑并存,这并不矛盾。

8/10小样本 DeepSWE 通过
63%更大样本复测成绩
551为 87 个结果调用的 API 次数
1尚未认领的「神秘身份」

注:两个成绩来自不同规模的社区测试,样本量差异导致波动明显。分数仅作参考,非官方审计结果。

有研究者用更偏抽象推理的 INDUCTION 基准测试 Ox Alpha,结论同样不乐观:落后于 GPT-5.6 Luna 和 DeepSeek V4 Pro,仅略高于 Gemini 3.7 Flash。为了得到 87 个可评估结果,测试者调用了 551 次 API,期间多次遇到空回答和接口错误。

但他自己也无法确认,问题究竟出在模型,还是出在 OpenRouter 的接入链路。

02从 HappyHorse 到 Ox Alpha 一条越来越熟练的「匿名公测」路径

Ox Alpha 并不是第一个蒙着脸跑出来的模型。往前翻四个月,阿里的 HappyHorse(欢乐马)直接空降 Video Arena 榜单,一度把字节 Seedance 2.0 和快手可灵 3.0 挤到身后。讨论热度起来几天后,阿里才确认它的身份。

2月Pony Alpha 3月Hunter Alpha 4月Elephant Alpha 8月Ox Alpha

注:Pony Alpha 后被标注为 GLM-5 早期测试版本,Hunter Alpha 被小米认领,Elephant Alpha 揭晓为蚂蚁 Ling-2.6-flash。

匿名测试本是 OpenRouter 长期存在的机制,OpenAI、xAI、NVIDIA 都曾用过。但中国团队正把它变成新品出海的标准动作:不需要发布会,先让开发者用起来,让代码告诉你答案。

为什么是这里?

OpenRouter 是开发者选模型、比价格的入口,OpenCode 直接连着编程 Agent。用户不需要下载新软件,换个模型就能让它开始读代码、跑任务。这和过去的发布会逻辑完全不同 —— 以前先告诉市场「我很强」,现在是先让开发者试几天,用真实项目给出答案

03去掉品牌滤镜,才能拿到真实反馈

传统发布会逻辑

厂商先喊「我很强」,再等用户来验证。品牌预期会影响判断 —— 有人多给几次机会,也有人连试都不想试。

匿名公测逻辑

模型先被扔进工作流,用户只看到结果:代码写得好不好,工具会不会调错,长任务能不能做完。真实反馈来得更快。

OpenRouter 联合创始人曾回顾匿名测试时提到,平台和模型团队想看的,是用户在不知道开发者是谁的情况下,会怎样使用和评价它。这能减少品牌带来的预设,也能更快拿到真实反馈。

厂商放出一个代号,用户就会开始跑 benchmark、接入 Agent、对比输出,甚至研究 tokenizer 和报错信息。从 HappyHorse 到 Ox Alpha,模型还没正式发布,社区已经替它完成了一轮能力测试、一轮技术分析和一轮口碑传播

这笔账很好算。

实验室里的 benchmark 能告诉团队模型「会不会做题」,开发者则会告诉团队模型「能不能干活」。它在真实代码库里会不会卡住,工具调用会不会出错,长上下文拉长以后还记不记得目标 —— 这些问题,只有真实用户拿项目去撞,才能撞出来

04但这场盲测,并不完全对等

匿名公测给模型团队带来了真实数据,但用户拿到的往往只有一个代号和一段有限的说明。Reddit 上已有开发者提到:匿名模型很难进入严肃的企业评估流程 —— 内部 benchmark、代码和业务数据都涉及合规,等走完审批,模型可能已经下线了。

🧪 三个被放大的问题诚实的注脚

  • 小样本惊喜被放大:10 个任务里 8 个通过,分数很好看;换成 63% 的更大样本,故事就不一样了。匿名模型初期,最容易被传播的是最极端的数字。
  • 数据政策不一致:OpenRouter 页面写明提示词和输出会由上游保留,但不用于训练;OpenCode 强调零数据留存。两种说法并不完全一致,上传代码前需要自己判断。
  • 服务稳定性是能力的一部分:测试中遇到大量空回答和 API 错误。对最终用户来说,问题出在模型还是网关并不重要 —— 不稳定就是不稳定。
引用研究者原话:「问题究竟出在模型,还是出在接入链路?」—— 对用户来说,答案都一样:不能稳定工作,就不算好产品。

匿名发布,确实给了模型一个摆脱品牌滤镜的机会,也让厂商能更早看到真实世界的反馈。但厂商拿到真实数据的同时,用户也承担了更多判断成本:要自己猜身份,自己判断能力,自己核对数据政策,还要自己承担服务不稳定的风险。

—— 本文编辑整理自公开社区讨论

05编辑判断

编辑核心判断

匿名公测的本质,是厂商用「神秘感」换取真实反馈 —— 但这场盲测并不对等。用户拿到的是没有署名的试用品,而厂商拿到的,是开发者用项目撞出来的真相。

当神秘代号成为标准出海打法,唯一确定的是:开发者社区正在成为大模型公司事实上的「第一测试团队」与「免费营销渠道」。

现在就能用

Ox Alpha 目前已在 OpenRouter 免费开放,支持图片与视频输入。想试试这个「神秘模型」,直接去 OpenRouter 搜「Ox Alpha」即可。

OpenRouter 搜索「Ox Alpha」 → 立即体验