大模型公司集体搞起「匿名公测」:一个神秘代号,正在成为出海第一站
8 月 20 日,OpenRouter 上出现了一个没有名字的模型 —— Ox Alpha。100 万 token 上下文、支持图片视频、能调用工具、免费。社区为它跑测试、拆参数、猜身份,最流行的猜测是:它来自智谱 GLM-5.x 系列。但这不只是一场「猜谜游戏」。
8 月 20 日,OpenRouter 上出现了一个没有名字的模型 —— Ox Alpha。100 万 token 上下文、支持图片视频、能调用工具、免费。社区为它跑测试、拆参数、猜身份,最流行的猜测是:它来自智谱 GLM-5.x 系列。但这不只是一场「猜谜游戏」。
Ox Alpha 上线后,海外社区很快出现两种声音。一边是惊喜:流传的 DeepSWE 测试中,它在 10 个软件工程任务里通过约 8 个,成绩高过同场测试的几款知名模型。另一边是质疑:10 个任务的样本太小,每多过或少过一道题,分数就浮动 10 个百分点。
惊喜与质疑并存,这并不矛盾。
注:两个成绩来自不同规模的社区测试,样本量差异导致波动明显。分数仅作参考,非官方审计结果。
有研究者用更偏抽象推理的 INDUCTION 基准测试 Ox Alpha,结论同样不乐观:落后于 GPT-5.6 Luna 和 DeepSeek V4 Pro,仅略高于 Gemini 3.7 Flash。为了得到 87 个可评估结果,测试者调用了 551 次 API,期间多次遇到空回答和接口错误。
但他自己也无法确认,问题究竟出在模型,还是出在 OpenRouter 的接入链路。
Ox Alpha 并不是第一个蒙着脸跑出来的模型。往前翻四个月,阿里的 HappyHorse(欢乐马)直接空降 Video Arena 榜单,一度把字节 Seedance 2.0 和快手可灵 3.0 挤到身后。讨论热度起来几天后,阿里才确认它的身份。
注:Pony Alpha 后被标注为 GLM-5 早期测试版本,Hunter Alpha 被小米认领,Elephant Alpha 揭晓为蚂蚁 Ling-2.6-flash。
匿名测试本是 OpenRouter 长期存在的机制,OpenAI、xAI、NVIDIA 都曾用过。但中国团队正把它变成新品出海的标准动作:不需要发布会,先让开发者用起来,让代码告诉你答案。
为什么是这里?
OpenRouter 是开发者选模型、比价格的入口,OpenCode 直接连着编程 Agent。用户不需要下载新软件,换个模型就能让它开始读代码、跑任务。这和过去的发布会逻辑完全不同 —— 以前先告诉市场「我很强」,现在是先让开发者试几天,用真实项目给出答案。
厂商先喊「我很强」,再等用户来验证。品牌预期会影响判断 —— 有人多给几次机会,也有人连试都不想试。
模型先被扔进工作流,用户只看到结果:代码写得好不好,工具会不会调错,长任务能不能做完。真实反馈来得更快。
OpenRouter 联合创始人曾回顾匿名测试时提到,平台和模型团队想看的,是用户在不知道开发者是谁的情况下,会怎样使用和评价它。这能减少品牌带来的预设,也能更快拿到真实反馈。
厂商放出一个代号,用户就会开始跑 benchmark、接入 Agent、对比输出,甚至研究 tokenizer 和报错信息。从 HappyHorse 到 Ox Alpha,模型还没正式发布,社区已经替它完成了一轮能力测试、一轮技术分析和一轮口碑传播。
这笔账很好算。
实验室里的 benchmark 能告诉团队模型「会不会做题」,开发者则会告诉团队模型「能不能干活」。它在真实代码库里会不会卡住,工具调用会不会出错,长上下文拉长以后还记不记得目标 —— 这些问题,只有真实用户拿项目去撞,才能撞出来。
匿名公测给模型团队带来了真实数据,但用户拿到的往往只有一个代号和一段有限的说明。Reddit 上已有开发者提到:匿名模型很难进入严肃的企业评估流程 —— 内部 benchmark、代码和业务数据都涉及合规,等走完审批,模型可能已经下线了。
匿名发布,确实给了模型一个摆脱品牌滤镜的机会,也让厂商能更早看到真实世界的反馈。但厂商拿到真实数据的同时,用户也承担了更多判断成本:要自己猜身份,自己判断能力,自己核对数据政策,还要自己承担服务不稳定的风险。
匿名公测的本质,是厂商用「神秘感」换取真实反馈 —— 但这场盲测并不对等。用户拿到的是没有署名的试用品,而厂商拿到的,是开发者用项目撞出来的真相。
当神秘代号成为标准出海打法,唯一确定的是:开发者社区正在成为大模型公司事实上的「第一测试团队」与「免费营销渠道」。
Ox Alpha 目前已在 OpenRouter 免费开放,支持图片与视频输入。想试试这个「神秘模型」,直接去 OpenRouter 搜「Ox Alpha」即可。
OpenRouter 搜索「Ox Alpha」 → 立即体验