匿名模型 Kivine 空降 LMArena,百万 token 上下文能力引发 Kimi K3 提前亮相猜想
7 月 15 日,一款名为 Kivine 的匿名模型悄然上线 LMArena,凭借百万 token 上下文能力和接近 Fable 级别的生成质量,在数小时内引爆 AI 社区。从充值页面泄露到 beta 接口信息,多方证据指向月之暗面尚未发布的下一代旗舰——Kimi K3。
7 月 15 日,一款名为 Kivine 的匿名模型悄然上线 LMArena,凭借百万 token 上下文能力和接近 Fable 级别的生成质量,在数小时内引爆 AI 社区。从充值页面泄露到 beta 接口信息,多方证据指向月之暗面尚未发布的下一代旗舰——Kimi K3。
事情的起点来自 X 用户 @lentils80。7 月 15 日凌晨,他在浏览 LMArena 时发现一个此前从未出现过的新模型悄然上线,名称为 Kivine。随后他发布了一条推文,迅速在 AI 圈传播。
Kivine 之所以引发关注,并非因为名字本身有何特殊——LMArena 上的匿名模型经常使用随机名称——而是它在能力表现上展现出了许多与 Kimi K3 传闻高度吻合的特点。
注:LMArena 是真实用户环境下的公开竞技场,模型需面对写代码、长文本总结、多步骤推理等复杂任务,其评测结果比实验室测试更具生态效度。
Kivine 最引人注目的,是它在 长上下文 和 生成质量 两个维度上的表现。测试用户 @kimmonismus 表示,Kivine 拥有 1M context,且在长程任务处理中表现更好。这与 Kimi 系列一贯的技术路线高度吻合。
上下文窗口通常为 128K–200K token,生成质量优秀但受限于输入长度,面对超长文档或大型代码项目时需分段处理。
百万 token 上下文窗口,可一次性处理整部企业资料、数十万字研究报告或大型软件项目代码。生成质量接近 Fable 级别。
有测试用户反馈,Kivine 在复杂任务上表现突出——例如要求它制作一款类似《我的世界》的小游戏,包含中世纪城堡、森林环境、花草细节及光影效果,最终生成结果不仅包含基础玩法,还加入了寻宝机制和环境音效设计。
但一个明显的问题也随之暴露:速度。一次完整生成过程可能需要等待约 35 分钟。这几乎意味着 Kivine 使用了高强度推理模式——推理能力越强,计算成本越高,响应时间越长。
注:高强度推理模式是当前顶级模型的常见取舍——OpenAI、Anthropic 的旗舰推理模型同样面临响应时间与质量之间的权衡。Kivine 展现的是"极致质量优先"路线。
如果 Kivine 只是能力出众,社区不会如此笃定地将它与 Kimi K3 挂钩。真正让猜测变得可信的,是三条独立出现的线索——它们相互印证,形成了一条完整的证据链。
注:以上三条线索相互独立,但指向同一结论。月之暗面尚未公开确认 Kivine 与 Kimi K3 的关系,也未发布任何官方技术资料。
关于 Kimi K3 的技术规格,目前社区流传最广的说法是:超过 2.5 万亿参数、百万 token 上下文、原生多模态能力,以及新的注意力架构设计。但所有信息均未经官方确认。
在测试成绩方面,社区流传的对比数据如下(非官方,仅供参考):
注:柱形为相对位置示意,非精确分数。测试数据来自社区流传,未经官方验证。Kivine 在部分测试中超过图中前三款模型,但与 GPT-5.6 Sol 和 Fable 5 相比仍存在差距。
一个诚实的注脚:如果最终成绩接近传闻水平,那么国产模型将不再只是"追赶者",而是开始直接参与最高水平基础模型竞争。但这一切仍需要官方发布来验证。
从 LMArena 上突然出现的 Kivine,到 beta 接口中的 K3 信息,再到提前泄露的运营页面——越来越多线索汇聚,Kimi K3 已经很难再称为一个秘密。
如果最终证实 Kivine 就是 Kimi K3,这不仅是月之暗面的一次模型升级,更可能成为国产 AI 竞争格局中的一个重要节点。它代表的不是简单的参数增加,而是国产模型开始尝试进入全球顶级模型竞争。
但真正决定它商业价值的,并不是能力上限。而是它能否解决一个现实问题:
一个需要 35 分钟才能完成任务的超级模型,如何变成普通用户每天都愿意使用的 AI 助手?
Kimi K3 可能不是没有准备好,而是在等待一个更合适的时间点。模型稳定性、成本控制、产品设计、发布节奏——每一项都是综合竞争力的一部分。技术能力只是起点,系统工程与产品化才是真正的战场。
Kimi K3 的正式发布动态、技术报告与产品体验入口,将在月之暗面官方渠道第一时间公布。保持关注。
kimi.moonshot.cn → 了解 Kimi 系列