AI·快讯
🔍 模型 · 匿名曝光

匿名模型 Kivine 空降 LMArena,百万 token 上下文能力引发 Kimi K3 提前亮相猜想

7 月 15 日,一款名为 Kivine 的匿名模型悄然上线 LMArena,凭借百万 token 上下文能力和接近 Fable 级别的生成质量,在数小时内引爆 AI 社区。从充值页面泄露到 beta 接口信息,多方证据指向月之暗面尚未发布的下一代旗舰——Kimi K3

综合公开信息整理 2026-07-22 全文约 4 分钟读完
#Kimi K3 #Kivine #LMArena #月之暗面 #长上下文
🥇 社区焦点 LMArena 匿名测试 · 数小时引爆讨论
1,000,000+ 上下文窗口(token)
~35 单次完整生成耗时(分钟)

⚡ 30 秒速览

  • 发生了什么:Kivine 以匿名身份上线 LMArena,被广泛怀疑为月之暗面未发布的 Kimi K3。
  • 能力有多强:百万 token 上下文,超长文本处理表现突出;生成质量接近 Anthropic 顶级模型 Fable 水平。
  • 证据链:充值活动页面提前泄露又迅速撤下 · beta.kimi.link 后台出现 K3 模型信息 · 产品体系重新划分。
  • 代价与取舍:单次生成约 35 分钟,追求极致质量而非即时响应,是典型的高强度推理模式。
  • 深层信号:国产模型开始尝试进入全球顶级基础模型竞争,系统工程能力与参数规模同样重要。

01事件经过 Kivine 是如何被发现的

事情的起点来自 X 用户 @lentils80。7 月 15 日凌晨,他在浏览 LMArena 时发现一个此前从未出现过的新模型悄然上线,名称为 Kivine。随后他发布了一条推文,迅速在 AI 圈传播。

Kivine 之所以引发关注,并非因为名字本身有何特殊——LMArena 上的匿名模型经常使用随机名称——而是它在能力表现上展现出了许多与 Kimi K3 传闻高度吻合的特点。

→ 关键节点:
7月15日 凌晨
@lentils80 发现 Kivine 上线 LMArena,推测其为 Kimi K3 的匿名测试版本。
数小时内
社区用户测试发现 Kivine 具备 百万 token 上下文能力,长文本处理远超常规模型。
7月14日 晚间
"Kimi K3 发布限时充值活动"页面提前泄露,很快被撤下,被视为发布物料提前曝光。
随后
网友通过抓包发现 beta.kimi.link 后台已出现 K3 相关模型信息,产品体系重新划分。

注:LMArena 是真实用户环境下的公开竞技场,模型需面对写代码、长文本总结、多步骤推理等复杂任务,其评测结果比实验室测试更具生态效度。

02能力分析 百万上下文 + 接近顶级的生成质量

Kivine 最引人注目的,是它在 长上下文生成质量 两个维度上的表现。测试用户 @kimmonismus 表示,Kivine 拥有 1M context,且在长程任务处理中表现更好。这与 Kimi 系列一贯的技术路线高度吻合。

但数据只是故事的一部分。来看看它与当前主流模型的对比:

当前主流模型(GPT-5.6 / Claude Opus 4.7)

上下文窗口通常为 128K–200K token,生成质量优秀但受限于输入长度,面对超长文档或大型代码项目时需分段处理。

Kivine(被疑为 Kimi K3)

百万 token 上下文窗口,可一次性处理整部企业资料、数十万字研究报告或大型软件项目代码。生成质量接近 Fable 级别。

生成质量:接近 Fable level ⭐⭐⭐⭐⭐
上下文长度 1,000,000+ token
生成质量 Fable 级 接近 Anthropic 顶级
生成耗时 ~35 min 单次完整生成
推理模式 高强度 质量优先

有测试用户反馈,Kivine 在复杂任务上表现突出——例如要求它制作一款类似《我的世界》的小游戏,包含中世纪城堡、森林环境、花草细节及光影效果,最终生成结果不仅包含基础玩法,还加入了寻宝机制和环境音效设计。

但一个明显的问题也随之暴露:速度。一次完整生成过程可能需要等待约 35 分钟。这几乎意味着 Kivine 使用了高强度推理模式——推理能力越强,计算成本越高,响应时间越长。

注:高强度推理模式是当前顶级模型的常见取舍——OpenAI、Anthropic 的旗舰推理模型同样面临响应时间与质量之间的权衡。Kivine 展现的是"极致质量优先"路线。

03证据链 为什么社区认定它就是 Kimi K3

如果 Kivine 只是能力出众,社区不会如此笃定地将它与 Kimi K3 挂钩。真正让猜测变得可信的,是三条独立出现的线索——它们相互印证,形成了一条完整的证据链。

🔗 线索一:充值活动页面提前泄露 已撤下

  • 7 月 14 日晚,一张"Kimi K3 发布限时充值活动"截图在 AI 圈传播,页面显示用户可在指定时间充值并获得额外奖励。
  • 该页面存在时间极短,很快被撤下,但已被社区留存截图。
  • 单独看可能是测试页面误上线,结合后续信息,更可能是提前准备好的发布物料。
可信度:高 — 页面截图经多方验证,非伪造。

🔗 线索二:beta.kimi.link 后台出现 K3 信息

  • 网友通过抓包发现,beta.kimi.link 后台已出现 K3 相关模型信息,K3 被放在默认位置,负责复杂任务处理。
  • K3 Agent 集群对应更强的自动化能力;K2.6 并未消失,而是被重新定位为快速响应模型。
  • 产品体系重新划分,透露了月之暗面未来的产品策略方向。
可信度:高 — 接口信息来自社区抓包,数据可复现验证。

🔗 线索三:社区测试成绩流出

  • 根据曝光结果,Kimi K3 在部分测试中超过 Claude Opus 4.7GPT-5.5 以及 GPT-5.6 Terra
  • 但与 GPT-5.6 SolFable 5 相比仍存在差距。
  • 这些结果目前无法得到官方验证,需保持谨慎。
可信度:中等 — 成绩未经官方确认,但多个独立测试者给出了一致的方向性结论。

注:以上三条线索相互独立,但指向同一结论。月之暗面尚未公开确认 Kivine 与 Kimi K3 的关系,也未发布任何官方技术资料。

04技术规格与传闻成绩 数据说话,但需谨慎

关于 Kimi K3 的技术规格,目前社区流传最广的说法是:超过 2.5 万亿参数、百万 token 上下文、原生多模态能力,以及新的注意力架构设计。但所有信息均未经官方确认。

传闻中的规格概览:
2.5T+ 参数规模 传闻
1M 上下文 token 已验证
原生多模态 图文理解 传闻
新架构 注意力机制 传闻

在测试成绩方面,社区流传的对比数据如下(非官方,仅供参考):

🥇 Kivine (Kimi K3)月之暗面 · 传闻
领先
Claude Opus 4.7Anthropic
被超越
GPT-5.5OpenAI
被超越
GPT-5.6 TerraOpenAI
被超越
GPT-5.6 SolOpenAI
仍有差距
Fable 5Anthropic
仍有差距

注:柱形为相对位置示意,非精确分数。测试数据来自社区流传,未经官方验证。Kivine 在部分测试中超过图中前三款模型,但与 GPT-5.6 Sol 和 Fable 5 相比仍存在差距。

一个诚实的注脚:如果最终成绩接近传闻水平,那么国产模型将不再只是"追赶者",而是开始直接参与最高水平基础模型竞争。但这一切仍需要官方发布来验证。

05编辑判断 代价与取舍的真实一面

从 LMArena 上突然出现的 Kivine,到 beta 接口中的 K3 信息,再到提前泄露的运营页面——越来越多线索汇聚,Kimi K3 已经很难再称为一个秘密。

如果最终证实 Kivine 就是 Kimi K3,这不仅是月之暗面的一次模型升级,更可能成为国产 AI 竞争格局中的一个重要节点。它代表的不是简单的参数增加,而是国产模型开始尝试进入全球顶级模型竞争。

但真正决定它商业价值的,并不是能力上限。而是它能否解决一个现实问题:

编辑核心判断

一个需要 35 分钟才能完成任务的超级模型,如何变成普通用户每天都愿意使用的 AI 助手?

对于科研、软件开发、企业分析等专业领域,如果模型能够完成过去需要数小时人工投入的任务,那么这种等待仍然具有商业价值。但大众市场的答案,取决于月之暗面能否在正式发布时给出更快的轻量版本——或者让用户接受"深度任务需要耐心"这一新习惯。

Kimi K3 可能不是没有准备好,而是在等待一个更合适的时间点。模型稳定性、成本控制、产品设计、发布节奏——每一项都是综合竞争力的一部分。技术能力只是起点,系统工程与产品化才是真正的战场。

关注进展

Kimi K3 的正式发布动态、技术报告与产品体验入口,将在月之暗面官方渠道第一时间公布。保持关注。

kimi.moonshot.cn → 了解 Kimi 系列