🤖 开源大模型 · 平台下场

内容平台悄悄下场造底座:280B MoE 大模型开源,激活仅 16B 参数

近日,小红书在海外低调发布并开源了自有大模型 dots3-note preview。这款 MoE 模型总参数 280B、激活参数 16B,支持 512K 上下文与文本、视觉、语音多模态理解。发布当天,海外开发者社区开始讨论,华为昇腾宣布完成适配;而在国内,这次发布暂时还没有掀起太大水花。

综合公开信息整理 事件:dots3-note preview 发布 全文约 4 分钟读完
#小红书 #dots3 #开源大模型 #MoE #多模态
280B 总参数 · MoE 激活仅 16B
512K 上下文窗口 · 文本/视觉/语音
3 亿+ 月活内容平台 · 首次公开开源底座

⚡ 30 秒速览

  • 发了什么:dots3-note preview——MoE 架构、280B 总参数 / 16B 激活、512K 上下文、三模态理解,以 Apache 2.0 协议开源。
  • 动静多大:海外社区当天开聊,Hugging Face 下载量破百,华为昇腾 0 Day 完成适配;国内暂时波澜不惊。
  • 实力如何:ARC-AGI-3 与个人助理任务超过部分更大参数模型;终端操作、复杂编程与头部仍有差距
  • 同场发布:自研评测集 VibeSearchBench(多轮搜索)与 VibeLifeBench(跨阶段任务),直指搜索与生活服务。
  • 为什么值得看:AI 在小红书内部,正从搜索、推荐、创作工具里的一个「功能」,变成支撑整套产品能力的「底座」
  • 诚实的注脚:官方承认强化学习训练仍不充分,幻觉控制与稳定性待改善,真实生活任务多数还在模拟环境里运行。

01发了什么:一块「先能上手,仍在演进」的能力模块 模型档案与系列路线图

dots3-note preview 属于 dots3 系列。这个系列此前曾在 IMO 2026 获得官方认证的满分成绩。此次发布的 note,是系列中更强调效率与实际部署的先行版本。

MoE 混合专家总参数 280B · 激活仅 16B
512K 上下文可容纳超长文档与多轮对话
三模态理解文本 · 视觉 · 语音
Apache 2.0Hugging Face 与 GitHub 同步开源
IMO 2026 满分dots3 系列此前获得官方认证
后续版本jazz / aria,覆盖不同能力与成本区间

注:系列路线图来自官方公开披露,jazz 与 aria 的实际发布时间与能力以最终版本为准。

dots3-note preview · 已开源jazzaria

也就是说,它更像是在发布一块已经能上手使用、但仍会继续演进的能力模块。

02能不能打:有惊喜,也有明显短板 从公开评测看强弱项

从公开评测看,dots3-note preview 在推理、Agent 和多模态任务中给出了有竞争力的成绩。但这份成绩单并不平均:

强项 · 超出预期

ARC-AGI-3 推理超过一部分更大参数模型
个人助理类任务同样超过一部分更大参数模型

短板 · 仍有差距

终端操作与头部模型相比仍有差距
复杂编程与头部模型相比仍有差距

注:横条为相对强度示意,非官方分数——原始报道仅给出方向性比较。这一高一低恰好说明,它不是「全能冠军」,而是一个有明确偏向的模型。

华为昇腾 0 Day 适配:模型发布当天即宣布完成适配。对开源模型来说,这种生态协作速度,是最直观的「可信度信号」之一。

03它在定义什么:两个不为榜单而生的评测集 VibeSearchBench 与 VibeLifeBench

此次与模型同时开放的,还有两个自研评测集。它们没有选择最泛化的命题。

🔍 VibeSearchBench 多轮搜索评测自研评测集

  • 考察用户意图逐步披露时的多轮搜索能力——用户不会一次说完需求。
  • 不是「答对一道题」,而是「跟住一个不断变化的人」:先问周末去哪、再补预算、又改口带上小孩。
它测的不是模型的知识量,而是搜索场景里最核心的能力:理解逐渐展开的意图

🏠 VibeLifeBench 跨阶段任务评测自研评测集

  • 聚焦非静态环境下的跨阶段任务执行——做攻略 → 订餐厅 → 生成清单 → 根据评论区反馈调整。
  • 指向真实生活服务:「找餐厅」「挑婚纱」「装修避坑」,而不是抽象问答。
两个评测集都指向搜索与真实生活服务——这恰好是小红书最可能建立差异化的领域。

换句话说,小红书不只是做一个模型,也在尝试定义:什么样的 Agent,才算真正理解用户的生活需求。

04为什么非要自己做:成本、语境与掌控力 内容平台自研模型的三个理由

一个常见的问题是:第三方模型已经足够强,为什么还要投入巨大资源自研?

答案并不复杂。对小型团队,调用 API 是合理选择;但对拥有数亿用户、高频搜索和推荐场景的平台来说,模型能力一旦成为核心链路的一部分,就很难完全依赖外部供给

调用外部 API

接入快、起步便宜;但高频场景调用量惊人,成本与价格波动带来不确定性;通用模型也难懂「挑婚纱」「装修避坑」的语境。

自研 + 开源

高频、稳定、明确的场景获得更可控的成本结构;模型理解图文笔记与评论区构成的生活语境;数据到产品反馈的闭环握在自己手里。

更关键的是,生活决策不是一次检索就能完成的任务:用户会补充条件、改变预算、比较方案,也会被图片、评论和真实体验影响。

内容生态数据模型训练产品体验用户反馈更懂语境的数据

注:这是一个自我强化的循环——数据越多、产品越好用,模型就越懂这个平台的语境;而这一切的前提,是模型能力掌握在自己手里。

当 AI 开始影响核心产品体验时,模型本身就会成为基础设施的一部分。能力边界、服务价格、迭代节奏,以及数据的使用方式,不能长期完全取决于外部供应商。

05玩家名单,还会继续变长 从云计算历史看模型分层

过去两年,大模型市场的主角似乎已经很清晰:互联网大厂、明星创业公司、科研机构。

但小红书的这次发布提醒了一件事:模型竞争不只属于模型公司。

☁️ 云计算的昨天,可能是模型的明天
01早期,大多数公司使用公共云。
02当规模、成本与业务复杂度上来,一些大平台开始自建数据中心。
03最终形成公有云、自建基础设施与混合架构并存的格局。
第一层

少数公司继续推进能力上限,提供最强的通用模型

第二层

更多平台围绕自己的数据和场景,训练或定制模型

第三层

大量中小团队仍以 API 为主要选择

注:模型正在走向类似云计算的「分层」——不是每家公司都要成为模型厂商,但会有越来越多公司把模型视为必须掌握的一层能力

已经下场的平台并不少:

字节 · 豆包腾讯 · 混元阿里 · 通义百度 · 文心小红书 · dots3

而按同样的逻辑,可能跟进的名单还可以更长:

美团 · 本地生活快手 · 内容理解电商出行游戏音乐

注:「可能跟进」为报道推测,并非确定事实。但其逻辑成立:拥有高频场景、独特数据和足够技术投入的平台,都有可能在某个节点下场。

06诚实的注脚:离「成熟的生活智能体」还很远 官方主动承认的局限

当然,它距离「一个成熟的生活智能体」还有很远。

小红书自己也没有回避这一点。它在发布中主动承认了多个未完成项:

⚠ 强化学习训练仍不充分这是当前最核心的短板。
⚠ 幻觉控制与稳定性待改善文本与多模态能力之间的平衡,也还未完全解决。
⚠ 真实生活任务多在模拟环境演示中的任务主要运行在模拟环境中,尚未经过大规模真实流量检验。
⚠ 体验 ≠ 模型榜单用户感受还取决于数据连接、工具调用、权限控制、安全机制与产品交互。

用户不会因为模型在某项基准中领先,就自然获得更好的体验。真正决定体验的,是它能不能在用户搜索、做攻略、比较商品、完成决策时,稳定地解决问题

编辑核心判断

接下来最值得看的,不是 dots3-note 会在榜单上排第几,而是三个更具体的问题:能力边界会推到哪里、模型先进搜索还是创作工具、会不会有更多握有场景与数据的平台加速下场。模型最终能造出什么,取决于它被放进什么产品、服务什么人——平台自研模型的时代,可能比我们以为的更近。

现在就能上手

模型以 Apache 2.0 协议开源,权重与评测集已在 Hugging Face 与 GitHub 同步发布。

Hugging Face · 搜「dots3-note」 GitHub · 搜「dots3」 VibeSearchBench / VibeLifeBench

华为昇腾已完成首日适配,可在昇腾硬件上直接部署体验。