AI·快讯
💰 融资 · 技术突破

国内唯一多模态长记忆公司获数千万融资,押注AI主动智能的关键基础设施

丘脑智能推出原生多模态记忆基座 MemAura,以仿生记忆架构重新定义 AI 的个性化边界——Token 消耗降低近一半,检索延迟控制在 400 毫秒以内。创始人张源判断:主动智能会率先发生在 Memory 企业

2026-08-01 全文约 4 分钟读完
#丘脑智能 #多模态长记忆 #MemAura #主动智能 #种子轮
数千万元 种子轮融资 · 深圳一线基金领投
400ms 记忆检索延迟,端到端首答 < 1 秒
80%+ 综合准确率,双 SOTA 基准

⚡ 30 秒速览

  • 谁拿了钱:丘脑智能——国内唯一做多模态长记忆的公司,完成数千万元种子轮融资,团队平均 26 岁,来自阿里达摩院、腾讯、商汤。
  • 做了什么:2026 年 6 月上线原生多模态记忆基座 MemAura,采用仿生记忆架构(事件识别→编码→分区),支持冷热存储,Token 综合消耗降低 40%–49%
  • 凭什么信:联合英伟达、港科大、港中文发布全球首个多模态长记忆 Benchmark MEMLENS,27 个视觉语言模型 + 7 个 Memory Agent 同场对照,结论公开可查。
  • 核心判断:Memory 的核心不是存储,而是决策。基模与记忆企业各有分工——基模做底层推理,记忆企业做跨模态检索与状态更新。
  • 谁在用:陪伴机器人、AI 客服、数字员工等场景已接入,以 API 调用量 + 场景授权组合收费。

01基模不会吃掉 Memory 层

丘脑智能创始人张源在融资沟通中反复被问到一个问题:基模会不会自己把记忆做了?她的回答很坚定——记忆层一定会作为独立的基础设施长期存在。

理由并不复杂:用户在不同基模之间切换,记忆孤岛天然存在。

不同厂商的基模基因、训练语料、擅长任务各有差异,用户今天用这个模型,明天用那个模型,记忆无法跨模型流转。AI 从通用走向个性化的过程中,缺少一个以用户为中心的第三方记忆层——这正是丘脑智能看到的机会。

但机会背后是行业尚未解决的三个硬痛点:

💰推理成本高:海量上下文全量塞入窗口
🔗上下文断裂:跨 session 任务难以衔接
🎨模态缺失:纯文本方案无法处理视觉/音频

注:三大痛点覆盖了成本、连续性和多模态三个维度,是目前 Memory 领域最棘手的工程障碍。

张源认为,基模与记忆企业应该各有分工。她用一个对比来说明:

基模厂商

做好视觉感知、图文对齐和底层推理。把上下文窗口做得更长,优化 KV cache,专注模型能力本身。

记忆企业

做好跨模态信息检索、证据组织和状态更新。以用户为中心,持续学习,支撑个性化交互。

这一分工不仅被丘脑智能的实践验证,也被他们联合发布的 Benchmark MEMLENS 所证实——后文会详细拆解。

02MemAura:仿生记忆,原生多模态

传统记忆系统的做法是:抽取→压缩→摘要→存入原始信息库→通过图谱或向量检索。但 MemAura 走了一条不同的路——仿生记忆架构,模仿人类记忆的处理机制。

具体流程分三步:

事件识别关键信息编码隐私与非隐私分区隔离

在此基础上,采用冷热存储策略:高频访问的数据用热存储实现快速检索,低频数据用冷存储节约资源。核心数据随时可访问,同时控制成本。

性能数据方面,MemAura 在真实场景中交出了以下成绩:

40–49%输入侧 Token 综合消耗降低
400ms记忆检索延迟
< 1s端到端首次回答
80%+综合准确率

注:对比传统方案,MemAura 在延迟和 Token 支出两个客户最关心的维度上做了工程化权衡,而非盲目追求 Benchmark 高分。

在技术路线上,丘脑智能已完成两次迭代,正在探索第三次:从 STKG 时空知识图谱(在 LoCoMo 和 LongMemEval 上拿到双 SOTA),到仿生记忆架构 MemAura,再到基于 E2P(Embedding-to-Prefix)和 Transformer 微调的下一代方案——实验室环境下已实现 Token 大幅节省和近似持续学习的偏好抽取效果。

一个值得注意的细节:传统线上客服场景的延迟通常在 10 秒左右,陪伴场景在 2 秒左右,而 MemAura 将延迟压缩到 400 毫秒以内——这决定了 AI 的交互是否"像人"。

03MEMLENS:全球首个多模态长记忆 Benchmark

2026 年 5 月,丘脑智能联合英伟达、港科大、港中文发布了 MEMLENS——全球首个多模态长记忆评测基准,已开源并获 Hugging Face AI 领域 Daily Paper 前三。

他们把 27 个视觉语言大模型7 个 Memory Agent 放在同一套多模态数据下,分 4 档上下文长度(32K / 100K / 128K / 256K)做了一次完整的对照实验。三个核心发现:

发现一:全量塞入 ≠ 记忆

  • 视觉语言大模型普遍不做压缩,直接将内容全量塞入上下文窗口。长度增加后,表现急剧下降
  • Memory Agent 表现相对稳定,但大量多模态数据在写入阶段就已损失——架构设计缺陷导致信息丢失。
结论:「长上下文 ≠ 好记忆」,关键在于记忆架构的设计。

发现二:越长越容易产生幻觉

  • 无论 Memory Agent 还是视觉大模型,随着上下文长度增长,都更倾向于自信地胡说
  • 面对缺乏充分证据的问题,模型拒绝回答的能力反而下降,幻觉风险与上下文长度正相关
结论:长度本身是双刃剑——更长的上下文需要更强的记忆筛选机制来对冲幻觉。

发现三:后训练方法削弱了拒绝能力

  • 许多针对 Memory 的后训练方法,在提升记忆能力的同时,削弱了模型拒绝回答的能力
  • 这直接导致模型在面对不确定信息时更容易产生幻觉,安全性随之下降
结论:记忆训练与安全训练需要协同优化,不能顾此失彼。

MEMLENS 的深层含义是:基模厂商和记忆公司确实应该各有分工。基模做好视觉感知、图文对齐和底层推理;记忆企业做好跨模态检索、证据组织和状态更新——两者在生态位上是互补而非替代关系。

04Memory 的核心不是存储,而是决策

如果 Memory 只是存储,传统数据库和文件系统早已实现,完全不需要 AI 记忆。真正让 Memory 创造价值的,是它做出一系列判断的能力:是否写入、哪部分写入、召回什么、在什么时机主动发起召回

基于此,Memory 承载着两大核心价值:

第一,释放 AI 潜力的上限。基模的上限到 AI 真正能够触达的上限之间,存在一个关键的中间层——包括 AI 系统的复杂度,以及个性化的数据闭环(即 Memory)。这个闭环是释放 AI 潜力上限的核心基础设施。

第二,支撑主动智能。AI 的落脚点始终在人身上——服务于人、取悦于人、加速于人。Agent 的终局不应该是任务驱动的,而是状态驱动的。未来的 Agent 能基于你的历史记忆帮用户做规划,自我驱动完成任务。

一个诚实的注脚:

目前大部分 Memory 企业仍在聚焦上下文窗口和 RAG。但上下文窗口本质上是依赖前端交互维持的临时性工作记忆,不是真正的记忆;而 GraphRAG 本质上是外挂的向量数据库,缺乏对信息关联性的动态建模。真正的记忆需要追踪随时间变化的用户意图,不断更新调整——这比单纯的检索要复杂得多。

编辑核心判断

Memory 的核心不是存储,而是决策。主动智能会率先发生在 Memory 企业——因为只有掌握了用户个性化数据闭环的公司,才能在正确的时间、以正确的方式发起交互。基模与记忆企业的分工,不是一个可选项,而是释放 AI 潜力上限的必经之路。

面向企业客户开放

MemAura 以 API 调用量及场景授权组合的方式收费,客户可按需选择不同层级的记忆能力。目前已落地陪伴机器人、AI 客服、数字员工等场景。

官网申请体验