📊 智能体 · 基准评测

首个金融 Agent 个性化记忆基准 FinPerMA 发布:理论框架 + 事件驱动双引擎

FinPerMA 将认知科学中的记忆理论引入 Agent 评测,用真实金融事件序列检验智能体的个性化记忆能力——为「AI 是否真正记住了用户」提供了第一把可量化的尺子。

综合公开信息整理 2026-07-22 全文约 3 分钟读完
#FinPerMA #AI Agent #个性化记忆 #金融场景
3 层 记忆架构:工作 / 情景 / 语义
5 维 评测体系,覆盖记忆全链路
200+ 事件驱动任务,锚定真实金融场景

⚡ 30 秒速览

  • 理论根基:首次将认知科学中工作记忆、情景记忆、语义记忆三分法引入 Agent 评测设计。
  • 事件驱动:评测任务锚定真实金融事件序列,检验 Agent 记忆的时序一致性检索准确性
  • 个性化焦点:不只考「记不记得」,更考「是否记住了这个用户的偏好与决策习惯」。
  • 金融先行:覆盖财报发布、市场异动、投资决策等场景,为垂直领域 Agent 提供可复用的评测范式

01为什么需要一个「记忆基准」?

大模型 Agent 的能力竞争,正在从「智商」转向「记忆」。一个能答对数学题却记不住用户持仓偏好的金融助手,在真实场景中几乎没有价值。

但现有的 Agent 评测基准,大多聚焦于单次任务完成率——给一个指令,看结果对不对。它们几乎不考察:Agent 能否在跨会话、跨事件的长周期里,持续记住并正确调用用户的个性化信息。

换句话说:考「记性」的基准,长期缺席。

FinPerMA 的推出,正是为了填补这个空白。

传统任务基准

单次指令 → 单次结果。测「会不会做」,不测「是否记得」。

FinPerMA 记忆基准

多事件序列 → 跨会话检索。测「记得准不准」「用得好不好」。

注:传统基准解决的是「能力下限」问题,FinPerMA 试图定义「能力上限」——即 Agent 在长期关系中能积累多少有效记忆。

02FinPerMA 的底层逻辑

FinPerMA 的独特之处,在于它不是一个「拍脑袋」的任务集,而是有认知科学理论作为骨架。论文将人类记忆系统映射为 Agent 记忆的三层架构:

情景记忆事件抽取偏好建模个性化输出

每一层都有明确的评测目标。情景记忆层考察 Agent 能否从新闻、财报、交易记录中提取关键事件;偏好建模层考察能否将离散事件归纳为稳定的用户特征;个性化输出层则检验最终回答是否真正适配特定用户

记忆提取准确率
理解事件关联
保持跨会话一致性
应用个性化程度

注:四个维度分别对应记忆的「获取—组织—存储—调用」阶段,任何一环失效都会拉低综合得分。

03它具体怎么考?三个典型评测场景

📰 财报记忆:Q2 营收增速还记得吗?情景记忆

  • Agent 先后接收多份财报与新闻,随后被问及特定季度的关键指标
  • 考察能否从长文本中定位目标信息,并排除相似事件的干扰
  • 进阶难度:要求 Agent 区分「同一公司不同季度」与「不同公司同季度」的混淆项。

📈 事件关联:美联储加息如何影响用户持仓?个性化

  • 用户此前明确表示「偏好低波动资产」,Agent 需在后续分析中自动代入该偏好
  • 考察 Agent 能否将宏观事件用户微观画像结合,给出个性化判断。
  • 关键评分点:回答是否体现「记忆」,而非仅依赖通用知识。

🧠 跨会话一致:三天前的对话还记得吗?语义记忆

  • 模拟真实用户与 Agent 的多次交互,间隔数天,考验长期记忆保持
  • 用户中途可能「改变主意」,Agent 需识别偏好漂移并更新记忆。
  • 考察重点:记忆是「死记硬背」还是可更新的动态模型

04一个诚实的注脚

FinPerMA 的价值在于把「记忆」这个模糊概念工程化——它给出了可操作的评测维度,让 Agent 的记忆能力第一次可以被横向比较。

但需要清醒看待的是:该基准目前聚焦金融垂直领域,其任务设计与记忆粒度是否适用于通用场景,仍需验证。个性化记忆的评估天然带有主观性——「记住了」与「运用恰当」之间的边界,在不同用户身上可能截然不同。

此外,评测集规模与真实用户数据的分布差异,也是后续需要持续校准的课题。

05怎么读这件事

编辑核心判断

当 Agent 的能力竞争从「单次智商」转向「长期记忆」,评测基准的进化才是真正的分水岭。FinPerMA 的价值不在榜单本身,而在于它第一次把「用户是否被记住」变成了可量化、可优化的工程指标——这才是个性化 AI 走向可信的关键一步。