首个金融 Agent 个性化记忆基准 FinPerMA 发布:理论框架 + 事件驱动双引擎
FinPerMA 将认知科学中的记忆理论引入 Agent 评测,用真实金融事件序列检验智能体的个性化记忆能力——为「AI 是否真正记住了用户」提供了第一把可量化的尺子。
FinPerMA 将认知科学中的记忆理论引入 Agent 评测,用真实金融事件序列检验智能体的个性化记忆能力——为「AI 是否真正记住了用户」提供了第一把可量化的尺子。
大模型 Agent 的能力竞争,正在从「智商」转向「记忆」。一个能答对数学题却记不住用户持仓偏好的金融助手,在真实场景中几乎没有价值。
但现有的 Agent 评测基准,大多聚焦于单次任务完成率——给一个指令,看结果对不对。它们几乎不考察:Agent 能否在跨会话、跨事件的长周期里,持续记住并正确调用用户的个性化信息。
换句话说:考「记性」的基准,长期缺席。
FinPerMA 的推出,正是为了填补这个空白。
单次指令 → 单次结果。测「会不会做」,不测「是否记得」。
多事件序列 → 跨会话检索。测「记得准不准」「用得好不好」。
注:传统基准解决的是「能力下限」问题,FinPerMA 试图定义「能力上限」——即 Agent 在长期关系中能积累多少有效记忆。
FinPerMA 的独特之处,在于它不是一个「拍脑袋」的任务集,而是有认知科学理论作为骨架。论文将人类记忆系统映射为 Agent 记忆的三层架构:
每一层都有明确的评测目标。情景记忆层考察 Agent 能否从新闻、财报、交易记录中提取关键事件;偏好建模层考察能否将离散事件归纳为稳定的用户特征;个性化输出层则检验最终回答是否真正适配特定用户。
注:四个维度分别对应记忆的「获取—组织—存储—调用」阶段,任何一环失效都会拉低综合得分。
FinPerMA 的价值在于把「记忆」这个模糊概念工程化——它给出了可操作的评测维度,让 Agent 的记忆能力第一次可以被横向比较。
但需要清醒看待的是:该基准目前聚焦金融垂直领域,其任务设计与记忆粒度是否适用于通用场景,仍需验证。个性化记忆的评估天然带有主观性——「记住了」与「运用恰当」之间的边界,在不同用户身上可能截然不同。
此外,评测集规模与真实用户数据的分布差异,也是后续需要持续校准的课题。
当 Agent 的能力竞争从「单次智商」转向「长期记忆」,评测基准的进化才是真正的分水岭。FinPerMA 的价值不在榜单本身,而在于它第一次把「用户是否被记住」变成了可量化、可优化的工程指标——这才是个性化 AI 走向可信的关键一步。