LUNAR:给大模型装"读心术"的测评基准,专治不会个性化
一篇来自知名预印本平台的论文,直指大模型在个性化能力上的系统性短板:模型知道你,但不懂你。LUNAR 基准的提出,将个性化能力拆解为可量化的评测任务,并给出首个通用用户行为日志格式。
一篇来自知名预印本平台的论文,直指大模型在个性化能力上的系统性短板:模型知道你,但不懂你。LUNAR 基准的提出,将个性化能力拆解为可量化的评测任务,并给出首个通用用户行为日志格式。
大模型正在走进每个人的生活。但一个尴尬的事实是:模型能回答世界知识,却常常记不住你上个月问过什么。这种"懂天下、不懂你"的割裂,源于个性化能力评测的长期缺位。
没有标准,就无法衡量进步。
传统基准(如 MMLU、GPQA)考的是"知识储备",而非"用户适配"。LUNAR 的出发点很直接:把个性化拆成可评测的任务,用真实行为数据说话。
考"模型知不知道",静态知识问答,与真实用户场景脱节。
考"模型懂不懂你",基于真实行为日志,动态预测用户偏好。
注:LUNAR 的评测任务全部基于真实用户行为日志构建,而非人工标注的模拟数据,更贴近实际部署场景。
LUNAR 的根基是一套全新的数据格式——通用用户行为日志(UUBL)。它把用户行为拆解为三个层级:从原始动作,到行为会话,再到行为意图。
注:UUBL 格式支持跨平台、跨场景的用户行为数据标准化,为评测提供了统一的"通用语言"。
这一层级结构,让模型不仅要"看到"用户做了什么,还要理解为什么做——这正是个性化推荐、智能助手的核心能力。
LUNAR 将个性化能力拆解为四个可独立评测的任务,每个任务都对应真实应用场景。
给定用户历史行为,预测下一步动作。评估模型的时序理解与偏好捕捉能力。
场景:个性化推荐根据用户画像生成符合偏好的行为序列。考验模型的"拟人化"程度。
场景:对话模拟从用户行为推断其显式配置(如通知偏好、隐私设置)。
场景:设备个性化在大量行为日志中检索与当前用户最相关的历史记录。
场景:记忆增强注:每个任务均采用自动化评估指标,确保评测结果的客观性与可复现性。
LUNAR 对当前主流大模型进行了系统性评测,结论并不乐观。
最先进的模型,在个性化任务上平均准确率不足 60%。
这意味着在近半数情况下,模型无法准确区分"你想要什么"和"别人想要什么"。尤其在行为生成与配置预测任务上,模型表现明显弱于行为检索——说明模型对用户偏好的深度建模能力仍然有限。
个性化任务难,难在数据格式不统一。不同平台、不同设备的行为数据各自为政,模型难以跨场景学习用户偏好。
LUNAR 的贡献在于提出 UUBL 格式,将行为数据标准化为一个通用结构:
这一抽象层级,让模型得以在更宏观的语义层面理解用户,而非停留在孤立的点击流。
有了统一语言,个性化才可能成为可学习的科学。
个性化能力将成为大模型竞争的下一个主战场。知识储备的差距正在缩小,而"懂你"的差距才刚开始被量化。LUNAR 的价值不在于给出答案,而在于第一次把问题问清楚了。
论文已在公开预印本平台发布,数据与评测代码开源,可供研究社区复现与扩展。
阅读论文全文 →