🔬 基准评测 · 个性化大模型

LUNAR:给大模型装"读心术"的测评基准,专治不会个性化

一篇来自知名预印本平台的论文,直指大模型在个性化能力上的系统性短板:模型知道你,但不懂你。LUNAR 基准的提出,将个性化能力拆解为可量化的评测任务,并给出首个通用用户行为日志格式。

来源:综合公开信息整理 2026-07-22 全文约 3 分钟读完
#LUNAR #个性化大模型 #基准测试 #用户行为
643K 真实用户行为日志(UUBL)
1.2亿+ 用户行为记录
4 核心评测任务

⚡ 30 秒速览

  • 核心问题:主流大模型在个性化任务上表现不佳,无法稳定区分不同用户的偏好。
  • LUNAR 是什么:首个基于超大规模真实用户行为日志的个性化基准,覆盖 3 个层级、4 个核心任务。
  • 数据规模:包含 643,735 条行为日志、1.2 亿+ 行为记录,全部来自真实用户。
  • 关键发现:当前最强模型在个性化任务上准确率不足 60%,与理想体验差距巨大。
  • 产业价值:为"AI 懂你"提供了可复现、可量化的评测标准,推动个性化从"玄学"走向"科学"。

01为什么需要 LUNAR?

大模型正在走进每个人的生活。但一个尴尬的事实是:模型能回答世界知识,却常常记不住你上个月问过什么。这种"懂天下、不懂你"的割裂,源于个性化能力评测的长期缺位。

没有标准,就无法衡量进步。

传统基准(如 MMLU、GPQA)考的是"知识储备",而非"用户适配"。LUNAR 的出发点很直接:把个性化拆成可评测的任务,用真实行为数据说话

传统基准

考"模型知不知道",静态知识问答,与真实用户场景脱节。

LUNAR 基准

考"模型懂不懂你",基于真实行为日志,动态预测用户偏好。

注:LUNAR 的评测任务全部基于真实用户行为日志构建,而非人工标注的模拟数据,更贴近实际部署场景。

02数据底气:史上最大真实行为日志

LUNAR 的根基是一套全新的数据格式——通用用户行为日志(UUBL)。它把用户行为拆解为三个层级:从原始动作,到行为会话,再到行为意图。

643K用户日志条数
3行为层级
4评测任务
1.2亿+行为记录总数

注:UUBL 格式支持跨平台、跨场景的用户行为数据标准化,为评测提供了统一的"通用语言"。

这一层级结构,让模型不仅要"看到"用户做了什么,还要理解为什么做——这正是个性化推荐、智能助手的核心能力。

03它考什么?四个核心任务

LUNAR 将个性化能力拆解为四个可独立评测的任务,每个任务都对应真实应用场景。

📌 行为预测

给定用户历史行为,预测下一步动作。评估模型的时序理解与偏好捕捉能力。

场景:个性化推荐

🧠 行为生成

根据用户画像生成符合偏好的行为序列。考验模型的"拟人化"程度。

场景:对话模拟

⚙️ 配置预测

从用户行为推断其显式配置(如通知偏好、隐私设置)。

场景:设备个性化

🔍 行为检索

在大量行为日志中检索与当前用户最相关的历史记录。

场景:记忆增强

注:每个任务均采用自动化评估指标,确保评测结果的客观性与可复现性。

04残酷真相:AI 还没学会"懂你"

LUNAR 对当前主流大模型进行了系统性评测,结论并不乐观。

最先进的模型,在个性化任务上平均准确率不足 60%。

这意味着在近半数情况下,模型无法准确区分"你想要什么"和"别人想要什么"。尤其在行为生成配置预测任务上,模型表现明显弱于行为检索——说明模型对用户偏好的深度建模能力仍然有限。

📊 一个具体发现 评测数据

  • 行为预测:表现最好的模型也仅达到 62.3% 的准确率,仍有近 40% 的预测与用户真实行为不符。
  • 配置预测:模型的 F1 分数普遍低于 0.5,说明推断用户显式设置的能力严重不足。
  • 规模悖论:更大的参数量并未带来个性化能力的显著提升,数据与训练策略更为关键。
结论:模型"知识丰富"与"懂你"是两种能力,当前业界对后者的投入明显不足。

05为什么难?缺乏"通用语言"

个性化任务难,难在数据格式不统一。不同平台、不同设备的行为数据各自为政,模型难以跨场景学习用户偏好。

LUNAR 的贡献在于提出 UUBL 格式,将行为数据标准化为一个通用结构:

原始动作行为会话行为意图

这一抽象层级,让模型得以在更宏观的语义层面理解用户,而非停留在孤立的点击流。

有了统一语言,个性化才可能成为可学习的科学。

编辑核心判断

个性化能力将成为大模型竞争的下一个主战场。知识储备的差距正在缩小,而"懂你"的差距才刚开始被量化。LUNAR 的价值不在于给出答案,而在于第一次把问题问清楚了。

如何获取

论文已在公开预印本平台发布,数据与评测代码开源,可供研究社区复现与扩展。

阅读论文全文