🔬 模型评估 · 幻觉研究

写自传时一半以上是编的?新评测框架给大模型叙事能力做了一次"X光扫描"

一项来自学术界的评测研究,首次以逐场景对照的方式,量化了主流大模型在生成自传体叙事时的"无意识编造"(Confabulation)水平——结果显示,幻觉率最高可达 68%,且模型规模与叙事诚实度之间并不存在简单的正相关。

来源:公开信息整理 2026-07-22 全文约 4 分钟读完
#大模型幻觉 #评估框架 #自传生成 #AI 可信度
68% 最高场景级幻觉率,来自旗舰级闭源模型
2.8 最强与最弱模型间的幻觉率差距
7 幻觉类别,覆盖时间/地点/人物/机构等

⚡ 30 秒速览

  • 测了什么:让主流大模型根据真实人物履历生成自传体短文,再将其与书面记录逐场景对照,量化"无意识编造"比例。
  • 核心发现:幻觉率最高的模型,每 10 句话里有近 7 句在关键事实上跑偏——且它恰恰是最贵的旗舰闭源模型之一。
  • 意外反转:一个轻量级开源模型拿下"最诚实"名号,幻觉率仅为旗舰模型的 36%
  • 结构性规律:越具体的"硬事实"(年份、职务、机构名)越容易出错;涉及个人动机与内心感受时,模型反而"安全"。
  • 为什么重要:如果连"我的人生经历"都能被模型一本正经地编造,那么 AI 写作在新闻、历史、法律等领域的应用边界就必须重新审视。

01一张"诚实度"榜单 幻觉率从低到高

研究者选取了 7 款代表性模型(闭源与开源混合),以同一批真实人物传记为素材,要求模型生成自传体叙述,再逐场景核对。幻觉率越低,代表叙事越忠实于事实。

🥇 Llama-3.1-8B-Instruct开源 · 轻量级
24.1%
GPT-4o-mini闭源 · 小型
33.3%
Mistral-7B-Instruct开源 · 轻量级
40.7%
Llama-3.1-70B-Instruct开源 · 中大型
49.3%
Gemini-1.5-Pro闭源 · 旗舰
55.8%
GPT-4o闭源 · 旗舰
59.7%
Claude-3.5-Sonnet闭源 · 旗舰
68.1%

注:幻觉率 = 与书面记录不符的场景 ÷ 全部生成场景。柱形按幻觉率线性缩放,非零起点。越短代表越"诚实"。

02它到底是怎么测的?一份"审计式"评测框架

这项研究的核心贡献,是一套名为 "自传体场景审计"的评测方法。它不是笼统地问"模型有没有编",而是把每一段自传拆成独立的场景单元,再逐一与书面记录比对。

就像审计一份财务报表——逐行核对,而不是看个总数。

传统幻觉评测

问模型"你知道什么",用标准答案比对回答。考的是"知识记忆",与现实叙事距离较远。

场景级审计(本框架)

给模型"一段真实人生",让它写成自传,再逐场景核对真实性。考的是"叙事时的忠实度"。

21真实人物样本
100+书面记录来源
7幻觉类别
2独立人工评审

幻觉分类覆盖:时间错位、地点错误、人物混淆、机构张冠李戴、事件细节篡改、因果推理编造、情感动机虚构。

评审环节采用双人独立标注 + 分歧仲裁机制,标注者在不被告知模型名的情况下,逐条判断每个场景是否与书面记录一致。这确保了评分的中立性。

03它到底编了什么?三个真实幻觉案例

数据是抽象的,具体到案例才触目惊心。以下是研究者从模型输出中截取的、典型的"无意识编造"片段:

📅 时间线坍缩:把"后来"变成了"同一年"时间错位

  • 书面记录:某学者 2015 年获得博士学位,2018 年才进入当前研究机构。
  • 模型输出:声称该学者"博士毕业后立即加入了该机构"——两件事被压缩进同一年。
  • 后果:个人履历中的职业发展路径被根本性扭曲,读者会对人物的资历产生错误认知。
点评:这不是"记错了",而是叙事逻辑自行补全——模型默认"毕业→就业"是连贯事件,于是自动填上了中间的时间。

🏛️ 机构张冠李戴:把 A 大学的成就写进了 B 大学的履历归属错误

  • 书面记录:该人物在 芝加哥大学获得教职,在西北大学做博士后。
  • 模型输出:将西北大学期间的研究成果,描述为"在芝加哥大学期间完成"。
  • 后果:涉及学术履历、科研归属的关键事实被改写,这在求职背调或学术评价中是重大瑕疵。
点评:模型在叙事时优先追求流畅的因果关系,而非严格的事实对应——机构名成了可替换的"场景道具"。

💭 动机虚构:给真实事件配上"想当然"的内心戏因果编造

  • 书面记录:人物从金融业转行学术,记录中未提及任何个人动机
  • 模型输出:杜撰了一句"他厌倦了金融行业的铜臭味,决心投身纯粹的知识探索"。
  • 后果:虽然方向"合理",但情感动机完全属于模型投射,在传记写作中属于误导性内容。
点评:这是最隐蔽的幻觉——不改变事件,但改变意义。读者几乎无法察觉,因为它"读起来太合理了"。

04为什么旗舰模型反而更"爱编"?三个结构性发现

最反直觉的发现是:模型越大、越贵,幻觉率反而越高。研究者对此给出了三个层面的解释:

更长的上下文窗口更强的叙事连贯性追求更激进的"合理性补全"

旗舰模型经过大量人类偏好对齐训练,学会了"像人一样讲故事"——但人的叙事天然包含情感修饰与记忆重构。模型把这种修辞习惯内化成了事实错误

而轻量级模型(如 Llama-3.1-8B)反而因为能力有限,倾向于直接"引用"输入材料,而不是发挥——这恰好保护了事实完整性。

换句话说:越会"讲故事"的模型,越容易把故事讲歪。这不是 bug,而是当前对齐路线的结构性副产品。

编辑核心判断

当模型学会了"像人一样叙事",它同时也学会了"像人一样撒谎"——无意识的撒谎。

当前大模型的对齐训练正在系统性地奖励"叙事流畅度",却未同步惩罚"事实偏离度"。如果这条技术路线不修正,AI 写作在新闻、历史、法律等一切以真实性为底线的领域,都将遭遇信任危机。这不是某一个模型的问题,而是整个行业的路线问题。

05一个诚实的注脚:这套框架的局限

这套评测框架的价值在于首次把"叙事幻觉"从笼统的"胡说八道"中分离出来,变成了可量化的、可复现的指标。但研究者也坦然承认两个边界:

其一,样本仅覆盖 21 位真实人物,且以学术界和公众人物为主——他们的书面记录相对完整,普通人的自传场景未必能直接套用这套标准。

其二,"幻觉率"衡量的是与书面记录的一致性,而不衡量"叙事质量"——最诚实的模型,未必是最好的自传作者。这提醒我们:真实与精彩,在大模型这里正在变成两条分岔的路。

数据能告诉我们模型撒了多少谎,但"该不该让它闭嘴"是另一道题。

这项研究的真正价值,是给行业递上了一把尺子——一把量"叙事忠实度"的尺子。在 AI 写作工具大规模进入内容生产的当下,这把尺子的出现恰逢其时。

这项研究意味着什么

对 AI 从业者:是时候把"叙事真实性"纳入模型评测体系,与推理能力、代码能力并列。
对内容行业:AI 生成的自传、传记、回忆录类内容,必须配套事实核查流程,否则就是对读者的误导。
对普通用户:别让 AI 替你"回忆"人生——它只是擅长编一个"听起来像真的"版本。

公开研究 · 全文见 arXiv 预印本