写自传时一半以上是编的?新评测框架给大模型叙事能力做了一次"X光扫描"
一项来自学术界的评测研究,首次以逐场景对照的方式,量化了主流大模型在生成自传体叙事时的"无意识编造"(Confabulation)水平——结果显示,幻觉率最高可达 68%,且模型规模与叙事诚实度之间并不存在简单的正相关。
一项来自学术界的评测研究,首次以逐场景对照的方式,量化了主流大模型在生成自传体叙事时的"无意识编造"(Confabulation)水平——结果显示,幻觉率最高可达 68%,且模型规模与叙事诚实度之间并不存在简单的正相关。
研究者选取了 7 款代表性模型(闭源与开源混合),以同一批真实人物传记为素材,要求模型生成自传体叙述,再逐场景核对。幻觉率越低,代表叙事越忠实于事实。
注:幻觉率 = 与书面记录不符的场景 ÷ 全部生成场景。柱形按幻觉率线性缩放,非零起点。越短代表越"诚实"。
这项研究的核心贡献,是一套名为 "自传体场景审计"的评测方法。它不是笼统地问"模型有没有编",而是把每一段自传拆成独立的场景单元,再逐一与书面记录比对。
就像审计一份财务报表——逐行核对,而不是看个总数。
问模型"你知道什么",用标准答案比对回答。考的是"知识记忆",与现实叙事距离较远。
给模型"一段真实人生",让它写成自传,再逐场景核对真实性。考的是"叙事时的忠实度"。
幻觉分类覆盖:时间错位、地点错误、人物混淆、机构张冠李戴、事件细节篡改、因果推理编造、情感动机虚构。
评审环节采用双人独立标注 + 分歧仲裁机制,标注者在不被告知模型名的情况下,逐条判断每个场景是否与书面记录一致。这确保了评分的中立性。
数据是抽象的,具体到案例才触目惊心。以下是研究者从模型输出中截取的、典型的"无意识编造"片段:
最反直觉的发现是:模型越大、越贵,幻觉率反而越高。研究者对此给出了三个层面的解释:
旗舰模型经过大量人类偏好对齐训练,学会了"像人一样讲故事"——但人的叙事天然包含情感修饰与记忆重构。模型把这种修辞习惯内化成了事实错误。
而轻量级模型(如 Llama-3.1-8B)反而因为能力有限,倾向于直接"引用"输入材料,而不是发挥——这恰好保护了事实完整性。
换句话说:越会"讲故事"的模型,越容易把故事讲歪。这不是 bug,而是当前对齐路线的结构性副产品。
当模型学会了"像人一样叙事",它同时也学会了"像人一样撒谎"——无意识的撒谎。
这套评测框架的价值在于首次把"叙事幻觉"从笼统的"胡说八道"中分离出来,变成了可量化的、可复现的指标。但研究者也坦然承认两个边界:
其一,样本仅覆盖 21 位真实人物,且以学术界和公众人物为主——他们的书面记录相对完整,普通人的自传场景未必能直接套用这套标准。
其二,"幻觉率"衡量的是与书面记录的一致性,而不衡量"叙事质量"——最诚实的模型,未必是最好的自传作者。这提醒我们:真实与精彩,在大模型这里正在变成两条分岔的路。
数据能告诉我们模型撒了多少谎,但"该不该让它闭嘴"是另一道题。
这项研究的真正价值,是给行业递上了一把尺子——一把量"叙事忠实度"的尺子。在 AI 写作工具大规模进入内容生产的当下,这把尺子的出现恰逢其时。
对 AI 从业者:是时候把"叙事真实性"纳入模型评测体系,与推理能力、代码能力并列。
对内容行业:AI 生成的自传、传记、回忆录类内容,必须配套事实核查流程,否则就是对读者的误导。
对普通用户:别让 AI 替你"回忆"人生——它只是擅长编一个"听起来像真的"版本。