🧪 论文速递 · 大模型评估

大模型能识别好假设吗?Logit 能量评分全面击败提示词式评审

一篇新论文提出了一个反直觉的问题:当大模型被要求评判科学假设时,我们该信它写下的文字,还是它内部的概率?实验给出的答案是——基于 logit 的能量评分,在科学假设排名任务上稳定击败提示词式 LLM-as-Judge,且不消耗任何额外生成

来源:综合公开信息整理 论文公开 arXiv 全文约 4 分钟读完
#LLM-as-Judge #Logit 能量评分 #科学假设 #AI Scientist #arXiv
🥇 5 / 5 胜出 能量评分在全部评分维度上超越提示词式评审
ρ +0.15 与专家排名的一致性系数显著提升
0 生成 token 只读取模型 logit,一次前向传播完成评估

⚡ 30 秒速览

  • 研究了什么:368 条科学假设、两种评估范式——提示词式评审(让模型打分排序)与 logit 能量评分(直接读取模型内部概率)。
  • 核心结论:能量评分在排名准确性与稳定性上全面优于提示词评审,且完全可复现、无模板依赖。
  • 提示词评审为何输:对措辞敏感、存在位置偏差、还会被"论文腔"文体带偏——评的不是假设质量。
  • 行业意义:AI 自动科学发现缺一个可靠的"质检员",能量评分可能是比生成式评审更便宜、更诚实的方向。
  • 诚实局限:评测停留在文本假设层面,未进入真实实验室闭环;对校准差的模型,能量评分同样会失效。

01两种评估哲学,一条分水岭

科学发现正在被 AI 重塑。AI Scientist 每轮能生成上百条候选假设,但真正稀缺的是判断力:哪一条值得进实验室?

过去两年,主流答案是"提示词评审"——把假设扔给大模型,让它写一段打分和理由。但这篇新论文用实验证明:这条路有系统性偏差,而偏差的根源,恰恰在我们输入的提示词里。

那么,更好的方案是什么?

提示词式评审(LLM-as-Judge)

让模型生成分数与理由。方向直观,但受提示措辞、候选位置、表达风格影响,结果波动大。

Logit 能量评分(Energy Scoring)

用模型对相关 token 的 log-probability 计算能量值。一次前向传播,零额外生成,结果完全确定。

368科学假设样本
2评估范式
5评分维度
6提示词模板

注:5 个评分维度涵盖相关性、可检验性、新颖性、简洁性与可证伪性;6 套提示词模板专门用于压力测试评审的稳定性。样本与结果均出自论文公开实验。

02提示词评审的三个"翻车现场"

论文不只是给出胜者,还解剖了败者。

三个偏差,每一个都直指生成式评审的软肋。

① 措辞敏感:换一个动词,排名面目全非

在 368 条假设上的系统性测试
  • 把评分指令里的 "evaluate" 换成 "assess",超过 1/5 的假设排名发生显著变化。
  • 不同措辞下,评审给出的排名甚至出现互相矛盾的结果——同一假设从"优秀"跌到"平庸"。
结论:提示词变成了隐藏的"调制器"——决定结果的不是假设质量,而是问题怎么问。

② 位置偏差:排在后半段的假设系统性低分

随机打乱候选顺序后重复测评
  • 同一假设被放在候选列表中末尾时,平均得分显著低于排在前部。
  • 这种偏差无法通过简单改写提示词消除,是生成式评审的结构性缺陷。
结论:评审结果沦为"出场顺序"的函数——这与科学假设本身毫无关系。

③ 文体溢价:写得越像论文,得分越高

把同一科学内容改写成不同文体
  • 把假设改写成"论文摘要腔"后,评分平均上涨;而科学内容一字未改。
  • 评审在奖励表达形式,而非科学有效性——这是生成式评估最隐蔽的偏差。
结论:对假设质量打分的系统,正在被"表达方式"劫持。

03一张图看懂:与专家排名的一致性

把三种评估方式与人类专家给出的假设排名做相关分析,差距一目了然——能量评分一骑绝尘

Logit 能量评分零提示词、零生成
0.79
提示词评审 · 最佳模板调优后的最优提示词
0.63
提示词评审 · 默认模板开箱即用的常规设置
0.44

注:柱形自 0.3 起缩放,非零起点;数值为论文实验报告的 Spearman 一致性系数,四舍五入保留两位。默认模板与最佳模板之间的差距,本身就是评审不稳定性的证据。

一个更值得注意的细节:提示词评审的最佳成绩也追不上能量评分。这意味着差距不是"调一调提示词就能弥补"的,而是两种评估哲学的本质差异。

04为什么这件事很关键

因为能量评分要解决的不是一个评测技巧问题,而是自动科学发现的"质检员"问题。

生成假设评估质量排序优先级进实验室验证

这整条链路上,评估环节是最脆弱的。生成器再强,如果质检员不可靠,输出只会是精心包装的噪声。能量评分提供了一条绕开提示词博弈的路径:不问模型"你觉得呢",而是直接读它"心里"的概率。

它能在哪些场景落地?

🔬

AI Scientist 假设筛选

每轮生成的上百条假设,先由能量评分批量排序,人只审查 Top 10——把稀缺的人力用在刀刃上。

📚

文献综述的方向勘探

从论文集中抽取的候选假设自动筛出值得深挖的方向,综述从"读几百篇"变成"审一份排名"。

🎯

科研选题预筛

把预研想法批量评估,按可检验性与新颖性排序,再交给领域专家做最终判断。

一个诚实的注脚:

⚠️ 论文的局限说得很清楚——评测集中在文本假设层面,尚未进入真实实验室闭环;能量评分依赖模型内部概率的校准质量,对校准差的模型可能失效。此外,该方法以编辑视角看,也更适用于"排序筛选"而非"绝对打分"。
编辑核心判断

当大模型开始参与科学发现,真正稀缺的不再是生成能力,而是可靠的评估能力。这篇论文给出一个反直觉的提醒:模型写出的文字可以被提示词左右,但它的内部概率分布,有时比任何一句"我觉得这个假设很好"都更诚实。

去读原论文

论文已在 arXiv 公开,检索标题 "Do LLMs Know a Good Hypothesis When They See One?" 即可阅读全文与评测数据,所有实验均可复现。

arXiv → 搜索论文标题