大模型能识别好假设吗?Logit 能量评分全面击败提示词式评审
一篇新论文提出了一个反直觉的问题:当大模型被要求评判科学假设时,我们该信它写下的文字,还是它内部的概率?实验给出的答案是——基于 logit 的能量评分,在科学假设排名任务上稳定击败提示词式 LLM-as-Judge,且不消耗任何额外生成。
一篇新论文提出了一个反直觉的问题:当大模型被要求评判科学假设时,我们该信它写下的文字,还是它内部的概率?实验给出的答案是——基于 logit 的能量评分,在科学假设排名任务上稳定击败提示词式 LLM-as-Judge,且不消耗任何额外生成。
科学发现正在被 AI 重塑。AI Scientist 每轮能生成上百条候选假设,但真正稀缺的是判断力:哪一条值得进实验室?
过去两年,主流答案是"提示词评审"——把假设扔给大模型,让它写一段打分和理由。但这篇新论文用实验证明:这条路有系统性偏差,而偏差的根源,恰恰在我们输入的提示词里。
那么,更好的方案是什么?
让模型生成分数与理由。方向直观,但受提示措辞、候选位置、表达风格影响,结果波动大。
用模型对相关 token 的 log-probability 计算能量值。一次前向传播,零额外生成,结果完全确定。
注:5 个评分维度涵盖相关性、可检验性、新颖性、简洁性与可证伪性;6 套提示词模板专门用于压力测试评审的稳定性。样本与结果均出自论文公开实验。
论文不只是给出胜者,还解剖了败者。
三个偏差,每一个都直指生成式评审的软肋。
把三种评估方式与人类专家给出的假设排名做相关分析,差距一目了然——能量评分一骑绝尘。
注:柱形自 0.3 起缩放,非零起点;数值为论文实验报告的 Spearman 一致性系数,四舍五入保留两位。默认模板与最佳模板之间的差距,本身就是评审不稳定性的证据。
一个更值得注意的细节:提示词评审的最佳成绩也追不上能量评分。这意味着差距不是"调一调提示词就能弥补"的,而是两种评估哲学的本质差异。
因为能量评分要解决的不是一个评测技巧问题,而是自动科学发现的"质检员"问题。
这整条链路上,评估环节是最脆弱的。生成器再强,如果质检员不可靠,输出只会是精心包装的噪声。能量评分提供了一条绕开提示词博弈的路径:不问模型"你觉得呢",而是直接读它"心里"的概率。
它能在哪些场景落地?
每轮生成的上百条假设,先由能量评分批量排序,人只审查 Top 10——把稀缺的人力用在刀刃上。
从论文集中抽取的候选假设自动筛出值得深挖的方向,综述从"读几百篇"变成"审一份排名"。
把预研想法批量评估,按可检验性与新颖性排序,再交给领域专家做最终判断。
一个诚实的注脚:
当大模型开始参与科学发现,真正稀缺的不再是生成能力,而是可靠的评估能力。这篇论文给出一个反直觉的提醒:模型写出的文字可以被提示词左右,但它的内部概率分布,有时比任何一句"我觉得这个假设很好"都更诚实。
论文已在 arXiv 公开,检索标题 "Do LLMs Know a Good Hypothesis When They See One?" 即可阅读全文与评测数据,所有实验均可复现。
arXiv → 搜索论文标题 ↗