AI 能不能评审 AI 科学家?多模型自动评审基准研究发布
一项新研究针对「自主研究生成系统」提出了一套多模型自动评审基准,试图回答一个元问题:当 AI 代替人类完成科研全流程时,谁来给这个 AI 打分?研究给出了自动化、可复现的评测框架,并揭示了当前自动评审的能力边界。
一项新研究针对「自主研究生成系统」提出了一套多模型自动评审基准,试图回答一个元问题:当 AI 代替人类完成科研全流程时,谁来给这个 AI 打分?研究给出了自动化、可复现的评测框架,并揭示了当前自动评审的能力边界。
随着大模型能力升级,学界已出现多个自主研究生成系统——它们能自动完成文献检索、假设生成、实验代码编写甚至论文撰写。但一个根本问题悬而未决:产出的论文质量参差不齐,谁来打分?
人类专家评审耗时长、主观性强,难以规模化。
这项研究提出的方案是:用多个大模型组成评审委员会,对自主科研系统的输出进行交叉打分。研究不仅构建了基准测试集,还系统比较了单模型评审与多模型评审的差异,给出了自动评审的可靠性边界。
单一 LLM 充当裁判,易受模型自身偏好影响,对同一篇论文的打分波动较大。
多个模型交叉打分取综合,降低单一模型偏见,提升评审稳定性与可复现性。
注:对比卡呈现的是研究提出的改进方向与传统方法的差异,具体稳定性提升幅度以原文实验数据为准。
研究将「AI 科学家」的能力拆解为多个可量化维度。不是笼统打一个分,而是对科研全链路的每个环节独立评估。
注:条形长度示意自动评审对各维度的评估可靠性,非具体得分。结构化维度(引用、严谨性)评审一致性高,开放性维度(原创性)仍是难点。
AI 做科研不再是科幻。从自动文献综述到代码实验,已有多个系统能跑完科研全流程。但如果没有可信的评审机制,这些产出就无法被学界接纳。
瓶颈不在「做」,在「验」。
这项研究的价值在于:它不回避自动评审的缺陷,而是诚实标注了能力边界——哪里可靠、哪里存疑、哪里必须留给人来判。这种诚实,恰恰是建立信任的前提。
最终的链路不是「AI 替代人类评审」,而是AI 做初筛与结构化校验,人类聚焦创新性判断——人机协作,各取所长。
一个诚实的注脚:这项研究并未证明自动评审已经「足够好」。它证明的是自动评审「可以知道自己在哪不好」——这比盲目乐观更有价值。
AI 科研的下一阶段竞争,不在模型能写出多漂亮的论文,而在能否构建一套诚实的、可校准的自动质检体系——信任,才是科研自动化的真正瓶颈。