arXivLabs 提出人机协作 AI 评估框架,让大模型评测回归人类共识
一项名为 「AI Evaluation Should Work With Humans」 的研究主张,将大模型评估从纯自动化打分推向人机协作闭环——评估不再只是机器对机器的审判,而是让人类专家深度介入流程,共同定义「什么是好的 AI 输出」。
一项名为 「AI Evaluation Should Work With Humans」 的研究主张,将大模型评估从纯自动化打分推向人机协作闭环——评估不再只是机器对机器的审判,而是让人类专家深度介入流程,共同定义「什么是好的 AI 输出」。
长期以来,大语言模型的评估高度依赖自动化基准测试——模型答对一题得一分,答错扣分。这套体系高效、可复现,但有一个致命缺陷:它衡量的是「答对」,而非「有用」。
但是,数据只是故事的一部分。
「AI Evaluation Should Work With Humans」提出的核心思路是:将人类专家的判断前置到评估流程内部,而非仅作为事后的抽检校验。人类不再只是给数据集打标签的标注员,而是评估逻辑的共同设计者。
模型 vs 标准答案,固定规则打分,人类不介入流程,刷榜空间大。
模型输出 → 人类专家动态定义评分维度 → AI 辅助规模化执行 → 回溯校准。
注:对比卡展示两种评估范式的核心差异。左侧为当前主流基准(MMLU、GPQA 等)的运作逻辑,右侧为 arXivLabs 倡导的协作式框架理念,并非非此即彼,而是互补关系。
这项主张能获得关注,很大程度上因为它背后的平台——arXivLabs。这是一个允许协作者直接在 arXiv 网站上开发并共享新功能的框架,个人与机构均可参与。
arXivLabs 对合作方有四项明确的价值要求,且只与遵守这些原则的伙伴合作:
注:标签云中,蓝色为 arXivLabs 明确声明的四项核心价值,灰色为衍生能力,金色为本研究额外强调的评估原则。四项核心价值为合作门槛,缺一不可。
这意味着,任何在该框架上构建的 AI 评估工具,天然继承了开放可复现的基因——评估代码、评分逻辑、人类反馈数据均可被社区审查。
研究勾勒的协作式评估流程,并非人类逐条批改,而是将人类判断嵌入自动化链路的关键节点:
注:流程链路展示人机协作评估的四阶段闭环。第①③环节由人类主导,第②环节由 AI 执行,第④环节双向反馈。实际部署中,③的抽检比例可动态调整。
答案藏在 arXiv 的身份里:它既是全球最大的预印本平台,也是一个已经运转了 30 多年的学术社区。
社区信任,是最稀缺的评估基础设施。
AI 评估面临的最大挑战不是技术,而是公信力。一个由商业公司发布的榜单,天然被怀疑「既当裁判又当运动员」。arXiv 的非营利属性和学术社区基因,使其成为少数能被各方信任的中立平台。
arXivLabs 框架的存在,意味着评估工具的开发不再是闭门造模型,而是开放给整个社区:任何人有好的评估想法,都可以直接在平台上实现并共享。这降低了评估创新的门槛,也让评估标准更可能反映真实的人类需求。
人机协作评估并非没有代价。引入人类专家意味着更高的成本、更慢的迭代速度、更难标准化的流程。在模型迭代以周计的当下,评估流程如果跟不上节奏,就会沦为学术象牙塔里的理想主义。
但反过来看,当前纯自动化评估的「刷榜困境」已经证明:一味追求速度的评估,正在失去区分模型真实能力的分辨率。慢一点但更准,可能比快但失真更有价值。
评估框架正在成为 AI 竞争的「元战场」——谁定义了评估标准,谁就定义了什么算「好模型」。人机协作不是倒退回人工时代,而是承认:在 AI 能力逼近人类边界的领域,只有人类能判断 AI 是否真的越过了那条线。
arXivLabs 框架面向所有个人与组织开放,如有能为 arXiv 社区增值的项目想法,可了解 arXivLabs 并申请协作。
访问 arXivLabs → 提交协作提案