AI 驱动的自驾驶显微镜:大模型在真实实验任务中展示 Agent 能力
一项新研究在自驾驶显微镜评估基准上,系统测试了多种大语言模型(LLM)与多模态模型(LMM)在真实科学实验自动化中的表现,揭示了 AI 在实验室场景中的真实能力边界。
一项新研究在自驾驶显微镜评估基准上,系统测试了多种大语言模型(LLM)与多模态模型(LMM)在真实科学实验自动化中的表现,揭示了 AI 在实验室场景中的真实能力边界。
这项研究构建了一个端到端的评估基准,让 AI 扮演"实验室助理"的角色——从理解实验目标开始,到自主操作显微镜、采集图像、分析数据、得出结论。
它不同于传统视觉基准:不是简单的图像分类或目标检测,而是真正的 Agent 式任务——需要模型理解上下文、制定计划、调用工具、验证结果。
注:任务类别包括样本定位、自动对焦、图像采集、数据处理、异常检测、实验报告生成。每个任务在"规划准确度"和"执行成功率"两个维度上独立评分。
研究者在 6 类任务上测试了 GPT-4o、Gemini Pro 1.5、Claude Opus 3 等模型。结果如下(综合评分,满分 100):
注:综合评分 = 0.5 × 规划准确率 + 0.5 × 执行成功率。柱形自 45 分起缩放,非零起点。榜首与末尾分差 30.9 分。
一个诚实的注脚:所有模型在"从未见过的任务"上,平均得分下降约 40%。这意味着当前 AI 在科学实验场景中,泛化能力仍是最大短板。
研究团队专门设计了一组"跨任务泛化"测试:让在训练集上表现优异的模型,面对全新实验协议——样品类型、操作流程、分析目标都与训练数据不同。
结果令人深思:
平均得分 78.3
模型能准确模仿训练好的流程,操作稳健,错误率低。
平均得分 47.1
规划能力下降 50%,执行成功率骤降,常出现"无关步骤"或"参数错误"。
这意味着,当前的 AI 在科学实验自动化中,更像一个熟练的学徒而非真正的科学家——它能高效完成训练过的流程,但面对新问题容易手足无措。
这不是第一个 AI 科学自动化基准,但它是第一个以 Agent 为中心的显微镜实验评估。它不考"模型知不知道某件事",而是考"模型能不能把一件复杂的事做成"。
实验室场景有其特殊性:仪器操作有物理约束、数据采集有实时性、实验失败有代价。因此,它比纯数字场景更贴近真实世界中的 AI 应用。
研究同时指出,当前模型在任务分解与子目标追踪上仍有明显不足——做实验时容易"忘记"已经完成的部分,导致重复或遗漏。这是 Agent 架构长期面临的挑战。
在科学自动化领域,AI 的"记忆"与"泛化"能力,比参数规模更重要。能完成 100 个已知实验的模型,不如能自主适应第 101 个未知实验的模型。
该研究已在 arXiv 公开预印本,评估框架与实验数据可复现。作者团队承诺开源部分测试代码与示例数据。
arXiv 预印本 → 查看完整论文