🔬 科学智能 · 平台发布

化学幻觉率低至 4.6%、试错压缩至 1.19 次:XtalPi Science 发布,自主科学发现进入新范式

7 月 29 日,晶泰科技正式发布全球首个整合大语言模型、科学智能体与大规模自动化机器人实验的 AI4S 综合平台——XtalPi Science,并推出核心调度系统 Genius Agents 多智能体矩阵,贯通「数字假设—物理验证」完整闭环,将科学研究的偶然性转变为一套可编排、可验证的系统工程。

综合公开信息整理 2026-07-30 全文约 4 分钟读完
#晶泰科技 #XtalPi Science #Genius Agents #AI4S #Physical AI
4.6% 模型化学幻觉率,仅为通用大模型 1/6
81–89% 失败实验预测准确度,远超人类专家
1.19 平均试错次数,从 5–10 次极致压缩

⚡ 30 秒速览

  • 发布什么:XtalPi Science——全球首个 LLM + 科学智能体 + 自动化机器人实验三位一体的 AI4S 综合平台。
  • 核心突破:反应条件预测模型 SureRoute 化学幻觉率仅 4.6%,为通用大模型的 1/6;SureRNX 失败实验预测准确度 81%–89%,远超资深化学家 38%–60%。
  • 效率跃升:传统合成目标分子需 5–10 次试错迭代,现压缩至平均 1.19 次,研发周期从「以周为单位」降至「以天为单位」。
  • 数据壁垒:累计 50 万 + 真实实验记录,其中 80% 为传统文献中极度稀缺的「失败负样本」,构成模型的纠错底座。
  • 生态联盟:联合 27 家产业、高校及科研机构成立「科学智能开放生态联盟」,已开放平台试用申请。

01模型 vs 人类专家 数据揭示的差距

在基于 350 个真实工业分子的严苛评测中,由真实物理数据训练的反应条件预测模型 SureRoute 与 SureRNX,展现出对资深化学家的系统性超越:

🧪 SureRoute化学幻觉率
4.6%
通用大语言模型化学幻觉率(对照)
~27.6%
🎯 SureRNX失败实验预测准确度
81–89%
👤 资深化学家失败实验预测准确度(对照)
38–60%

注:柱形为示意对比,非严格等比例缩放。化学幻觉率越低越好,准确度越高越好。SureRNX 的 81%–89% 准确度对应人类专家 38%–60%,差距显著。

更直观的产业价值:SureRNX 将传统合成目标分子所需的 5~10 次试错迭代,大幅压缩至平均仅需 1.19 次。这意味着研发效率实现数量级跃升,科学不确定性正在收敛为工程可控性。

02XtalPi Science:从「单点工具」到「科学基础设施」

当前的 AI 推理大多止步于屏幕前的对话界面,「数字假设—物理验证—知识沉淀」的数据闭环尚未真正打通。传统科研体系面临两大结构性缺陷:高度依赖个人经验导致的「隐性知识缺失」,以及公开数据库几乎全为「正样本」、缺乏对模型纠错至关重要的失败数据。

传统科研范式

依赖科学家个人经验,隐性知识无法数字化;公开数据几乎全为正样本;试错周期以周或月为单位;工具碎片化,协作摩擦大。

XtalPi Science 新范式

LLM + 科学智能体 + 自动化实验贯通;80% 失败负样本沉淀;研发周期压缩至天;多智能体协同,隐性知识固化为可复用工作流。

20+工业场景覆盖
100+真实项目服务
50万+实验记录沉淀
80%失败负样本占比

数据截至 2026 年 7 月。平台每月稳定产出 5 万余条反应产率数据和 30 万条过程数据,持续反哺底层垂直模型。

—— 但数据只是结果。更关键的问题是:这套系统如何运转?

Genius Agents 作为核心调度中枢,将经典的 DMTA(设计-制造-测试-分析)循环重构为上百类研发意图,统一调度跨学科专家智能体、数百项专业工具及全球最大规模商业部署的自动化机器人实验集群。专家「隐性知识」被固化为可复用的标准化工作流(Skills),同时保留科学家在关键节点的最终判断权。

接收科研目标拆解为研发意图调用专业模型预测物理实验验证数据反馈迭代

这套体系已在晶泰内部持续高强度运行,历经多轮真实研发验证,将动辄数周甚至数月的研发周期压缩至 「以天为单位」,自主跑通从文献研读到自动化实验测试的超长科研流程。

03它已经做了什么?三个真实场景

💊 肺癌新药:AI 全程深度参与,最快 2026 下半年有望获批 临床阶段

  • 晶泰内部一款 AI 全程深度参与的肺癌新药已推进至临床阶段,有望成为最早一批由 AI 主导研发并获批上市的药物之一。
  • 从靶点发现到候选分子确定,Genius Agents 贯穿了文献调研、构效分析、ADMET 预测、合成路线规划全流程。
  • 温书豪透露:「最快预计 2026 年下半年有望在美国获批上市。」未来两到三年行业将迎来质变拐点。
趋势判断:AI 在新药研发中的核心占比正从 50%–70% 持续提升,端到端的自主发现能力正在从概念走向现实。

🔋 电池材料:3–5 年迭代周期压缩至数月 上百种配方验证

  • 传统需要 3 至 5 年迭代周期的复杂电池材料,如今依托 AI 智能体系仅需 数月 即可完成优化。
  • 平台已实现 上百种新材料配方 的快速验证,覆盖电解质、电极材料等关键方向。
  • 物理智能体系在真实实验室中完成合成、测试与数据回流,形成「预测—验证—优化」的快速闭环。
产业意义:材料研发从「经验试错」跃升为「精准预判」,高附加值场景的商业闭环正在加速形成。

🧪 合成路线预测:1.19 次试错 vs 传统 5–10 次 准确率 81–89%

  • SureRNX 模型在 失败实验预测 上的准确度达到 81%–89%,而资深化学家的对照表现仅为 38%–60%。
  • 首条合成路线准确率高达 51.7%,化学幻觉率仅 4.6%——仅为通用大语言模型的六分之一。
  • 在真实对外服务中,将传统合成目标分子所需的 5~10 次试错 压缩至平均 1.19 次,效率实现数量级提升。
底层基石:80% 的失败负样本数据构成了模型的纠错底座,这是传统公开数据库无法提供的稀缺资产。

04为什么是晶泰做出来了?

答案藏在三个关键词里:「产业数据 × 软硬一体 × 生态协同」

晶泰科技的护城河并非单一技术优势,而是近十年在产业一线沉淀的一整套组合拳。与绝大多数科技企业不同,晶泰长期扎根药企、新材料、能源化工等实体场景,积累了海量的一手产业数据——其中 80% 是传统公开文献中极度稀缺的失败负样本。这种「纠错数据」让科学模型在面对复杂未知空间时,具备了超越人类专家的认知底座。

50万+
真实实验记录,包含80% 失败负样本
每月新增 5 万+ 反应产率数据 + 30 万过程数据
20+ 类
工业场景覆盖,服务100+ 真实项目
新药与新材料发现领域持续运转
4.6%
化学幻觉率,仅为通用大模型1/6
SureRoute 模型在 350 个工业分子评测中验证
1.19 次
平均试错次数,传统需5–10 次
SureRNX 在真实对外服务中的效率数据

晶泰科技 CEO 马健表示:「未经验证的假设无法转化为知识。Genius Agents 将大模型推理、专业模型预测与物理实验无缝连接为可自我迭代的完整闭环。」这种「AI 规模化探索 + 科学家关键决策」的协作范式,正在重塑科研基础设施的基本形态。

—— 一个诚实的注脚:这套体系并非一日建成,而是近十年持续投入的结果。

温书豪指出,晶泰的壁垒还体现在软硬件结合的数据闭环与生态协同上:通过为自动化硬件赋予 AI「灵魂」,形成「硬件迭代—数据积累—模型优化」的正向循环;同时通过投资孵化生态企业,构建起协同共建的产业生态体系。行业内极少有企业能像晶泰一样集齐「学科专家经验 + 垂直领域大模型 + 智能硬件实验室」全套要素。

05编辑核心判断

✧ 独立观点

当 AI 生成科学假设的边际成本趋近于零,物理世界的真实验证成为大模型时代最稀缺的硬资产。晶泰科技证明了「失败数据」的价值——80% 的负样本不是垃圾,而是下一代科学智能的原油。Physical AI 在实验室场景率先跑通商业闭环,不是偶然,而是结构化环境、高价值验证与数据闭环三者共振的必然。科学智能的竞争,正在从「谁的模型更大」转向「谁的闭环更完整」。

现在就能用

XtalPi Science 平台已开放试用申请,面向「科学智能开放生态联盟」成员及合作高校、科研院所优先提供免费 Science Token 额度。截至 7 月 29 日中午,已有近 200 家企业、高校及科研机构提交申请。

已开放试用申请 → 面向联盟成员优先

申请渠道:晶泰科技官方渠道 · 综合公开信息整理