给 AI 运维立标尺:InfraBench 从层、生命周期、风险三维度考核基础设施智能体
近日,面向基础设施智能体的开源评测框架 InfraBench 正式发布。它把「AI 运维靠不靠谱」拆成 层、生命周期、风险 三个维度——不考模型知不知道,只考它能不能在真实系统上安全地把事办成。
近日,面向基础设施智能体的开源评测框架 InfraBench 正式发布。它把「AI 运维靠不靠谱」拆成 层、生命周期、风险 三个维度——不考模型知不知道,只考它能不能在真实系统上安全地把事办成。
过去两年,几乎每月都有新的 AI 运维智能体发布:能看日志、能定位故障、能在凌晨三点自动重新拉起崩溃的集群。
它们看起来什么都能干。
但有一个问题始终没有答案——怎么证明它们真的可靠?大模型评测早已成熟,基础设施智能体却是另一回事:它在真实系统里执行动作,任何一步失误都可能造成线上事故。能答对题,和能不闯祸地把事办完,是两种完全不同的能力。
考「知不知道」:静态问答、单轮作答。
无后果、无环境,测的是知识储备与推理能力。
考「能不能安全办成」:多步执行、真实工具调用。
带风险约束,测的是执行可靠性与工程能力。
注:这并不是否定传统评测的价值——知识问答对模型能力仍是有效度量。两者的分界线在于:前者测「想得到」,后者测「做得到」,而基础设施智能体的价值恰恰落在后者。
InfraBench 把「一个 AI 运维靠不靠谱」拆成三个可以独立打分的问题。
第一问,它管得住哪些层?第二问,它跑得完哪些环节?第三问,它知不知道自己在玩火?
注:上方链路展示了 InfraBench 的任务生成逻辑——六个生命周期阶段为:部署、配置、监控、排障、扩容、退役;层、环节、风险各取一项,交叉构成一个具体任务。最终给出的不是单一总分,而是三个维度各自的剖面视图,避免「一好遮百丑」。
评测基准行业有个老问题:标准往往掌握在利益相关方手里。自己出题自己考,分数再高也缺说服力。
InfraBench 选择了另一条路。
它经由 arXivLabs 发布。arXivLabs 是 arXiv 面向开发者与机构开放的协作框架,允许合作者在 arXiv 上直接构建和分享新能力——前提是认同其价值观:开放、社区、卓越、用户数据隐私。这决定了 InfraBench 的定位更接近「公共研究基础设施」,而非商业营销工具。
评测任务与打分逻辑向社区公开,不搞封闭榜单。
任何团队可提交任务、复现结果、参与共建数据集。
以学术标准约束评测设计,压缩「刷榜式指标」的生存空间。
评测遵循数据隐私约束,不把用户数据当作测试燃料。
注:可被审计,是评测基准可信的前提。封闭榜单只能证明「跑得高」,开放基准才能证明「测得准」。
一套中立、可复现的开源基准,会在三个方向上改变基础设施智能体的生态。
对厂商、对用户、对研究者,账各不相同。
另一个现实是:从基准发布到行业普遍采纳,通常要经过数个版本的迭代。arXivLabs 上的第一批任务只是起点,不是终点。
基础设施智能体的竞争,正从「谁的模型更聪明」转向「谁的系统更可靠」。在一个厂商各执一词的市场里,来自学术社区的中立基准,是少数能让各方都认账的标尺。模型决定智能的上限,工程与标准决定落地的下限——后者,才是运维 Agent 真正的生死线。
项目已通过 arXivLabs 开源开放。研究者与工程师可前往 arXiv 官网进入 arXivLabs 页面,查看 InfraBench 的项目说明、任务样例与共建方式。
arXivLabs → 查看 InfraBench 项目