⚙️ 智能体 · 工程实践

从 Coding 到 Running:AI Native SRE Agent 如何理解一个持续变化的运行世界?

Coding Agent 正在提升开发效率,但系统上线后的运行治理仍高度依赖专家经验。腾讯云智能顾问技术负责人姚斌斌在 AICon 深圳站首次系统公开 AI Native SRE Agent 的方法论框架:从数据融合、语义理解到工程闭环,让 Agent 真正理解"运行中"的世界。

综合公开信息整理 2026-07-22 全文约 4 分钟读完
#SRE Agent #Coding Agent #Running World Model #AICon #运维智能体
🧠 三层架构 数据层 → 认知层 → 能力层,构建可推理的运行世界模型
6+ 运行治理场景:架构可视化、健康巡检、根因分析、容量规划、变更风控、FinOps
1 工程闭环:Harness 驱动 Agent 从"能回答"走向"可验证、可复现、可持续优化"

⚡ 30 秒速览

  • SRE Agent 不是 Coding Agent 的延伸:Coding Agent 解决开发效率,SRE Agent 面对的是上线后服务依赖、资源变化、监控日志、发布变更交织的复杂运行世界。
  • 核心难题:单一数据源无法完成诊断。Agent 需要融合 Infra、可观测性数据与运维知识三大类事实基础。
  • 关键突破:通过本体、语义层和全景图谱,把分散的运行数据组织成统一的 Running World Model,让 Agent 真正理解系统对象、关系与上下文。
  • 工程闭环:Harness 提供任务轨迹、工具模拟、沙箱验证、经验沉淀与能力复用,让 SRE Agent 可落地、可进化。
  • 一个案例:从 CPU 告警开始,Agent 自主完成应用→资源→部署→变更的全链路分析,匹配历史经验与 Runbook,输出根因判断与处置建议,并将过程沉淀为可复用经验。

01为什么 Coding Agent 不够?运行世界是另一回事

Coding Agent 的效率提升已成共识。但代码写完之后,系统上线了——真正的挑战才刚刚开始。

运行阶段面对的不是静态代码,而是持续变化的运行世界:服务依赖动态调整、资源水位实时波动、监控日志持续涌入、发布变更频繁执行、专家经验散落在文档与头脑中。一个 Agent 要参与运行治理,首先得回答一个根本问题:

它如何理解一个它从未"见过"的、正在变化中的系统?

Coding Agent

面对静态代码仓库,输入输出明确,任务可拆解为函数调用与文件操作。上下文由代码本身定义。

SRE Agent

面对动态运行系统,输入包含告警、日志、指标、变更事件,输出需要根因判断与处置建议。上下文由整个运行环境定义,且不断变化。

核心差异在于:Coding Agent 需要理解"写的是什么",SRE Agent 需要理解"发生了什么以及为什么"。后者需要的不只是语言模型,而是一个对运行世界有统一语义理解的智能系统。

02三层架构:从数据到认知再到能力

让 Agent 理解运行世界,不能只靠"给 LLM 更多文档"。姚斌斌提出的方法论包含三个层次:

📡 数据层🧠 认知层🛠️ 能力层

数据层是事实基础,融合三类来源:Infra(计算、网络、存储、数据库、容器、云资源)、Observability(Metrics、Logs、Trace、APM、Events、Alerts)、Knowledge(团队文档、SOP、Runbook、历史故障、RCA)。单一数据源无法完成诊断,Agent 需要多源运行事实的融合视图。

认知层是核心突破。不同系统中的资源、服务、实例、告警和变更往往语义不一致。通过本体、语义层和全景图谱,把分散的运行数据组织成统一的 Running World Model,让 Agent 能够理解系统对象、关系与上下文。Agent 缺少的不是更多文档,而是对运行世界的统一语义理解。

能力层是价值输出。当 Agent 建立了对运行世界的理解,它就可以围绕真实运维场景完成连续推理与决策辅助。

3数据来源
1统一语义模型
6+治理场景
1工程闭环

三层架构中,认知层是区分 SRE Agent 与"简单 LLM + 工具调用"的关键分水岭。——姚斌斌,腾讯云智能顾问技术负责人

03六大治理场景 SRE Agent 能做什么

当 Agent 建立了对运行世界的理解,它可以参与的具体场景非常直接:

🏛️ 架构可视化 🩺 健康巡检 🔍 根因分析 📊 容量规划 🛡️ 变更风控 💰 FinOps 优化

这些场景的共同特征:需要跨系统、跨数据源的综合判断。根因分析不是查一条日志,而是关联告警、指标、变更、历史案例;变更风控不是读一个配置文件,而是理解变更影响的服务拓扑与上下游依赖。

SRE Agent 的价值,不是替人打开更多工具,而是帮助 SRE 在复杂运行上下文中更快形成判断,并持续提升系统治理效率。

04工程闭环与一个真实案例从"能回答"到"可验证"

SRE Agent 面向真实生产环境,不能只依赖一次性的 Prompt 效果。姚斌斌介绍了 Harness 框架——通过任务轨迹、工具模拟、沙箱验证、经验沉淀和能力复用,让 Agent 从"能回答"走向"可验证、可复现、可持续优化"。核心观点:Agent 也需要自己的 DevOps。

以下是一个完整的线上故障治理闭环:

🔔 一次 CPU 告警的完整治理 全链路闭环

  • 触发:Agent 收到一条 CPU 告警,不只看指标数值,而是理解告警背后的应用、资源、部署和变更
  • 分析:结合日志与 Trace 进行关联分析,定位到某次发布变更导致的内存泄漏,进而引发 CPU 持续攀升。
  • 诊断:匹配历史经验库中的类似故障模式与 Runbook,确认根因并评估影响范围。
  • 处置:输出根因判断与处置建议——回滚变更并扩容临时资源,同时触发变更风控流程。
  • 沉淀:处理过程被完整记录,经 Harness 验证后沉淀为可复用的经验,下次同类告警可直接匹配。
关键洞察:Agent 不是简单调用 LLM 看日志,而是在运行世界模型中完成了"告警→应用→变更→根因→处置→经验"的完整闭环推理。
编辑核心判断

SRE Agent 的真正门槛不是模型能力,而是对"运行世界"的语义建模能力。当 Agent 能从告警信号中理解系统拓扑、变更历史与业务上下文,运维的范式才真正从"人找故障"转向"系统自诊"。

完整分享即将呈现

上述方法论将在 2026 年 8 月 21 日—22 日 · 深圳举办的 AICon 人工智能开发与应用大会 上由姚斌斌完整呈现。大会聚焦 AI 基础设施、大模型系统、智能体工程、数据智能等关键方向,邀请来自腾讯、阿里、华为、百度等 50+ 头部科技企业技术负责人分享实战干货。

了解大会详情