从 Coding 到 Running:AI Native SRE Agent 如何理解一个持续变化的运行世界?
Coding Agent 正在提升开发效率,但系统上线后的运行治理仍高度依赖专家经验。腾讯云智能顾问技术负责人姚斌斌在 AICon 深圳站首次系统公开 AI Native SRE Agent 的方法论框架:从数据融合、语义理解到工程闭环,让 Agent 真正理解"运行中"的世界。
Coding Agent 正在提升开发效率,但系统上线后的运行治理仍高度依赖专家经验。腾讯云智能顾问技术负责人姚斌斌在 AICon 深圳站首次系统公开 AI Native SRE Agent 的方法论框架:从数据融合、语义理解到工程闭环,让 Agent 真正理解"运行中"的世界。
Coding Agent 的效率提升已成共识。但代码写完之后,系统上线了——真正的挑战才刚刚开始。
运行阶段面对的不是静态代码,而是持续变化的运行世界:服务依赖动态调整、资源水位实时波动、监控日志持续涌入、发布变更频繁执行、专家经验散落在文档与头脑中。一个 Agent 要参与运行治理,首先得回答一个根本问题:
它如何理解一个它从未"见过"的、正在变化中的系统?
面对静态代码仓库,输入输出明确,任务可拆解为函数调用与文件操作。上下文由代码本身定义。
面对动态运行系统,输入包含告警、日志、指标、变更事件,输出需要根因判断与处置建议。上下文由整个运行环境定义,且不断变化。
核心差异在于:Coding Agent 需要理解"写的是什么",SRE Agent 需要理解"发生了什么以及为什么"。后者需要的不只是语言模型,而是一个对运行世界有统一语义理解的智能系统。
让 Agent 理解运行世界,不能只靠"给 LLM 更多文档"。姚斌斌提出的方法论包含三个层次:
数据层是事实基础,融合三类来源:Infra(计算、网络、存储、数据库、容器、云资源)、Observability(Metrics、Logs、Trace、APM、Events、Alerts)、Knowledge(团队文档、SOP、Runbook、历史故障、RCA)。单一数据源无法完成诊断,Agent 需要多源运行事实的融合视图。
认知层是核心突破。不同系统中的资源、服务、实例、告警和变更往往语义不一致。通过本体、语义层和全景图谱,把分散的运行数据组织成统一的 Running World Model,让 Agent 能够理解系统对象、关系与上下文。Agent 缺少的不是更多文档,而是对运行世界的统一语义理解。
能力层是价值输出。当 Agent 建立了对运行世界的理解,它就可以围绕真实运维场景完成连续推理与决策辅助。
三层架构中,认知层是区分 SRE Agent 与"简单 LLM + 工具调用"的关键分水岭。——姚斌斌,腾讯云智能顾问技术负责人
当 Agent 建立了对运行世界的理解,它可以参与的具体场景非常直接:
这些场景的共同特征:需要跨系统、跨数据源的综合判断。根因分析不是查一条日志,而是关联告警、指标、变更、历史案例;变更风控不是读一个配置文件,而是理解变更影响的服务拓扑与上下游依赖。
SRE Agent 的价值,不是替人打开更多工具,而是帮助 SRE 在复杂运行上下文中更快形成判断,并持续提升系统治理效率。
SRE Agent 面向真实生产环境,不能只依赖一次性的 Prompt 效果。姚斌斌介绍了 Harness 框架——通过任务轨迹、工具模拟、沙箱验证、经验沉淀和能力复用,让 Agent 从"能回答"走向"可验证、可复现、可持续优化"。核心观点:Agent 也需要自己的 DevOps。
以下是一个完整的线上故障治理闭环:
SRE Agent 的真正门槛不是模型能力,而是对"运行世界"的语义建模能力。当 Agent 能从告警信号中理解系统拓扑、变更历史与业务上下文,运维的范式才真正从"人找故障"转向"系统自诊"。
上述方法论将在 2026 年 8 月 21 日—22 日 · 深圳举办的 AICon 人工智能开发与应用大会 上由姚斌斌完整呈现。大会聚焦 AI 基础设施、大模型系统、智能体工程、数据智能等关键方向,邀请来自腾讯、阿里、华为、百度等 50+ 头部科技企业技术负责人分享实战干货。
了解大会详情 →