🔬 可观测性 · 趋势洞察

AI 根因分析内核迁移:模型推理不再是瓶颈,上下文工程才是新战场

可观测性工程师们正在形成共识:大语言模型的推理能力已不再是 AI 辅助根因分析的瓶颈。更棘手的问题在于决定哪些数据能传入模型的处理流程。投入精力准备上下文信息,其回报可能比追求更强大的模型更为可观。

综合公开信息整理 2026-07-29 全文约 3 分钟读完
#AI RCA #上下文工程 #可观测性 #Coroot
🔑 核心转变 从"模型推理能力"到"上下文工程"
11 测试模型数量
~9800 单次调用 Token 消耗

⚡ 30 秒速览

  • 根本原因在哪里:AI 根因分析(RCA)的瓶颈已从模型推理能力,转向"决定哪些数据进入模型"的上下文工程。
  • 为什么是现在:Coroot 最新研究将模型推理与数据采集框架分离评估,证实了"推理部分基本解决,上下文工程才是关键"。
  • 两种方案的分野:基于代理的自主调查 vs 确定性预置上下文。业界正从前者转向后者,以换取可靠性。
  • 成本已不是问题:单次调用仅需几美分,相关性分析在调用模型前已完成。
  • 行业共识何在:Anthropic、LangChain、Mezmo 等均指向同一核心理念——精心筛选信号强度高且紧凑的最小上下文集合。

01为什么"推理"不再是瓶颈?一个实验证明了一切

可观测性供应商 Coroot 的工程师 Nikolay Sivko 设计了一个精巧的实验,试图将"模型推理能力"与"数据采集框架"这两个变量彻底分开。

他的方法:将信号关联成调查结果,在不涉及代理循环的情况下,以单一聚焦的上下文传递给大模型。这样一来,错误答案只能归因于模型本身,而非证据缺失。

实验场景:通过 Chaos Mesh 在目录服务与 Postgres 数据库之间注入延迟,减慢查询速度并导致前端 502 错误。场景中特意包含误导性信号——因网络往返时间被夸大的查询时长。

然后,他向 11 款模型输入了相同的提示(约 9800 个 Token),要求每款模型分别给出根本原因、因果链以及即时修复方案。

3前沿专有模型全通过
1自托管模型通过(Gemma 4 31B)
2更大模型未通过(Qwen3.6 35B 等)
推理能力已足够

注:通过标准为正确识别 Chaos Mesh 实验名称,并指出需要删除实验及其定时任务。前沿专有模型包括 Claude Opus 4.8、GPT-5.5、Gemini 3.1 Pro。

结果非常清晰:前沿模型和部分开放权重模型已能胜任推理任务。失败案例中,更大但更早的模型反而未能通过。这与 Sivko 的结论一致——"AI 能否进行根因分析?这个问题本身就是错误的"。

02两种方法,一种命运从"自主代理"到"确定性管道"

大多数 AI 根因分析工作可以分为两大类。但业界正从其中一种,快速转向另一种。

基于代理的方法

向模型提供工具,让其自主调查,在推理过程中选择要获取哪些遥测数据。灵活,但难以调试。

确定性方法

前期建立信号关联,向模型提供预准备好的上下文。Dynatrace Davis AI、Coroot 均采用此范式。

但别忘了:两种方法的故障表现形式各不相同。当诊断失败时,你很难分辨是模型推理能力不足,还是治理框架向模型提供了错误证据。

这正是 Coroot 研究的价值——它把这两个变量拆开了。

🔍 实践中的声音:Reddit 上讨论权衡取舍的工程师们表示,他们已放弃完全基于代理的设计,转而采用"小范围 LLM 步骤 + 主要为确定性工作流"的方案,理由是可靠性更高、Token 成本更低。

03为什么是"上下文工程"?三个层面的理由

💰 成本层面:推理已足够便宜单次几美分

  • 相关性分析在调用模型前已完成,模型只需处理已经筛选好的上下文。
  • 即使使用前沿模型,单次简短调用也仅需几美分。
  • 成本不是问题——问题在于"给模型什么"。
Sivko 结论:「AI RCA 的推理部分基本上已经解决」

🔧 可靠性层面:确定性胜过自由

  • 基于代理的方法难以调试——ZenML 和 Incident.io 的案例表明,多代理 LLM 调查失败时不会留下清晰的调用堆栈,只有不可预测的提示词交互。
  • 确定性管道以部分灵活性为代价,换取了可重复性和更清晰的评估。
  • 这正是业界将治理框架而非模型本身视为最困难部分的主要原因。
实践共识:「可靠性更高且 Token 成本更低」

🧠 行业共识:最小上下文集合

  • Anthropic、LangChain、Mezmo 等提供的指导意见均指向同一核心理念。
  • 对于基于 LLM 的推理和可观测性,精心筛选信号强度高且紧凑的最小上下文集合已成为确保可靠性的核心原则。
  • 下一轮工程努力应聚焦于治理框架,而非模型本身
核心原则:「上下文工程正在取代模型竞赛」

04一个诚实的注脚

基于代理的方法并非没有价值。它能够捕捉到固定处理管道从未预料到的信号——对于预定义相关性集合之外的新型事件,这至关重要。

但它的代价,是失去可操作性。

确定性方法则相反:它牺牲了部分灵活性,换来了可重复性、可评估性和更低的调试成本。在当前的生产环境中,后者往往更重要。

这并不是一个"对与错"的选择,而是一个"在哪里投资"的权衡。Coroot 的研究只是一个精巧的实验,但它揭示了一个更深刻的趋势:模型能力的边界正在被工程化系统能力所重新定义

编辑核心判断

上下文工程正在取代模型参数竞赛,成为 AI 根因分析领域最具回报率的投入方向。谁先构建出更聪明的"数据采集管道",谁就掌握了下一代 AI 可观测性的钥匙。

了解更多

Coroot 已开源其评测流程,相关研究细节可在其官方博客查看。Dynatrace Davis AI 等产品已率先采用确定性上下文方案。

综合公开信息整理 → 更多阅读