AI 根因分析内核迁移:模型推理不再是瓶颈,上下文工程才是新战场
可观测性工程师们正在形成共识:大语言模型的推理能力已不再是 AI 辅助根因分析的瓶颈。更棘手的问题在于决定哪些数据能传入模型的处理流程。投入精力准备上下文信息,其回报可能比追求更强大的模型更为可观。
可观测性工程师们正在形成共识:大语言模型的推理能力已不再是 AI 辅助根因分析的瓶颈。更棘手的问题在于决定哪些数据能传入模型的处理流程。投入精力准备上下文信息,其回报可能比追求更强大的模型更为可观。
可观测性供应商 Coroot 的工程师 Nikolay Sivko 设计了一个精巧的实验,试图将"模型推理能力"与"数据采集框架"这两个变量彻底分开。
他的方法:将信号关联成调查结果,在不涉及代理循环的情况下,以单一聚焦的上下文传递给大模型。这样一来,错误答案只能归因于模型本身,而非证据缺失。
实验场景:通过 Chaos Mesh 在目录服务与 Postgres 数据库之间注入延迟,减慢查询速度并导致前端 502 错误。场景中特意包含误导性信号——因网络往返时间被夸大的查询时长。
然后,他向 11 款模型输入了相同的提示(约 9800 个 Token),要求每款模型分别给出根本原因、因果链以及即时修复方案。
注:通过标准为正确识别 Chaos Mesh 实验名称,并指出需要删除实验及其定时任务。前沿专有模型包括 Claude Opus 4.8、GPT-5.5、Gemini 3.1 Pro。
结果非常清晰:前沿模型和部分开放权重模型已能胜任推理任务。失败案例中,更大但更早的模型反而未能通过。这与 Sivko 的结论一致——"AI 能否进行根因分析?这个问题本身就是错误的"。
大多数 AI 根因分析工作可以分为两大类。但业界正从其中一种,快速转向另一种。
向模型提供工具,让其自主调查,在推理过程中选择要获取哪些遥测数据。灵活,但难以调试。
前期建立信号关联,向模型提供预准备好的上下文。Dynatrace Davis AI、Coroot 均采用此范式。
但别忘了:两种方法的故障表现形式各不相同。当诊断失败时,你很难分辨是模型推理能力不足,还是治理框架向模型提供了错误证据。
这正是 Coroot 研究的价值——它把这两个变量拆开了。
🔍 实践中的声音:Reddit 上讨论权衡取舍的工程师们表示,他们已放弃完全基于代理的设计,转而采用"小范围 LLM 步骤 + 主要为确定性工作流"的方案,理由是可靠性更高、Token 成本更低。
基于代理的方法并非没有价值。它能够捕捉到固定处理管道从未预料到的信号——对于预定义相关性集合之外的新型事件,这至关重要。
但它的代价,是失去可操作性。
确定性方法则相反:它牺牲了部分灵活性,换来了可重复性、可评估性和更低的调试成本。在当前的生产环境中,后者往往更重要。
这并不是一个"对与错"的选择,而是一个"在哪里投资"的权衡。Coroot 的研究只是一个精巧的实验,但它揭示了一个更深刻的趋势:模型能力的边界正在被工程化系统能力所重新定义。
上下文工程正在取代模型参数竞赛,成为 AI 根因分析领域最具回报率的投入方向。谁先构建出更聪明的"数据采集管道",谁就掌握了下一代 AI 可观测性的钥匙。
Coroot 已开源其评测流程,相关研究细节可在其官方博客查看。Dynatrace Davis AI 等产品已率先采用确定性上下文方案。
综合公开信息整理 → 更多阅读