AI Agent多步调用引发Token超支隐忧:Snowflake推出7重成本治理与硬阻断机制

随着 Agentic AI 深入企业级数据工作流,多轮模型调用极易导致 Credit 快速耗尽;Snowflake 通过建立从遥测监控、RBAC 模型管控到物理硬阻断的七重治理机制,试图解决 GenAI 成本失控痛点。

多步智能体交互催生成本黑洞,数据平台补齐治理短板

Snowflake CoCo 能够将自然语言直接转化为复杂 SQL 与多步工作流,但在多轮交互中持续调用大语言模型(LLM),若缺乏治理体系,企业账户的 Credits 极易出现异常暴涨。

智能体多步调用与遥测监控链路
用户指令
──>
CoCo推理引擎
──[多轮LLM调用]──>
Credit消耗激增 💥
(高风险)
ACCOUNT_USAGE 遥测数据视图 保留 365 天
├── 覆盖终端
CLI / Desktop / Snowsight
└── 记录维度
Input / Output / Cache Tokens
⚠️ [警告] 监控数据存在 ~5分钟 实时延迟边界
遥测数据保留时长与延迟 最长 365 天 / 约 5 分钟延迟 数据源自官方底层 ACCOUNT_USAGE 历史视图,实时监控存在数分钟延迟边界(企业官方文档说明,待第三方复测)

CoCo 的使用遥测数据被写入 ACCOUNT_USAGE 视图,覆盖 CLI、Desktop 与 Snowsight 界面,记录 input、output 及 cache tokens 的精确消耗。

从实时监控到物理封顶:7 项治理控制手段拆解

针对不同治理精度的需求,Snowflake 提供了覆盖轻量级监控、自然语言交互查询到强阻断限额的七大控制工具。

全局硬阻断
Per-user Quotas

跨 AI domains(含 CoCo、AI functions、Cortex Agents 等)的全局硬阻断,按自然月/日评估并在超限数分钟内自动封顶。

界面阻断
Per-surface 每日限额

基于滚动 24 小时窗口统计用户预估使用量,超过阈值即阻断对应界面访问。

仅预警
Budgets 预警

基于时间序列预测超支风险并触发告警,默认仅提示不阻断。

Low-latency Budget 消耗放大系数 12 倍计算成本 官方文档披露:将 Budget 刷新间隔从默认最长 6.5 小时调高至每小时 1 次,会使 Budget 自身计算消耗增加 12 倍

企业在配置预算告警时需权衡刷新频率与治理成本本身的额外开销。

在模型接入控制层面,Snowflake 正全面转向基于角色的访问控制(RBAC)。旧有的 CORTEX_MODELS_ALLOWLIST 参数拟于 2026 年 8 月锁定为 None,并于 2026 年 11 月彻底移除。

自动止损机制与自动化防护逻辑

针对 Agent 调用的长尾异常(Runaway Query),可借助定时运行的自动化 Task 进行实时识别并强制取消执行。

失控查询处理边界 无法退回已消耗 Credits 企业披露说明:强行取消仅能终止后续 Token 产生,结合视图最长 5 分钟延迟,须配合保守初始阈值使用

自动防护逻辑能够阻断后续的无效消耗,但对已经发生的 Token 费用无法进行逆向退款。

Phase 01
第一阶段:看清
基于 Usage History 和 /cost-intelligence 跑通成本消耗基线。
Phase 02
第二阶段:优化
利用 RBAC 模型访问控制,将日常需求引导至高性价比模型。
Phase 03
第三阶段:封顶
针对规模化团队叠加 Daily Limits、Quotas 及强阻断 Tasks。