🧪 数据工程 · 开源框架

AI 就绪数据 6C 框架开源:6 维度 60 项量化检查,给企业数据做一次"体检"

Snowflake Labs 以开源智能体技能形式发布 AI-Ready Data 框架,将"数据是否准备好喂给 AI"这一模糊问题,拆解为 Clean / Contextual / Consumable / Current / Correlated / Compliant 六个可量化维度,配套 60+ 项检查项,每项返回 0–1 分数与诊断建议。框架按 RAG、智能体、特征服务、模型训练等五种工作负载差异化评估。

来源:企业技术博客 2026 年 全文约 4 分钟读完
#AI就绪数据 #6C框架 #数据治理 #Snowflake #开源
6 个 C 干净·上下文·可消费·最新·可追溯·合规
60+ 项 可衡量检查要求,覆盖六维度
5 种 工作负载配置,按需差异化评估

⚡ 30 秒速览

  • 核心问题:大多数 AI 项目失败不是因为模型,而是因为数据——脏数据在 AI 链路里会被嵌入、检索、放大成"自信但错误的行动"。
  • 关键洞察:"AI 就绪"不是绝对质量,而是工作负载相关——同一份数据可能适合 RAG,却极不适合训练。
  • 框架形态:开源智能体技能,指向一个 Snowflake 数据模式 + 选一种工作负载,自动跑完整评估,输出评分卡。
  • 安全设计:智能体只用经审查的 SQL 模板替换参数,不自行生成 SQL;评估期间只读,修复须逐项人工批准。
  • 合规倒计时:欧盟《人工智能法案》高风险系统义务 2026 年 8 月全面适用,距今约三个月。

01为什么"数据就绪"比"数据质量"更值得谈

传统分析里,一条脏数据顶多让仪表盘上出现一个错误数字,人看一眼就能发现。但 AI 链路不同——同一条脏数据会被嵌入、建立索引、检索,最终以一个"自信但错误的答案"呈现,甚至触发一个"自信但错误的行动"。

传统分析场景

脏数据 → 错误图表 → 人类发现问题 → 修复管道。影响范围:浪费一场会议。

AI / 智能体场景

脏数据 → 嵌入索引 → 检索放大 → 自信的错误答案 / 行动。影响随自主性提升而扩大。

更关键的是,"AI 就绪"是工作负载相关的,而非一份普适的"好数据"标准。同一份数据集,对不同任务的要求截然不同:

工作负载核心关注点
RAG分块质量、检索召回率
智能体工具契约、实时状态
特征服务亚毫秒级延迟、时间点正确性
模型训练数据规模、去重、许可授权

这意味着同一份数据可能完全适合 RAG,却极不适合用于训练,甚至会带来危险。真正的问题不是"我们的数据质量好吗?",而是"它究竟足以胜任什么工作?我们又如何证明?"

02六个 C:把"就绪"拆成可衡量的共同语言

框架把"AI 就绪"拆成六个可衡量因素,为团队提供一套共同语言——一旦有了它,"应该修复什么"的讨论就会大幅缩短。

Clean 干净

准确、完整、有效、一致,不包含会削弱 AI 行为质量的数据缺陷。脏数据在 RAG 中危害尤为突出——缺陷会在嵌入、索引、检索每一阶段不断叠加。

Snowflake 落地:数据度量函数 DMF 直接为数据表附加空值率、唯一性、新鲜度等检查;动态表提供声明式增量管道,每阶段设质量门槛。

Contextual 上下文

数据含义必须与数据本身共存,而不是放在某个 Wiki 页面或某个人脑子里。模型遇到无文档字段会"默默推断",且很可能推断错误。

Snowflake 落地:语义视图让业务含义与数据共存;通用搜索结合描述、标签、血缘让内容可发现;Cortex Analyst 基于语义定义做自然语言查询。

Consumable 可消费

具备正确的形态、速度和规模,运行时无需额外转换成本。在线特征查询需亚毫秒级延迟,向量搜索需个位数毫秒级,智能体工具调用需亚秒级响应。

Snowflake 落地:Cortex Search 提供托管式向量检索;特征存储双架构(离线批量 + 在线亚毫秒推理),内置时间点正确性。

Current 最新

模型把每条输入都当作当下真实情况,不会因数据过时而自动降级信任。智能体基于过时数据发出的邮件、执行的交易、关闭的工单,往往无法撤销。

Snowflake 落地:Streams + Tasks 实现 CDC 驱动更新;动态表声明式定义"应始终反映最新状态";新鲜度 SLA 由基础设施直接保障。

Correlated 可追溯

从数据源到最终决策全过程可追踪、复现、审计、调试。AI 事故中代价最高的一句话是:"我们不知道模型做决定时看到了哪些数据。"

Snowflake 落地:时间旅行访问历史状态;ACCESS_HISTORY 结构化记录每次查询;OpenLineage 集成把可追溯性扩展到整个技术栈。

Compliant 合规

明确的所有权、分类、脱敏、访问边界、用户同意与用途限制。个人身份信息可能经嵌入向量泄露,敏感属性可能沿特征管道传播。"读取权限"≠"行动权限"。

Snowflake 落地:Horizon Catalog 内置治理层;自动识别 150+ 种敏感数据类型;标签自动传播到下游视图;Trust Center 提供安全态势仪表板。

03一次真实运行:评分卡长什么样

框架的输出不是一份模糊的"健康报告",而是逐项打分 + PASS/FAIL 判定 + 诊断 + 修复建议。下面是对 ANALYTICS.CORE 数据模式做"Serving 就绪"评估的真实输出:

Serving Assessment: ANALYTICS.CORE 工作负载:服务
Cleandata_completeness 0.99 (need ≥ 0.98)
PASS
encoding_validity 1.00 (need ≥ 1.00)
PASS
Contextualsemantic_documentation 0.45 (need ≥ 0.90)
FAIL
column_descriptions 0.32 (need ≥ 0.80)
FAIL
Currentfreshness_sla 0.97 (need ≥ 0.95)
PASS
Summary: 4 of 6 stages passing (8 of 12 requirements passing)

每项检查 = 一项返回 0–1 分数的数据查询 + 一段诊断说明 + 一项修复方案。修复过程中每一步都需人工批准,智能体只提方案、不做决定。

评估流程的工程化设计值得注意:

指向数据模式选择工作负载运行 60+ 项 SQL 检查输出评分卡逐项诊断人工批准修复

智能体读取经审查的 SQL 模板并替换参数,不自行生成 SQL;评估期间只有读取权限;修复期间每次数据变更必须明确批准。

编辑视角 · 阅读提示

本文原始素材来自 Snowflake 官方技术博客,6C 框架与其智能体技能、开源仓库均由 Snowflake Labs 发布——这是一篇带有产品技术布道色彩的企业通稿:6C 概念本身是平台无关的,但每个 C 的"落地"段落都映射到了 Snowflake 自家产品线(DMF、语义视图、Cortex、Horizon Catalog 等)。

建议这样读:把 6C 当作一套通用的数据治理思考框架来吸收——它确实把"AI 就绪"这个模糊目标拆得相当扎实,工作负载差异化、时间点正确性、读取≠行动权限等观点都有独立价值。但具体工具实现部分需自行判断:文中提及的能力多为 Snowflake 平台内置或原生,目前未见第三方独立复测或跨平台对照;若你的技术栈不在 Snowflake 上,落地路径需自行寻找等价组件。

数据治理正从"项目交付前的最后一道检查"变成"AI 系统运行时的持续基础设施"——6C 框架的价值不在绑定某个平台,而在为这个行业提供了一套可被复用、可被争论的共同语言。

现在就能用

框架与智能体技能均已开源,安装后指向你的 Snowflake 数据模式即可运行完整评估。

GitHub 仓库 → ai-ready-data
npx skills add Snowflake-Labs/ai-ready-data -a cortex