7 个 Cortex AI 函数 1 条 SQL 管线 Snowflake

非结构化数据的结构化处理:基于 Snowflake Cortex AI Functions 的技术实践

借助 Snowflake Cortex AI Functions,将非结构化数据纳入 raw→transformed→curated 的多层数据架构,在 SQL 内直接完成实体抽取、情感评分、摘要生成等转换,使非结构化数据获得与结构化数据同等的治理、一致性与可分析性。

背景:非结构化数据长期被排除在数据治理之外

传统多层数据架构(raw→transformed→curated)是结构化数据分析的黄金标准,但企业大量非结构化数据(通话转录、支持工单、法律合同、图像与视频)仍依赖临时脚本处理,形成数据孤岛,导致洞察不一致和决策变慢。

结构化数据

raw → transformed → curated

纪律 · 清晰 · 可信

拥有成熟的 raw→transformed→curated 多层架构,具备纪律性、清晰度和可信度。

非结构化数据

临时脚本 / 数据孤岛

洞察不一致 · 决策变慢

缺乏统一转换流程,洞察不一致,决策变慢,错失价值。

非结构化数据类型:通话转录、支持工单、法律合同、图像和视频 这些数据常分散在割裂的孤岛中,只靠临时脚本处理,未纳入统一的数据治理与转换管线。

新框架:重新定义 transformed 层

新方式的核心是重新定义 transformed 阶段:利用 Cortex AI Functions 直接在 SQL 中把原始非结构化数据转换为实体抽取结果、情感评分、摘要等结构化信息,随后输出到 curated 层,用于 BI、机器学习与自然语言探索。

杂乱文本 transformed 结构化可分析

transformed 层是连接“杂乱无章的文本”和“结构化、可度量分析”的关键桥梁。

—— 技术实践观点
Stay native Align with business Create reusable assets

所有处理在 Snowflake 内部完成,提取与业务对齐的概念,并构建可复用的结构化数据资产。

非结构化数据的工作流

工作流沿用熟悉的多层模式,但在中间增加智能:raw 层通过 OpenFlow 接入原始非结构化数据;transformed 层用 Cortex AI Functions 生成结构化格式;curated 层整合其他数据集并构建 KPI;consumption 层供 BI、ML 和自然语言查询直接消费。

raw OpenFlow 连接任意来源的原始非结构化数据,保留完整文本与元数据
transformed Cortex AI Functions 将文本、音频、图像转换为结构化格式
curated KPI 整合新生成的数据集,构建 KPI 表
consumption BI / ML / NLQ BI 工具、ML pipelines、Cortex Analyst 自然语言查询

Cortex AI Functions:transformed 层的核心引擎

Cortex AI Functions 被设计为直接在数据仓库中从文本提取洞察,让分析不再停留于关键词搜索,而是执行更复杂、更贴合业务的分析。

函数名 能力 典型场景
AI_COMPLETE 从单条文本或图像记录中提取关键信息,或生成简洁摘要 单条记录 · 精细提取
AI_CLASSIFY 将内容归类到预定义业务分类,如 billing_issue、technical_support、cancellation 客户通话分类等场景
AI_FILTER 快速找出满足特定业务条件的记录,如过滤无关数据或标记投诉 过滤、标投诉 · 减少人工筛选
AI_SIMILARITY 查找相似案例或文档,匹配新问题与已知问题 已知问题匹配 · 加快处理
AI_AGG 跨大量记录汇总洞察,生成高管可读的高层摘要 curated 层总体摘要 · 高管摘要
AI_EMBED 为文本或图像生成向量 embedding,支持语义搜索与相似度比较 语义搜索 · 高级检索场景
AI_TRANSCRIBE 将音频口语转为文本,使音频数据可在 Snowflake 内搜索和分析 通话可搜索 · 扩展可处理范围

真实案例:呼叫中心分析

以客户服务组织为例,通过一条 SQL 查询组合 AI_TRANSCRIBE、AI_CLASSIFY、AI_FILTER、AI_SIMILARITY、AI_COMPLETE 等函数,将原始通话转录转换为结构化、逐行可分析的记录,并回答关键业务问题。

呼叫中心管理者 · 典型问题 “客户为什么打来电话?哪些案例属于升级处理?客户情绪趋势如何变化?哪些已知问题在反复出现?”
通话录音 AI_TRANSCRIBE 原始文本 AI_CLASSIFY 分类 / 意图
AI_FILTER 升级标记
AI_SIMILARITY 匹配分数
AI_COMPLETE 摘要
AI_AGG 本周 TOP3 客户问题
生成字段:call_intent | is_escalation_flag | known_issue_match_score | call_summary

收益:治理、复用与信任

将结构化多层框架应用到非结构化数据后,企业可获得治理与血缘、一致性与可复用性、可扩展性与信任三大类收益。

Scalability & Trust 框架可扩展到任何领域,每个结构化事实可回溯到原始文本,建立对数据的信任。
Consistency & Reusability 一条增强管线服务多个业务团队,消除孤岛与定义不一致,维持单一 source of truth。
Governance & Lineage 所有处理在 Snowflake 内部完成,审计链路和 lineage 完整保留,从原始文本到结构化洞察全程可追溯。

编辑判断

这篇文章将数据工程中成熟的多层架构理念迁移到非结构化数据领域,没有空谈大模型能力,而是用具体 SQL 示例展示了 Cortex AI Functions 的用法,对数据团队有较强的实践参考价值。其核心观点——非结构化数据也应该有 transformed 层——准确命中了企业数据治理的痛点。不过文章整体以 Snowflake 生态为背景,未讨论与其他数据平台或开源方案的对比,读者需要结合自身技术栈进行评估。

核心判断:对于已经在使用或计划采用 Snowflake 的企业,这是一份可操作性较高的技术实践指南;对于其他平台用户,其“以分层架构治理非结构化数据”的思路同样具有借鉴意义。

总结与上手步骤

这种方法让非结构化数据获得与其他数据生态相同的纪律、治理和严谨性,真正成为驱动战略决策的可信资产。

1
找到高价值数据源
如客户支持工单或销售通话,选择最能体现业务价值的数据源
2
定义提取价值
明确希望从文本中提取的具体价值,定义业务目标和结构化输出
3
实现 transformed layer
在 Snowflake 中用 Cortex AI Functions 实现非结构化 transformed layer,用 SQL 工作流落地框架