一句话看懂:Snowflake 正在把非结构化数据(通话录音、合同、工单)纳入其数据仓库体系,借助 Cortex AI Functions 在 SQL 中直接完成文本分类、摘要、情感分析等处理,让这部分数据也能进入标准化的分析管线。
事件核心:发生了什么
InfoQ CN 发布的技术实践文章显示,Snowflake 提出了一套针对非结构化数据的三层处理框架:raw、transformed、curated。其中 transformed 层是新增的关键环节,直接调用 Cortex AI Functions,在 SQL 查询里把原始文本转换为实体抽取结果、情感评分、摘要等结构化信息。
这套方案依赖的具体函数包括:AI_COMPLETE(提取关键信息)、AI_CLASSIFY(按业务分类)、AI_FILTER(筛选条件记录)、AI_SIMILARITY(相似案例匹配)、AI_SUMMARIZE_AGG(跨记录汇总)、AI_EMBED(生成向量)、AI_TRANSCRIBE(音频转文字)。所有处理都在 Snowflake 内部完成,无需把数据导出到外部 NLP 服务。
文章还给出了呼叫中心场景的示例:音频转录后,用 AI_CLASSIFY 判断通话意图(billing_issue、technical_support、cancellation),用 AI_FILTER 识别升级投诉线索,用 AI_SIMILARITY 匹配已知问题,再通过 AI_AGG 生成供高管阅读的周度问题摘要。
为什么重要
非结构化数据长期游离在企业分析体系之外,通常依赖临时脚本单独处理,结果不可复用、缺乏统一口径。Snowflake 的做法是把文本分析能力下沉到数据仓库本身,让非结构化数据走和结构化数据相同的治理、血缘和审计链路。
这意味着数据处理团队可以在不引入额外工具的情况下,把通话记录、合同文本、工单内容变成可查询、可回溯的结构化资产。对于已经在使用 Snowflake 的企业来说,降低了尝试 AI 分析的门槛,也为后续接入 BI 报表或机器学习管线提供了更干净的数据基础。
对用户/开发者/创作者的影响
对数据工程师和数据分析师而言,最直接的变化是:过去需要编写 Python 脚本调用外部大模型 API 的流程,现在可以通过几条 SQL 语句完成,且数据不需要离开 Snowflake 环境,治理和合规层面的顾虑更少。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对于业务团队,这个方案意味着更多业务数据可以被量化——客户情绪、投诉升级率、合同关键条款等都能进入仪表盘,不再依赖人工抽读。文章中的 SQL 示例展示了如何用 AI_COMPLETE 结合 Claude 3.5 Sonnet 生成单句摘要,说明大模型能力正在被封装成可重复调用的数据仓库函数。
目前公开信息显示,这套框架的适用边界取决于 Cortex AI Functions 的可用性和计价方式,使用成本尚未在文章中披露。
值得关注的后续
一是观察 Cortex AI Functions 在不同行业的具体落地效果,尤其是法律合同审查、金融客服质检这类对准确性要求较高的场景,函数输出能否满足业务验收标准。
二是关注定价策略。AI 函数的调用频率远高于传统 SQL 查询,如果按 token 或按调用次数计费,企业需要评估大规模处理非结构化数据的成本是否可控。
三是竞品动向。Databricks 和 BigQuery 同样在推进数据仓库内置 AI 能力,如果 Snowflake 这一步棋被验证有效,头部云数据平台之间的功能差距可能会进一步拉大。
来源:InfoQ CN


