一句话看懂:Snorkel AI 完成 3.5 亿美元 E 轮融资,估值从 17 个月前的 13 亿美元涨到 35 亿美元。它从数据标注工具转向直接交付训练数据集和强化学习环境,年化收入运行率据称已达 3.75 亿美元。
事件核心:发生了什么
这笔 E 轮由 Insight Partners 和 S32 领投,Addition、Lightspeed、Greylock、GV、Wells Fargo 等老股东跟投,公司估值接近上一轮的三倍。Snorkel 由斯坦福 AI 实验室出身的 Alex Ratner 团队孵化,2019 年正式商业化,早期做的是数据标注自动化软件。去年它调整路线,转向直接向客户交付做好的数据集,官方称为 data-as-a-service,并把强化学习环境和完整数据集作为主要产品形态。
做法上它不是纯人力众包市场,而是”软件加模型合成数据 + 领域专家”的混合模式。公司称当前年化收入运行率为 3.75 亿美元,12 个月内增长约 18 倍。作为对比,同类数据公司 Mercor 的年化毛收入约 20 亿美元,Handshake 今年早些时候突破 10 亿美元,Micro1 达到 5 亿美元。需要注意,这类公司通常把六到七成收入直接付给做标注的领域专家,因此净收入远低于对外公布的口径;Snorkel 表示自己卖的是数据和环境而非人力,付给专家的费用计入成本而非收入。
为什么重要
这轮融资是 AI 训练数据需求膨胀的一个直接信号。当大模型在通用语料上的边际收益下降,厂商开始把预算投向高质量、可验证、带反馈信号的专有数据和强化学习环境,尤其是推理、Agent、代码等需要过程监督的方向。数据供应正在从”外包标注”变成一门有软件壁垒、有合成数据能力的生意,定价权和毛利结构也随之改变。对行业来说,这解释了为什么一批”AI data lab”能在短时间内跑出夸张的收入曲线,也意味着数据环节的竞争会与模型训练路线深度绑定。
对用户/开发者/创作者的影响
对开发者而言,数据集和 RL 环境逐渐成为可采购的标准化服务,做垂直 AI 应用时不必从零搭标注管线,可以把精力放在推理逻辑和产品上。对企业和内容创作者,这意味着模型厂商会用更多领域专家产出的数据持续优化能力,专业经验的”被采买”价值上升,但报酬分配仍掌握在平台手里。如果你在做开源或闭源模型微调,值得留意这类供应商是否开放 API 或按需交付小批量数据,而不是只服务头部实验室的大单。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 3.75 亿美元年化收入的口径能否持续,以及合成数据在客户评估中的实际占比;二是 Snorkel 会不会把 data-as-a-service 产品化到中小团队,价格和交付周期是否透明;三是 Mercor、Handshake 等竞品在净收入层面的表现,能否证明这门生意不是靠高额人力成本堆出来的规模。


