返回行业动态
行业与市场

AI 训练数据供应商 Snorkel AI 完成 3.5 亿美元 E 轮:17 个月估值涨近两倍至 35 亿美元

Snorkel AI 于 9 月 22 日宣布完成 3.5 亿美元 E 轮融资,投后估值 35 亿美元,较 17 个月前 D 轮时的 13 亿美元接近翻三倍,由 Insight Partners 与 S32 领投。公司一年前从数据标注软件转向直接交付成品数据集与强化学习环境,称该业务近 12 个月增长 18 倍、年化收入运行率突破 3.75 亿美元。公司把支付给领域专家的费用计入销售成本而非冲减收入,这一口径与同类的数据人力市场平台显著不同。

来源:SiliconANGLE:Training data provider Snorkel AI raises $350M at $3.5B valuation原标题:Training data provider Snorkel AI raises $350M at $3.5B valuation查看原文
现代化数据厂房内部,前景为服务器机架间的走道,中景悬挂的成束光纤线缆汇聚成发光数据流,远景为厂房高窗与货架剪影,蓝紫与暖橙对比配色

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

当地时间 9 月 22 日,AI 训练数据供应商 Snorkel AI 宣布完成 3.5 亿美元 E 轮融资,投后估值 35 亿美元。本轮由 Insight Partners 与 S32 领投,Third Point、March、Blumberg、Allegis、Standard VC 与 Frontline 参与,既有股东 Addition、Lightspeed、Greylock、GV、P7、Wells Fargo、Walden Catalyst Ventures 与 Factory 继续跟投。相比公司 17 个月前完成 1 亿美元 D 轮时的 13 亿美元估值,本次估值接近翻三倍。

Snorkel AI 成立于 2019 年,创始团队出自斯坦福大学 AI 实验室,首款产品 Snorkel Flow 用于自动化数据标注。约一年前公司调整商业模式,从出售标注工具转为直接交付已完成的数据集,并把重心从监督学习扩展到强化学习:后者提供的是没有标准答案的问题,模型自行作答后由人类专家或自动系统核验并反馈,用于改进推理能力。公司称目前依托数万名人类专家生成强化学习训练任务与评测标准。

  • 增长数据:公司称 data-as-a-service 业务近 12 个月增长 18 倍,本周年化收入运行率突破 3.75 亿美元
  • 平台机制:Agentic Data Platform 让领域专家与专用 AI 智能体协同,智能体把专家给出的任务草案扩展为完整环境或数据集,并承担质量分派与初筛
  • 效率口径:公司称智能体使质检环节提速超过 50%,复核准确率提升 15 个百分点以上;在数据质量任务上的准确率是非专用前沿大模型基线的两倍以上(均为公司自述)
  • 客户结构:覆盖前沿 AI 实验室、超大规模云厂商、新兴模型公司、垂直 AI 企业、大型企业与美国政府机构
  • 财务口径:支付给领域专家的费用计入销售成本,而不是像人力市场型同行那样按净额确认收入
  • 资金用途:扩充工程、研究与市场团队,扩大 Open Benchmarks Grants 开放评测数据集资助计划(约 300 万美元规模),并投入面向 AI 对齐与安全的数据开发

为什么重要

第一,训练数据正在从「外包服务」变成「可规模化的数据基础设施」。当公开互联网语料被逐步用尽,前沿模型的能力差距越来越取决于能否获得高质量、可验证、带评测标准的领域数据,Snorkel 的估值重估与 18 倍增速是这一判断的资本侧印证。第二,强化学习环境的供应方式决定了下一阶段成本结构:相比单纯购买人力标注,交付完整环境与评分细则(rubric)的产品形态更容易被复用与审计,也更容易与客户已有的训练流水线对接,这是它区别于纯劳动力市场平台的关键。

第三,横向比较需要谨慎。同一赛道的 Mercor 已披露总年化收入约 20 亿美元、Handshake 超过 10 亿美元、Micro1 约 5 亿美元,但这些平台通常把 60% 至 70% 的收入直接支付给承接任务的专家,按净额计算的真实规模远低于毛收入数字。Snorkel 把专家费用计入销售成本的做法,使其报表上的收入更具软件业务特征。对企业采购方与投资人而言,这意味着「年化收入」在不同数据供应商之间并不是可直接比较的指标,判断依据应回到交付物形态、毛利结构与可复用程度。

不确定之处

其一,收入与效率数字均来自公司披露,没有审计或第三方复核;其二,本轮已有额外 1 亿美元的投资意向,但最终规模取决于分配与文件签署,实际交割条件与老股东权益安排未完全公开;其三,训练数据市场高度依赖前沿实验室的资本开支节奏,若模型厂商放缓预训练与强化学习投入,需求弹性会明显放大;其四,公司同时承接受美国政府机构业务,相关合同的规模与可持续性尚未单独披露。

对国内企业的参考意义在于采购视角的转变:与其把数据标注预算视作一次性人力外包,不如按「是否沉淀可复用的评测标准与环境」来评估供应商,这决定了同一笔投入能否在下一轮模型迭代中继续产生价值。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。