跳转至

商业预训练数据供应商

更新日期:2026-04-26

时效

定价、融资轮次、产品线变化频繁。本页是 2024 末-2026 初公开信息汇总,下手前直查官网。

预训练数据有三种来源:自爬 / 公开开源 / 商业采购。这里讲第三种 —— 谁在卖、卖什么、什么场景该买。


一、市场格局

flowchart LR
    A["上游<br/>原始数据生产"] --> B["中游<br/>清洗/打包"]
    B --> C["下游<br/>训练消费"]

    A1["Common Crawl Foundation<br/>(免费, 上游基底)"] --- A
    A2["Internet Archive<br/>(免费, 历史数据)"] --- A
    A3["商业爬虫<br/>(Bright Data / Apify)"] --- A

    B1["开源清洗发布<br/>FineWeb / DCLM / RedPajama / Dolma"] --- B
    B2["商业清洗服务<br/>DatologyAI"] --- B
    B3["数据托管<br/>HuggingFace"] --- B

    C1["Frontier Lab<br/>OpenAI/Anthropic/Google"] --- C
    C2["规模训练方<br/>初创/学术"] --- C

    classDef supplier fill:#fff,stroke:#cc785c;
    class A,B,C,A1,A2,A3,B1,B2,B3,C1,C2 supplier

收费模式分三类

  1. 采购原始抓取(按 GB / 按抓取数)—— Bright Data 等
  2. 采购清洗后语料(一次性 license / 订阅)—— DatologyAI / 部分企业 license 给 frontier lab
  3. 托管 / curation as a service(按工作量)—— HuggingFace Pro / DatologyAI

二、关键玩家

2.1 Common Crawl Foundation

身份:美国 501©(3) 非营利。定位"互联网 Wikipedia 的 crawl 版"。

  • 价格:完全免费(AWS Public Dataset,下载只算自己 egress)
  • 覆盖:每月 ~3-5 B URLs,~300-400 TB 压缩
  • 限制:严格 robots.txt、不抓 SPA / 登录后;详见 archives.md
  • 状态:活跃,月度 cadence 稳定

何时考虑替代:自爬补充长尾、SPA / 登录后内容。

2.2 Together AI

togethercomputer.com。开源数据 + 训练 infra。

产品 价格
RedPajama V1(1.2T tokens)/ V2(30.4T deduped) 免费 开源(HF Datasets / 自家 mirror)
Together GPU 训练平台 $1-3 / GPU·hr,竞争 H100 现货
Together Inference $0.1-1.0 / M tokens,open model 推理

核心定位:数据送你免费,让你在他们家 GPU 上训练。

2.3 HuggingFace Datasets Hub

huggingface.co/datasets

  • 免费:托管所有公开数据集(FineWeb / DCLM / The Stack v2 等)
  • Pro 订阅($9/月起):私有 dataset、更高 storage quota、优先 CI
  • Enterprise:自托管、合规 audit、SLA

实际作用几乎所有公开预训练数据的事实分发渠道。frontier 团队也在 HF 上开私有 dataset 给合作伙伴。

2.4 DatologyAI

datologyai.com。最近最热的"data curation as a service"。

  • 融资:$46M Series A(2024,Felicis 领投,Google Ventures 跟投)
  • 创始人:Ari Morcos(前 Meta FAIR / DeepMind data scaling 研究者)
  • 产品:客户给 raw data 池子(自己抓的 / 买的),DatologyAI 跑专有 curation pipeline(dedup + 质量分类 + mixture optimization)输出训练就绪语料
  • 定价:未公开,估计按训练 token 量级 / 按工程 retainer 计
  • 客户:未完全公开,但 OpenAI / Anthropic 类的 frontier customer
  • HF 组织huggingface.co/datologyai — 公开发布 vision/CLIP curation 模型证明能力

何时考虑:你有抓取能力但清洗经验不足,模型规模 ≥30B,预算容许花 mid-six-figure 买 curation。

2.5 Bright Data(前 Luminati)

brightdata.com爬虫基础设施而非数据本身。

  • Web Unlocker:$1.5 / 1000 requests,自动反爬 / IP 轮换 / CAPTCHA 解决
  • SERP API:$1.5 / 1000 SERP,绕 Google scrape 限制
  • Scraping Browser:~$3 / GB,托管 stealth puppeteer/playwright
  • Datasets:少量预制 dataset(Amazon / LinkedIn / Reddit 等公开页面),按 row 收费

何时:自家工程团队不想啃 crawler.md 那一堆事,付钱买 SaaS。

2.6 学术开源(不商业但要列)

出品方 数据 体量 链接
HuggingFace FineWeb 团队 FineWeb / FineWeb-Edu / FineWeb-2 15T / 1.3T / 1T+(多语言) HF FineWeb-Edu
MLFoundations (UW + 联合体) DCLM-Pool / DCLM-Baseline 240T / 4T datacomp.ai/dclm
AllenAI Dolma / OLMoE-Mix 3T+ HF allenai/dolma
BigCode The Stack v1 / v2 3TB / 67.5TB HF bigcode/the-stack-v2
EleutherAI The Pile 825 GiB / 300B tokens 已基本退役,只作 eval baseline

2.7 其他场内角色

公司 角色
Apify 爬虫 SaaS,ready-made actors(每个站一个)+ 自定义
Scale AI 标注 / SFT / RLHF 为主;"Data Engine" 含预训练数据但权重小
Surge AI 标注 / SFT 为主,做 frontier lab post-train data
Defined.ai licensed text/audio,多语言、对小语种友好
Bria AI / Photoroom 图像 commercially-licensed 数据集
Nomic AI embedding + curated 文本子集(Nomic Atlas)

三、决策表

你的情况 建议
学术 / 7B 以下规模 免费 —— FineWeb-Edu + The Stack v2 + Dolma 子集
7B-30B / 工程团队 < 10 人 FineWeb + 自家 1-2 个补抓的 CC snapshot;不买商业
30B-200B / 工程团队 30 人 自爬 + FineWeb baseline + DatologyAI curation 协助;需要 ~$M 级 curation 预算
Frontier (>200B) 全自研。商业供应商只买原始抓取(Bright Data 等爬虫基础设施),curation 一律内部
中文为主 中文 CC 部分(FineWeb-2 中文 slice)+ magic-html 提取 + 自抓中文 site;目前没有 mature 商业中文供应商
多模态(图/视/音) LAION / DataComp(图)+ AVA / VATEX(视频)+ ImageNet 系列;商业方面 Bria / Photoroom(图,license 干净)

四、合规警钟

商业供应商最终落地处理是版权 + 个人数据 + ToS 三重风险

  1. 版权 — Bright Data 抓的页面里大量是他人内容(新闻 / 博客)。买的不是版权,是抓取行为的合规外壳。Andersen v. Stability AI、NYT v. OpenAI 等案件还在演变,2026 年法律边界未定
  2. 个人数据 / GDPR — 抓欧盟 IP 的页面 = 处理欧盟个人数据,需要 GDPR 6 条 lawful basis。Common Crawl 走"研究豁免",商业用途需要自己 risk-assess
  3. ToS — Reddit / Twitter 等明确禁止 scrape;2023 后大量站点开始追诉 scraper(Reddit 案、Bright Data 多次诉讼)

安全姿势

  • 优先用官方 dump / 官方 API(Wikipedia / Stack Exchange / arXiv / GitHub git clone)
  • 商业 license 的图像 / 音频数据集用合规渠道(Bria / Defined.ai / Pond5 等)
  • 文本 web data 在生产上线前做法律 review(特别是 frontier lab)

五、追问延伸

问题 方向
我能用 Bright Data 抓的数据训商业模型吗? 法律灰区。Bright Data ToS 通常允许"在你自己合规框架下"用,但版权等下游风险还在你身上
DatologyAI 值不值买? 看你团队 data curation 经验。如果你有 senior data scaling researcher,DIY 性价比好;没有,买就是买时间
有没有"预训练数据交易所"? 没有。曾有 Bria(图像)/ Defined.ai(多模态)尝试做,目前规模小,frontier lab 不依赖
Reddit / Twitter / 知乎 哪些可以买? Reddit 跟 Google 签了 license(专供 Gemini),其他 frontier lab 通过 ToS 灰区;Twitter/X 完全切断;知乎无开放许可

参考链接


上级 · B1. 预训练数据 Pipeline:爬取→清洗→去重→过滤→配比