跳转至

私域数据:CSDN / Reddit / Twitter / 微信公众号 / GitHub 私库

更新日期:2026-04-26

合规警钟

本页讨论技术可行性,不构成合规建议。许多目标站点的 ToS 明确禁止 scrape;用于商业模型训练的法律风险随各国法规演变(EU AI Act / 中国生成式 AI 管理办法 / Andersen v. Stability AI / NYT v. OpenAI 等案件)。生产上线前法律 review

公开 web(Common Crawl 覆盖范围)远不是高质量预训练数据的全部。中文圈 CSDN / 知乎 / 简书 / 微信公众号、英文 Reddit / Twitter(X.com) / Discord / Quora,这些有 robots Disallow / 反爬严 / 登录后 的内容,对 frontier 模型质量有显著贡献。本页拆几大私域。


一、按"难度 / 合规度"光谱

flowchart LR
    A["官方 dump<br/>(零灰度)"] --> B["公共 API<br/>+ rate limit"]
    B --> C["有合规 license<br/>(付费 / 合作)"]
    C --> D["反爬中等<br/>+ ToS 灰区"]
    D --> E["反爬严<br/>+ ToS 明禁"]

    classDef green fill:#fff,stroke:#7a9e8c;
    classDef yellow fill:#fff,stroke:#cc785c;
    classDef red fill:#fff,stroke:#a14c3a;
    class A green
    class B,C yellow
    class D,E red

实操原则:能用绿色就别用黄色,能用黄色就别碰红色。


二、英文私域

2.1 Reddit

时期 状态
2022 之前 Pushshift 公开 dump,全量历史 + 实时增量,事实标准预训练源
2023 Reddit 关闭 Pushshift API + 第三方(导致 Apollo / RIF 等死)
2024 Reddit 与 Google 签独家 license,承包 Gemini 训练用
2025-2026 OpenAI / Anthropic 走"灰渠道"或自己内部 license 谈判

当前可用

  • Pushshift 历史(2005-2022)— 各种 mirror 还在 HF datasets / academictorrents注意 ToS 风险
  • Reddit 官方 Data API:$0.24 per 1K API calls(2023 改后)。免费额度 100 calls/min,商用需联系销售
  • 不推荐:直接 scrape reddit.com —— Cloudflare 严守 + 法律明禁

2.2 Twitter / X.com

时期 状态
Twitter 时代(pre-2022) Decahose / Firehose API 可买,学术 v1.1 API 免费
2023 X 接管 关停免费 v1,付费 tier \(100-\)42K/月
2024-2026 scrape 几乎不可能(大量反爬 + JS-only),完全切断对 frontier lab 的常规渠道

当前可用

2.3 Discord / Slack

  • Discord:聊天平台,反爬不算严,但纯私域(每服务器需邀请)。有些公开 server 可加入抓,少数 dump 在 HF(Discord chat dataset 搜)。ToS 明禁 scrape
  • Slack:完全企业私域,无公开渠道

2.4 Quora / Stack Overflow

  • Stack Overflow / Stack Exchange绝对正路data.stackexchange.com 公开 XML/Parquet dump,季度更新,All major LLM corpora 都直接用 dump。详见 parser.md §七
  • Quora:反爬中等(CF + 登录墙),ToS 明禁。无合法 dump。frontier lab 通常通过 Common Crawl 间接拿一部分

2.5 GitHub

  • 公开仓库GHArchive(事件流,2011 至今)+ BigQuery GitHub + 直接 git clone
  • The Stack v2(BigCode)= GitHub 公开仓库的 frontier 标准切片,详见 archives.md §3.6
  • 私库 / 内部代码:完全私域,无渠道。Frontier 公司可能内部用自己的 enterprise GitHub repos 但不算外部数据

三、中文私域

3.1 CSDN

中文最大技术博客 + 答疑社区。质量参差但量大

  • 反爬:中等。开了 anti-spider middleware,登录后才能看完整文章(部分),登录后限 daily 浏览数
  • 可行
  • CC 间接覆盖:CC 抓 ~50-70% 公开文章(无登录限制部分)
  • trafilatura + magic-html 提取:因为 CSDN 的 layout 多样,magic-html 提取效果显著好
  • 自爬补 CC 漏的:用 crawler.md 描述的 stealth 栈
  • ToS:禁止 scrape,但实际执法宽松(有版权诉讼例如 CSDN 起诉 Stack Overflow Chinese 转载,但不针对 LLM 训练)

3.2 知乎

中文最大问答社区,质量较 CSDN 更高(精华答案、长文)。

  • 反爬。CF 风控 + 自家 anti-bot + 登录墙(2023 起对未登录展示截断)
  • 法律:知乎 2024 多次发函给国内 LLM 公司禁止 scrape,部分案件诉讼中
  • 可行渠道
  • Common Crawl 历史(2018-2022 部分)—— 当时反爬较松,有相当 unique 内容
  • 付费 API:知乎不开放
  • 走第三方 dataset:HF 上偶有"知乎问答"小批量,合规存疑

风险:知乎是法律前线,frontier 中文模型这部分都要内部 review。

3.3 微信公众号

中文优质长文重灾区(科技 / 商业 / 财经 / 文化),但强 access control

  • 没有公开 API
  • 只能通过:
  • 搜狗微信搜索(限量、被搜狗 ban)
  • 手动收藏 + Web 转 PDF / markdown
  • 第三方爬虫 SaaS(违规,存活时间短)
  • CC 间接:公众号文章在 mp.weixin.qq.com 域,CC 抓不到(动态 + 登录态)

实际:中文 LLM 训练里公众号内容普遍极少,是关键短板。少量通过手动收集 / 转载到第三方站点的才进 corpus。

3.4 简书 / 掘金 / 思否

  • 简书:反爬轻,CC 部分覆盖。质量参差
  • 掘金:技术社区,反爬中等,部分需登录
  • 思否(SegmentFault):技术问答,反爬轻,有 robots.txt 比较规范

这三个的中文技术内容跟 CSDN 高度重叠(很多文章交叉转载),dedup 后增量有限。

3.5 小红书 / 抖音

  • 完全私域(移动 App 优先),反爬极严
  • 有少量第三方 dataset(短文本),合规高度存疑
  • 中文 LLM 训练绝大多数不碰

四、技术:如何抓登录后内容

reminder:抓登录后内容会触及 ToS / 法律高压区,本节仅做技术陈述。

# Selenium / Playwright 半手动 + cookie session 复用
from playwright.sync_api import sync_playwright

with sync_playwright() as p:
    browser = p.chromium.launch()
    ctx = browser.new_context()
    # 加载预存的 cookies(自己登录一次后导出)
    ctx.add_cookies(stored_cookies)
    page = ctx.new_page()
    page.goto("https://csdn.net/...")
    # 现在是"登录态"

风险:账号容易被风控盯上(IP / UA / 行为异常),单账号挂 1-N 天。多账号轮换是常规做法,但创建账号本身可能违反 ToS。

4.2 OAuth / API Token

合规渠道。如果站点有 OAuth API(GitHub / Reddit),通过应用注册拿 token,按 rate limit 抓。

4.3 浏览器扩展自动化

browsertrix-crawler 等可以用真实浏览器配置 + 真实用户登录态做合规边界内的归档(学术档案场景)。frontier lab 训练数据采集通常不走这条


五、实操栈

目标 工具栈
Reddit Pushshift 历史 HF datasets 直接下,datasets.load_dataset("...")
Stack Exchange data.stackexchange.com 周期 dump,requests 下载 + 解
CSDN trafilatura/magic-html 提取 + 自爬(crawler.md IP 池)
知乎历史 CC index 查询过去几年的快照
GitHub 公开 GHArchive API + git clone
arXiv bulk LaTeX source(S3 requester-pays)

六、追问延伸

问题 方向
抓登录后内容算违法吗? 看辖区。中国网信办对 LLM 训练数据来源越来越严;EU AI Act 对训练数据有 transparency obligation;美国 Andersen / NYT 案件还在演变
有没有"中文私域 dataset"市场? 几乎没有 mature 公开商业渠道。frontier 中文模型主要靠 CC 中文部分 + 自爬 + 内部数据交易(不公开)
Reddit 现在 frontier 怎么用? OpenAI / Anthropic 通过付费 API 或历史 Pushshift 用;Google 独家 license
微信公众号怎么补? 没有合规渠道。frontier 中文模型这部分确实弱,只能等微信侧政策变化

参考链接


上级 · B1. 预训练数据 Pipeline:爬取→清洗→去重→过滤→配比