跳转至

Anthropic 工程深读 — Pretraining + Serving

更新日期:2026-04-26

本篇讨论 Anthropic 怎么把 Claude 系列训出来 + 部署上线 —— 训练 infra、framework、数据、长 context、serving stack。其余主题(对齐方法、agents、可解释性、安全、社会影响)独立成篇,见 Anthropic 总览

主要参考:


一、Pretraining 硬件栈

公开声明的 Anthropic 训练硬件:

硬件 时期 用途
GCP TPU v4 / v5p 2023-至今 Claude 1-3 主要训练硬件,pod 内 ICI 联合
AWS Trainium2 + Project Rainier 2024.12 起 千亿到万亿参数训练 + 推理迁移
NVIDIA H100 / H200(Azure / AWS p5) 2024-至今 部分训练 + 推理

Anthropic 是少数同时跨 TPU / Trainium / NVIDIA 三栈的实验室。这意味着:

  • 训练框架必须硬件无关(JAX 主导而非 PyTorch)
  • 持续维护多套 kernel / sharding strategy
  • Hardware diversification 是 supply chain risk hedge

Project Rainier 是 Anthropic + AWS 联合数据中心计划,2024.12 公布,规模千亿美元级,主体是 Trainium2 集群。


二、训练框架:JAX + pjit

跟 OpenAI / DeepSeek 用 PyTorch + Megatron 完全不同:

  • JAX:函数式、SPMD-friendly、XLA 编译,TPU 上原生
  • pjit / shard_map:表达 data + tensor + pipeline mixed parallelism
  • multihost training:原生跨 TPU pod / GPU 节点

这套栈的 trade-off:

TPU 性能极致(XLA 编译比 PyTorch eager 快很多) PyTorch 生态外,社区贡献少
SPMD 表达统一(不像 Megatron 要切多种 parallelism) 调试复杂(traced graph 报错难懂)
跨硬件可移植(TPU / Trainium / GPU 都能跑) NVIDIA 上未必比 Megatron 快

可类比工作:T5X (Google) 是公开的同范式框架;Anthropic 内部框架不开源,但 paper 引用 + 工程团队成员公开 talk 提及 SPMD + pjit 栈。


三、训练数据

Claude 系列 Model Card 的数据声明(共性):

  • 公开网页 + 公开数据集 + 用户提供 + 商业 license
  • 多语种 + 多模态(图文混合训练)
  • Curated to a high standard —— 没具体过滤管道公开
  • 不抓有 robots.txt 禁爬的网站

数字层面待核实

  • Claude 3 / 4 训练 token 总数(社区估 10T-30T)
  • 数据混合比例(代码 / 数学 / 多语种各占多少)
  • Constitutional 数据是否进 pretraining(推测主要在 post-train)

后训练数据(推测,结合 J2 thinking-effort):

  • 多 effort 级别 SFT 数据(low/med/high thinking)
  • Constitutional preference pair(CAI 自动生成)
  • Coding / agentic trajectory(用于 Computer Use / Claude Code)

四、训练规模与经验

4.1 模型代际(仅工程相关)

模型 发布 上下文 多模态 工程亮点
Claude 1 2023.03 100k Constitutional AI 1.0
Claude 2 2023.07 100k Coding 能力
Claude 3 (Haiku/Sonnet/Opus) 2024.03 200k 文+图 多模态 omni-batch
Claude 3.5 Sonnet 2024.06 200k 文+图 SWE-Bench 顶峰
Claude 3.7 Sonnet 2025.02 200k 文+图 Extended Thinking(推理 RL)
Claude 4 (Opus / Sonnet) 2025.05 1M (Sonnet 4) 文+图 长 context 跳变
Claude 4.5 Sonnet 2025.09 1M 文+图 综合能力
Claude 4.7 Opus 2026.04 1M 文+图 当前旗舰

每代提升的工程原因(公开 + 推测):

  • 3 → 3.5 编程跳变:训练数据中代码占比显著提升,加 SWE-Bench-style 数据
  • 3.5 → 3.7 推理:引入 Extended Thinking 训练(类 o1/R1 路线)
  • 3.7 → 4 长 context:YaRN / position interpolation 工程化,1M context 进入产品

4.2 训练 fail mode(公开访谈)

Anthropic 工程团队公开演讲提及的 fail mode(与 OpenAI / DeepSeek 同类):

  • Loss spike → 回滚 + 数据 / LR 重训
  • Hardware failure:千卡训练每周丢若干设备
  • Numerical instability:fp8 / bf16 边缘 case
  • Scaling law 偏差:实际 loss 跟预测偏 0.1-1% 是常态

具体对策不公开,但跟 DeepSeek V3 paper §9 / OpenAI engineering §3.3 描述相同套路:checkpoint + monitoring + hand-tune intervention。


五、Long context 工程

Claude 3 200k → 3.5 / 4 1M context 的实现细节不公开,社区推测:

  • YaRN / NTK-aware RoPE 扩展(pretrain 短,post-train YaRN 拉长)
  • Sliding Window + Global token 混合(类 Mistral)
  • KV Cache 压缩 / quantization(1M context 下 KV 占用是 GB 级别)
  • Context-aware attention scheduling:长 context 时不同 layer 的 attention sparsity 不同

RULER evalJ1 long-context 章节)显示 Claude 3 effective context ~64K,跟 GPT-4 类似 —— 即便 claimed 200K,实际"用满"还是 64K-128K 量级。Claude 4 / Sonnet 4 的 1M 是否实际 work 在 RULER 上待 2026 后续 benchmark。


六、Inference / Serving stack

公开度低。已知:

  • AWS p5(H100)+ Trainium2:双栈推理
  • Azure 部署:Microsoft 是 Anthropic 投资伙伴,有 Azure 上的 Claude 端口
  • Cloudflare Workers AI:边缘部署 Sonnet(2024 起)

工程推测(基于 ChatGPT 公开的 serving pattern + Anthropic 的工作量级):

  • 多区域部署(US East/West, EU, AP)
  • PD 分离:prefill / decode 不同硬件配置
  • KV Cache reuse:相同 system prompt 跨用户共享 prefill
  • Speculative decoding:Anthropic 有相关研究投稿

具体 throughput / latency / per-token 成本不公开。


七、复现度自评

组件 公开度 复现路线
TPU / Trainium 训练栈 用 PyTorch + Megatron 替代(NVIDIA 路线)
JAX + pjit framework 部分(T5X 类似) 用 PyTorch FSDP + Megatron 等价
Long context 工程 高层描述 YaRN(开源) + 自己实现 sliding window
推理 serving 用 vLLM / SGLang + 自己 PD 分离
训练数据 用 RedPajama / FineWeb / DCLM 替代

实操路径(如果要复现 Claude 系列等价工程):

  1. 训练栈:PyTorch + FSDP + Megatron 是最现实的国内可获得替代
  2. Long context:YaRN 起步,1M+ 自己实现 sliding window mix
  3. 数据:FineWeb-Edu / DCLM-Pro / 自家清洗 + 商业 license
  4. 推理:vLLM / SGLang,PD 分离自己拼

Anthropic 的工程优势主要在多硬件并存 + JAX 栈跨架构,这是大多数实验室没有的(也不必有)。


八、跟 OpenAI / DeepSeek 工程对比

维度 Anthropic OpenAI DeepSeek
主力硬件 TPU + Trainium + H100 三栈 NVIDIA + Microsoft Azure H800(NVIDIA 中国版)
训练框架 JAX + pjit 内部 PyTorch fork PyTorch + Megatron + 自研
公开度 中(model card 详) 低(无 paper 细节) 高(V3/R1 tech report 完整)
长 context 1M(实现不公开) 128k → 1M 演进 128k(YaRN 公开)
训练 fail 描述 高层描述 访谈 完整章节(V3 §9)
推理 serving 高层描述

Anthropic 在工程层面公开度居中 —— Model Card 给方向但不给数字,比 DeepSeek 公开度低很多,比 OpenAI 多。


总结

  1. Anthropic 工程的独特性是多硬件 + JAX 栈 —— 这条路 NVIDIA 锁死的实验室没法走
  2. Pretraining 数据细节几乎全不公开,要复现只能用第三方数据替代
  3. Long context 1M 工程化是 Claude 3.5/4 跳变的核心,但实现细节不公开;RULER 评测显示 effective context 远小于 claimed
  4. Inference / serving 完全黑盒,跟 OpenAI 同样级别保密
  5. 复现 Claude 工程不必走 Anthropic 同样路线:PyTorch + Megatron + NVIDIA 是更现实的路径

参考文献

  1. Anthropic. Claude 3 Model Card. 2024.
  2. Anthropic. Claude Opus 4 / Sonnet 4 System Card. 2025.05. PDF
  3. Anthropic. Claude Sonnet 4.5 System Card. 2025.09. anthropic.com/claude-sonnet-4-5-system-card
  4. AWS. Project Rainier with Anthropic on Trainium2. 2024.12. aboutamazon.com
  5. Google Research. T5X. 2022.(公开的 JAX + pjit 框架参考实现) github.com/google-research/t5x

上级 · Anthropic