Anthropic 工程深读 — Pretraining + Serving¶
更新日期:2026-04-26
本篇仅讨论 Anthropic 怎么把 Claude 系列训出来 + 部署上线 —— 训练 infra、framework、数据、长 context、serving stack。其余主题(对齐方法、agents、可解释性、安全、社会影响)独立成篇,见 Anthropic 总览。
主要参考:
- Claude 3 Model Card (2024)
- Claude Opus 4 / Sonnet 4 System Card (2025.05)
- Project Rainier / Trainium2 partnership (AWS, 2024)
- 多次 Dario Amodei / Jared Kaplan 公开演讲与访谈
一、Pretraining 硬件栈¶
公开声明的 Anthropic 训练硬件:
| 硬件 | 时期 | 用途 |
|---|---|---|
| GCP TPU v4 / v5p | 2023-至今 | Claude 1-3 主要训练硬件,pod 内 ICI 联合 |
| AWS Trainium2 + Project Rainier | 2024.12 起 | 千亿到万亿参数训练 + 推理迁移 |
| NVIDIA H100 / H200(Azure / AWS p5) | 2024-至今 | 部分训练 + 推理 |
Anthropic 是少数同时跨 TPU / Trainium / NVIDIA 三栈的实验室。这意味着:
- 训练框架必须硬件无关(JAX 主导而非 PyTorch)
- 持续维护多套 kernel / sharding strategy
- Hardware diversification 是 supply chain risk hedge
Project Rainier 是 Anthropic + AWS 联合数据中心计划,2024.12 公布,规模千亿美元级,主体是 Trainium2 集群。
二、训练框架:JAX + pjit¶
跟 OpenAI / DeepSeek 用 PyTorch + Megatron 完全不同:
- JAX:函数式、SPMD-friendly、XLA 编译,TPU 上原生
- pjit / shard_map:表达 data + tensor + pipeline mixed parallelism
- multihost training:原生跨 TPU pod / GPU 节点
这套栈的 trade-off:
| 优 | 劣 |
|---|---|
| TPU 性能极致(XLA 编译比 PyTorch eager 快很多) | PyTorch 生态外,社区贡献少 |
| SPMD 表达统一(不像 Megatron 要切多种 parallelism) | 调试复杂(traced graph 报错难懂) |
| 跨硬件可移植(TPU / Trainium / GPU 都能跑) | NVIDIA 上未必比 Megatron 快 |
可类比工作:T5X (Google) 是公开的同范式框架;Anthropic 内部框架不开源,但 paper 引用 + 工程团队成员公开 talk 提及 SPMD + pjit 栈。
三、训练数据¶
Claude 系列 Model Card 的数据声明(共性):
- 公开网页 + 公开数据集 + 用户提供 + 商业 license
- 多语种 + 多模态(图文混合训练)
- Curated to a high standard —— 没具体过滤管道公开
- 不抓有 robots.txt 禁爬的网站
数字层面待核实:
- Claude 3 / 4 训练 token 总数(社区估 10T-30T)
- 数据混合比例(代码 / 数学 / 多语种各占多少)
- Constitutional 数据是否进 pretraining(推测主要在 post-train)
后训练数据(推测,结合 J2 thinking-effort):
- 多 effort 级别 SFT 数据(low/med/high thinking)
- Constitutional preference pair(CAI 自动生成)
- Coding / agentic trajectory(用于 Computer Use / Claude Code)
四、训练规模与经验¶
4.1 模型代际(仅工程相关)¶
| 模型 | 发布 | 上下文 | 多模态 | 工程亮点 |
|---|---|---|---|---|
| Claude 1 | 2023.03 | 100k | 文 | Constitutional AI 1.0 |
| Claude 2 | 2023.07 | 100k | 文 | Coding 能力 |
| Claude 3 (Haiku/Sonnet/Opus) | 2024.03 | 200k | 文+图 | 多模态 omni-batch |
| Claude 3.5 Sonnet | 2024.06 | 200k | 文+图 | SWE-Bench 顶峰 |
| Claude 3.7 Sonnet | 2025.02 | 200k | 文+图 | Extended Thinking(推理 RL) |
| Claude 4 (Opus / Sonnet) | 2025.05 | 1M (Sonnet 4) | 文+图 | 长 context 跳变 |
| Claude 4.5 Sonnet | 2025.09 | 1M | 文+图 | 综合能力 |
| Claude 4.7 Opus | 2026.04 | 1M | 文+图 | 当前旗舰 |
每代提升的工程原因(公开 + 推测):
- 3 → 3.5 编程跳变:训练数据中代码占比显著提升,加 SWE-Bench-style 数据
- 3.5 → 3.7 推理:引入 Extended Thinking 训练(类 o1/R1 路线)
- 3.7 → 4 长 context:YaRN / position interpolation 工程化,1M context 进入产品
4.2 训练 fail mode(公开访谈)¶
Anthropic 工程团队公开演讲提及的 fail mode(与 OpenAI / DeepSeek 同类):
- Loss spike → 回滚 + 数据 / LR 重训
- Hardware failure:千卡训练每周丢若干设备
- Numerical instability:fp8 / bf16 边缘 case
- Scaling law 偏差:实际 loss 跟预测偏 0.1-1% 是常态
具体对策不公开,但跟 DeepSeek V3 paper §9 / OpenAI engineering §3.3 描述相同套路:checkpoint + monitoring + hand-tune intervention。
五、Long context 工程¶
Claude 3 200k → 3.5 / 4 1M context 的实现细节不公开,社区推测:
- YaRN / NTK-aware RoPE 扩展(pretrain 短,post-train YaRN 拉长)
- Sliding Window + Global token 混合(类 Mistral)
- KV Cache 压缩 / quantization(1M context 下 KV 占用是 GB 级别)
- Context-aware attention scheduling:长 context 时不同 layer 的 attention sparsity 不同
RULER eval(J1 long-context 章节)显示 Claude 3 effective context ~64K,跟 GPT-4 类似 —— 即便 claimed 200K,实际"用满"还是 64K-128K 量级。Claude 4 / Sonnet 4 的 1M 是否实际 work 在 RULER 上待 2026 后续 benchmark。
六、Inference / Serving stack¶
公开度低。已知:
- AWS p5(H100)+ Trainium2:双栈推理
- Azure 部署:Microsoft 是 Anthropic 投资伙伴,有 Azure 上的 Claude 端口
- Cloudflare Workers AI:边缘部署 Sonnet(2024 起)
工程推测(基于 ChatGPT 公开的 serving pattern + Anthropic 的工作量级):
- 多区域部署(US East/West, EU, AP)
- PD 分离:prefill / decode 不同硬件配置
- KV Cache reuse:相同 system prompt 跨用户共享 prefill
- Speculative decoding:Anthropic 有相关研究投稿
具体 throughput / latency / per-token 成本不公开。
七、复现度自评¶
| 组件 | 公开度 | 复现路线 |
|---|---|---|
| TPU / Trainium 训练栈 | 无 | 用 PyTorch + Megatron 替代(NVIDIA 路线) |
| JAX + pjit framework | 部分(T5X 类似) | 用 PyTorch FSDP + Megatron 等价 |
| Long context 工程 | 高层描述 | YaRN(开源) + 自己实现 sliding window |
| 推理 serving | 无 | 用 vLLM / SGLang + 自己 PD 分离 |
| 训练数据 | 无 | 用 RedPajama / FineWeb / DCLM 替代 |
实操路径(如果要复现 Claude 系列等价工程):
- 训练栈:PyTorch + FSDP + Megatron 是最现实的国内可获得替代
- Long context:YaRN 起步,1M+ 自己实现 sliding window mix
- 数据:FineWeb-Edu / DCLM-Pro / 自家清洗 + 商业 license
- 推理:vLLM / SGLang,PD 分离自己拼
Anthropic 的工程优势主要在多硬件并存 + JAX 栈跨架构,这是大多数实验室没有的(也不必有)。
八、跟 OpenAI / DeepSeek 工程对比¶
| 维度 | Anthropic | OpenAI | DeepSeek |
|---|---|---|---|
| 主力硬件 | TPU + Trainium + H100 三栈 | NVIDIA + Microsoft Azure | H800(NVIDIA 中国版) |
| 训练框架 | JAX + pjit | 内部 PyTorch fork | PyTorch + Megatron + 自研 |
| 公开度 | 中(model card 详) | 低(无 paper 细节) | 高(V3/R1 tech report 完整) |
| 长 context | 1M(实现不公开) | 128k → 1M 演进 | 128k(YaRN 公开) |
| 训练 fail 描述 | 高层描述 | 访谈 | 完整章节(V3 §9) |
| 推理 serving | 无 | 无 | 高层描述 |
Anthropic 在工程层面公开度居中 —— Model Card 给方向但不给数字,比 DeepSeek 公开度低很多,比 OpenAI 多。
总结¶
- Anthropic 工程的独特性是多硬件 + JAX 栈 —— 这条路 NVIDIA 锁死的实验室没法走
- Pretraining 数据细节几乎全不公开,要复现只能用第三方数据替代
- Long context 1M 工程化是 Claude 3.5/4 跳变的核心,但实现细节不公开;RULER 评测显示 effective context 远小于 claimed
- Inference / serving 完全黑盒,跟 OpenAI 同样级别保密
- 复现 Claude 工程不必走 Anthropic 同样路线:PyTorch + Megatron + NVIDIA 是更现实的路径
参考文献¶
- Anthropic. Claude 3 Model Card. 2024.
- Anthropic. Claude Opus 4 / Sonnet 4 System Card. 2025.05. PDF
- Anthropic. Claude Sonnet 4.5 System Card. 2025.09. anthropic.com/claude-sonnet-4-5-system-card
- AWS. Project Rainier with Anthropic on Trainium2. 2024.12. aboutamazon.com
- Google Research. T5X. 2022.(公开的 JAX + pjit 框架参考实现) github.com/google-research/t5x
↑ 上级 · Anthropic