跳转至
Walker Chi
Studies
正在初始化搜索引擎
walkerchi/walker-cms
Walker Chi
walkerchi/walker-cms
walker
About
Blog
Blog
Gallery
Gallery
Notes
Notes
ETHz
ETHz
Optimizing the Social Force Model: Investigating Memory Layouts and Register Pressure
Computational Quantum Physics
Space Elevator is Closer than we think
Infinite Energy is closer than you think
Model Cascades for Efficient Image Search
Neural Operators and Operator Networks vs Parametric Approach: A General Comparison
IAM: Climate Economics and Finance
Computational Physics Question Card
Computational Physics
Mathematics for New Technologies in Finance
HoloScanner: In-Hand Scanning with HoloLens 2 for Irregular Geometries
Master Thesis: Semantic Chunk Sparse Attention for Large Language Model
Probabilitisc Artificial Intelligence
Quantum Information Processing:Concept
Robot Dynamics
Robotic Seminar:Sensor Modeling in Sim2Real
Semester Project: Learning Structural Dynamics with Graph Neural Networks
Numerical Method for Partial Differential Equation
ETHz numPDE
ETHz numPDE
Plot
Projects
Projects
torch-sla
Studies
Studies
大语言模型/多模态大模型 LLM/MLLM
大语言模型/多模态大模型 LLM/MLLM
Z. 附录
Z. 附录
Z2. 术语表
Z1. 行业格局与模型速查表(2026.04)
Z3. 参考文献汇总
Z3. 参考文献汇总
Z3.1 参考文献:架构与训练
Z3.3 参考文献:推理、安全与工具
Z3.2 参考文献:后训练与应用
H. 应用层
H. 应用层
H2. Agent 架构:MCP / A2A / 框架生态
H1. RAG vs Search:技术路线与大厂选择
H5. LLM + Security:攻防、审计、威胁情报
H3. Agent 集群 Scaling 与多 Agent 协作
H3. Agent 集群 Scaling 与多 Agent 协作
H3.3 MAD vs Self-Consistency 实验与工程问题
H3.2 Anthropic 多 Agent 系统工业实现
H3.1 Agent Scaling Law 与 TTS 关系
H4. Coding Agent:Claude Code / Cursor / Devin / OpenClaw
H4. Coding Agent:Claude Code / Cursor / Devin / OpenClaw
H4.1 Claude Code 完整架构剖析
H4.3 开源 Coding Agent 生态对比
H4.2 Subagents、Hooks、Skills、MCP 深入
B. 数据工程
B. 数据工程
B3. 多模态数据工程:图片/视频数据组织与处理
B5. 数据质量评估:指标、工具、与 Loss 斜率的关系
B4. 合成数据:方法论、Scaling 边界、Model Collapse
B2. Tokenizer 设计与训练:BPE、多语言、多模态 Token
B1. 预训练数据 Pipeline:爬取→清洗→去重→过滤→配比
B1. 预训练数据 Pipeline:爬取→清洗→去重→过滤→配比
B1.4 互联网存档清单:CC / Wayback / 衍生语料
B1.1 爬虫工程:反检测、IP 池、覆盖率
B1.5 去重:exact / MinHash / SemHash / 质量分桶
B1.7 数据配比:典型方案 + 为什么
B1.2 HTML 解析器选型
B1.3 私域数据:CSDN / Reddit / Twitter / 微信公众号
B1.6 商业供应商
I. 评测与安全
I. 评测与安全
I2. 安全对齐:Constitutional AI、RLAIF、红队测试
I1. 评测体系搭建:基准选择、内部 Eval Suite
I3. 治理与合规:EU AI Act、中国法规、企业实践
A. 基础理论
A. 基础理论
A9 Activation 函数与 FFN 设计
A10 MoD、Early Exit 与动态计算
A12 工业模型架构选型图谱
A3. MoE 架构:路由、负载均衡、训练稳定性
A8 Normalization 技术演进
A6. SSM 与混合架构:Mamba、Jamba、RWKV
A1. Transformer 架构:从 Attention 到完整前向传播
A11 模型设计空间:深度、宽度与 Vocab
A2 注意力机制全景
A2 注意力机制全景
A2-1 Full 路线 — softmax + K/V 表示压缩
A2-4 attention kernel 实现与验证
A2-3 Linear / RNN 路线 — 砍 softmax,固定 state 替代 KV
A2-2 Sparse 路线 — softmax + 跳过部分 (q,k) 对
A4. 位置编码:RoPE 原理、扩展方法、2D-RoPE
A4. 位置编码:RoPE 原理、扩展方法、2D-RoPE
A4.2 NoPE、CoPE 与混合策略
A4.1 RoPE 原理与外推方法
A5. 压缩即智能:信息论视角与 Scaling Laws 推导
A5. 压缩即智能:信息论视角与 Scaling Laws 推导
A5.2 Scaling Laws 公式与数据质量
A5.1 压缩即智能:信息论推导
A5.1 压缩即智能:信息论推导
延伸:Grokking、信息瓶颈、不可约 Loss
论文精读:Language Modeling Is Compression (ICLR 2024)
论文精读:Understanding LLM via Compression (2025)
K. 前沿实验室深读
K. 前沿实验室深读
Anthropic
Anthropic
Anthropic Agents — Computer Use + MCP + Tool Use
Anthropic 对齐研究
Anthropic 工程深读 — Pretraining + Serving
Anthropic 机制可解释性研究
Anthropic Safety + Frontier Red Team
Anthropic 社会影响研究
DeepSeek
DeepSeek
DeepSeek 工程深读
DeepSeek 推理 RL 方法论
OpenAI
OpenAI
OpenAI 工程深读
OpenAI Safety + Interpretability
G. 推理与部署
G. 推理与部署
G6 解码策略:Beam Search、采样与 KV Cache
G4. 主流模型部署配置:Qwen / DeepSeek / LLaMA
G5. 投机解码与 KV Cache 优化
G2. PD 分离与推理架构设计
G1. 量化全景:GPTQ / AWQ / SmoothQuant / FP8
G3. vLLM vs SGLang 深入对比与优化
C. 分布式训练基础设施
C. 分布式训练基础设施
C5. 6D 并行下的 Attention Kernel 与通信重叠
C7. 万卡集群运维:容错、Checkpoint、健康检查
C4. GPU Kernel 编程:Triton vs TileLang vs CUDA
C3. MFU 优化:Profiling → 诊断 → 提升实战
C2. 集群拓扑感知的并行策略设计
C6. 训练稳定性:Loss Spike、NaN、梯度异常诊断
C8. 开源训练/推理基础设施
C8. 开源训练/推理基础设施
C8.2 其他开源基础设施:UCCL-EP / Megatron Core / DeepSpeed / FSDP
C1. Megatron 架构与 6D 并行完整指南
C1. Megatron 架构与 6D 并行完整指南
C1.2 EP、CP、SP 与通信重叠
C1.1 TP、PP、DP 与 ZeRO
F. 多模态 VLM
F. 多模态 VLM
F3. 高分辨率与视频理解技术
F4. MLLM + 硬件:端侧部署、NPU、专用芯片
F1. VLM 架构选型:编码器、投影层、骨干网络
F2. VLM 训练三阶段完整 Recipe
F5. 世界模型与视频生成
E. 后训练与对齐
E. 后训练与对齐
E7. Instruction Following 能力提升
E2. 偏好对齐全链路:RLHF → DPO → SimPO → GRPO
E4. RLVR 深入:代码生成方向
E3. RLVR 深入:数学推理方向
E6. RLVR 深入:Research / Report / 开放域
E5. RLVR 深入:Search & Tool Use 方向
E1. SFT / RFT / RL / Pretrain 的关系与数据效率
E8. Claude / GPT / DeepSeek 训练方法论还原
E8. Claude / GPT / DeepSeek 训练方法论还原
E8.2 Anthropic 路线:Constitutional AI → Claude
E8.3 DeepSeek 路线:V3 → R1
E8.1 OpenAI 路线:GPT → o 系列
D. 预训练 Recipe
D. 预训练 Recipe
D5. 成本估算:给定规模需要多少卡、多少时间、多少钱
D3. Dense 模型预训练完整 Recipe
D2. 混合精度训练:BF16 → FP8,哪些层能量化
D4. MoE 模型预训练完整 Recipe
D1. 优化器:Adam → Muon → 调参理论(Parabolic Fitting、μP)
D1. 优化器:Adam → Muon → 调参理论(Parabolic Fitting、μP)
D1.1 AdamW 与 Muon:机制与为什么
D1.2 LR Schedule:Cosine / WSD / D2Z 和为什么
D1.3 Per-Layer LR 与调参理论(μP、Parabolic Fitting)
J. 推理行为与失败模式
J. 推理行为与失败模式
J4. 幻觉 — 与 Thinking 关系 + 减少策略
J1. 长 Context — Benchmarks、问题、数据构造
J3. 推理模式对比 — CoT / ReAct / Interleave / ToT / Self-Consistency
J2. Thinking Effort 控制 — Adaptive / Level-Switched
World Model
World Model
08 AGI路径之争
09 挑战、局限与未来展望
06 投融资与产业生态
01 定义、起源与发展史
03 核心论文与里程碑
10 综合Survey论文索引
05 应用领域深度分析
05 应用领域深度分析
05.1 自动驾驶世界模型端到端技术
05.3 游戏与交互式娱乐
05.2 机器人与具身AI
05.2 机器人与具身AI
05.2.2 开源项目与框架全景
05.2.3 技术路线之争与市场数据
05.2.1 人形机器人公司全景
02 技术架构与核心方法
02 技术架构与核心方法
02.3 NVIDIA Cosmos 平台架构全解
02.5 世界模型的数学基础
02.2 Dreamer 系列内部机制
02.4 Genie 系列技术演进
02.1 JEPA 技术细节深挖
02.6 训练数据深度剖析
07 评估基准与指标体系
07 评估基准与指标体系
07.2 LLM内部世界模型之争
07.1 物理理解机制与实验证据
00 世界模型的"皇帝新衣":视频生成 ≠ 物理理解
00 世界模型的"皇帝新衣":视频生成 ≠ 物理理解
00.1 物理世界模型:真正在做物理理解的工作
00.2 世界模型 = 内在科学家?从物理理解到规律发现与工具制造
00.2 世界模型 = 内在科学家?从物理理解到规律发现与工具制造
00.2.1 科学发现AI系统工程实现详解
04 关键玩家与竞争格局
04 关键玩家与竞争格局
04.1 世界模型公司全景
目录
当前主题
walker
Studies
Studies
¶
当前主题
¶
大语言模型/多模态大模型 LLM/MLLM
World Model 深度调研
回到页面顶部