跳转至

MLLM + 硬件:端侧部署、NPU、专用芯片

更新日期:2026-04-17


一、MLLM 部署硬件全景

flowchart LR
    cloud["云端推理<br/>H100/H200<br/>500-2000W"]
    edge["边缘<br/>Jetson Orin<br/>15-60W"]
    pc["AI PC<br/>Intel/AMD<br/>15-40W"]
    mobile["手机 NPU<br/>骁龙 8 Elite<br/>5-15W"]
    apple["Apple<br/>统一内存<br/>20-40W"]

    cloud --> edge --> pc
    pc --> apple
    pc --> mobile

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class cloud,edge,pc,mobile,apple stage

按可承载模型规模递减:云(千亿)→ 边缘(百亿)→ PC(数十亿)→ 手机(数 B 量化)。每档跨越的关键限制是内存带宽(不是算力)。


二、端侧部署需求

设备 CPU NPU (TOPS) 内存 适合模型 能跑什么规模的模型
iPhone 16 Pro A18 Pro (6 核, 2 性能 + 4 能效) 38 TOPS — 足够加速 3-4B 模型的矩阵乘法,但对 7B+ 模型力不从心 8GB (与系统共享,实际可用约 5-6GB) 3-4B 多模态 INT4 量化下可流畅运行 MiniCPM-V 3B、Phi-3-mini 等;7B 模型因内存不足基本无法加载完整权重,除非极端量化 (2-bit)
骁龙 8 Gen 3 手机 Kryo CPU (1+3+4 核) 45 TOPS — Hexagon NPU 支持 INT4/INT8 混合精度,推理效率高于纯 GPU 方案 12-16GB (LPDDR5X,带宽约 77GB/s,带宽是端侧推理的核心瓶颈) 7B 模型 16GB 版本可运行 Qwen2.5-7B INT4 (~4GB),留有系统余量;MiniCPM-V 8B INT4 (~5GB) 可运行但较紧张;13B 模型勉强可加载但推理极慢
骁龙 8 Elite 手机 Oryon CPU (自研架构,大幅提升单核性能) 75+ TOPS — NPU 算力几乎翻倍,支持更大模型的实时推理,INT4 吞吐约为上一代 1.7x 12-24GB (LPDDR5X 9600MHz,带宽提升至约 90GB/s) 7B+ 多模态 24GB 版本可流畅运行 13B INT4 模型 (~7GB);7B 多模态模型 (视觉编码器 + LLM) 可达 15+ tok/s;理论上可尝试 Qwen2.5-32B 的极端量化版本但体验不佳
MacBook M4 M4 系列 (高性能核 + 能效核) 38 TOPS (ANE) — 但 Mac 的真正优势不在 NPU 而在统一内存架构:CPU/GPU/NPU 共享同一内存池,无需数据拷贝 16-128GB (统一内存,带宽 100-546GB/s,M4 Max 达 546GB/s) 32B+ 模型 (取决于内存) 16GB 版可跑 7-13B INT4;32GB 版可跑 32B INT4 (~18GB);64GB 版可跑 70B INT4 (~40GB) 约 10-15 tok/s;128GB M4 Max 甚至可加载 Llama-3 405B 的量化版,是消费级设备中独一无二的大模型平台
AI PC (Copilot+) Intel Core Ultra / AMD Ryzen AI (均集成 NPU) 40-50 TOPS — 满足微软 Copilot+ PC 的最低要求 (40 TOPS),但生态和驱动成熟度不如手机 NPU 16-64GB (DDR5,CPU/GPU/NPU 内存分离,不如 Mac 统一内存高效) 7-32B 16GB 可稳定运行 7B INT4;32GB 可运行 13-32B INT4;但 Windows 上 NPU 利用率目前不如 GPU 直接推理 (CUDA/DirectML),实际多数用户仍用独显跑模型
Jetson Orin ARM Cortex-A78AE (12 核) 275 TOPS (稀疏) / 138 TOPS (密集) — 专为边缘 AI 设计,支持完整 CUDA 生态 64GB (共享 LPDDR5,带宽 204.8GB/s) 大模型可运行 边缘设备中的 "小型服务器":可运行 70B INT4 模型 (~40GB),支持多模态 VLA 推理;功耗仅 15-60W,适合机器人/自动驾驶场景;是 NVIDIA 机器人 (Isaac) 和自动驾驶 (DRIVE) 平台的核心硬件

三、MiniCPM-V: 手机端 MLLM 的里程碑

MiniCPM-V 8B 是首个在手机上实现 GPT-4V 级别多模态能力的模型。参考 MiniCPM-V (Yao et al., 2024)

3.1 关键技术

技术 作用
AnyRes 动态分辨率 输入图任意尺寸,按 14×14 patch 切块,最高 1.8M px
InternViT-300M 视觉编码器 比 SigLIP-400M 小但精度持平,部署友好
Token 压缩 (Resampler) 1296 视觉 token → 64,减 20× 计算
INT4 量化训练(QAT) 推理时仅 ~5GB 显存(vs 16GB FP16)
多图理解 + 视频理解 同一模型支持单图 / 多图 / 视频

3.2 性能

Benchmark MiniCPM-V 2.6 GPT-4V
OCRBench 852 656
MathVista 60.6% 49.9%
MMMU 49.8% 56.8%
Real-World QA 65.0% 61.4%
推理速度(骁龙 8 Gen 3) ~7 tok/s
推理速度(M4 Max) ~30 tok/s

→ 在 OCR / 数学等结构化视觉任务上反超 GPT-4V,参数仅 8B vs 千亿,是端侧 MLLM 的代表作。


四、移动端 NPU 编程

4.1 主流 NPU 编程接口

平台 接口 框架 备注
iOS / Mac Core ML / MLX Swift / Python Apple 统一栈
Android NNAPI(已废弃)/ AICore Java / Kotlin Google 在切 AICore
Qualcomm QNN / Hexagon SDK C++ / Python 通过 AI Hub 部署
MTK Neuron SDK C++ 联发科自研
Huawei HiAI C++ 仅鸿蒙生态
Intel OpenVINO Python / C++ 通用 PC NPU
AMD ROCm + RyzenAI Python 进展较慢

跨平台抽象层(推荐):

  • MLC-LLM:TVM 编译 → 任意硬件
  • llama.cpp + GGUF:CPU + GPU 量化推理
  • ONNX Runtime + DirectML(Windows)

4.2 通用端侧部署路径

flowchart LR
    train["训练好的<br/>模型"]
    quant["量化<br/>INT4/INT8"]
    convert["格式转换<br/>GGUF/CoreML/<br/>ONNX/MLX"]
    compile["编译<br/>TVM/MLC"]
    deploy["端侧部署<br/>iOS/Android/PC"]

    train --> quant --> convert --> compile --> deploy

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class train,quant,convert,compile,deploy stage

实操建议:

  • iOS/Mac:Apple MLX(最快上手)→ 进阶 Core ML
  • Android:MLC-LLM(GGUF backend)或 Qualcomm AI Hub
  • Windows AI PC:MLC-LLM 或 ONNX Runtime DirectML
  • 跨平台 demo:MLC-LLM 一份编译跑全平台(含 Web)

4.3 MLC-LLM (最通用方案)

# MLC-LLM 用 TVM 编译模型到各种硬件
# 支持: iOS/Android/Mac/Windows/Linux/Web (WebGPU)

# 示例:
# 1. 编译 Qwen2.5-3B 到 iOS
mlc_llm compile \
    --model Qwen/Qwen2.5-3B-Instruct \
    --quantization q4f16_1 \
    --target iphone-a18 \
    --output qwen2_5_3b_ios.tar

# 2. 在 iOS App 中加载运行
# Swift 代码:
let model = MLCModel(path: "qwen2_5_3b_ios.tar")
let response = model.chat(prompt: "你好")

五、Apple Silicon 生态

Mac 的 M 系列芯片统一内存架构特别适合大模型推理。M4 Max 可以有 128GB 统一内存。

5.1 Apple MLX 框架

# MLX: Apple 官方的机器学习框架, 专为 Apple Silicon 优化
import mlx.core as mx
import mlx.nn as nn

# 加载模型
from mlx_lm import load, generate
model, tokenizer = load("mlx-community/Qwen2.5-32B-Instruct-4bit")

# 推理
response = generate(
    model, tokenizer,
    prompt="Explain MoE architecture",
    max_tokens=500
)

# 优势:
# - 统一内存: CPU/GPU 共享, 零拷贝
# - 量化支持好
# - 针对 Metal 优化
# 速度: M4 Max 跑 32B INT4 可达 30+ tok/s

六、专用 AI 芯片

6.1 推理优化芯片

芯片 公司 路线 适合规模 速度(70B)
LPU Groq SRAM-only 确定性 7B-70B 500 tok/s/user
WSE-3 Cerebras 单晶圆超大芯片 任意(晶圆即内存) 450 tok/s(70B)
TPU v5p Google systolic array 任意 ~150 tok/s
Trainium2 AWS systolic + MoE 优化 70B-1T MoE
Etched Sohu Etched Transformer-only ASIC 70B+ 500K tok/s 总吞吐(声明)
Maia 100 Microsoft 推理通用 7B-70B

各家共同点:砍掉训练特性 + cache 简化 换吞吐与延迟。Groq 是当前消费者最快推理。

6.2 Groq 的推理优势

Groq LPU (Language Processing Unit):
- 确定性执行 (无缓存不确定性)
- 超低延迟: <1ms per token
- 吞吐: LLaMA-70B 达 500+ tok/s per user (消费者最快!)
- 缺点: 只做推理, 成本高, 不支持训练

七、华为昇腾生态

中国最大的 AI 芯片, DeepSeek 等模型可在昇腾上运行。

7.1 MindSpore + 昇腾

# 华为的 MindSpore 框架
import mindspore as ms
from mindformers import AutoModel

model = AutoModel.from_pretrained("deepseek-v3", device="ascend")
# 类似 PyTorch API, 但底层是 CANN

八、世界模型与机器人硬件

8.1 机器人 AI 硬件趋势

flowchart LR
    cloud["云训练<br/>H100/H200"]
    edge["边缘推理<br/>Jetson Thor"]
    onb["On-device<br/>RTX 5070 Mobile"]
    actuator["执行器<br/>实时控制"]

    cloud --> edge --> onb --> actuator

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class cloud,edge,onb,actuator stage
平台 用途 算力 功耗
Jetson Thor (NVIDIA, 2025) 机器人主控 2000 TOPS 100W
Jetson Orin Nano 小型移动机器人 40 TOPS 7-15W
高通 Robotics RB7 工业 / 物流 15 TOPS 5-12W
Tesla FSD HW4 自动驾驶 144 TOPS 250W
Mobileye EyeQ Ultra 自动驾驶 176 TOPS 待核实
Wayve / 华为昇腾车规 自动驾驶 200-400 TOPS 100-300W

趋势:从"通用 GPU + 改驱动"过渡到"机器人专用 SoC(Thor / Orin)",核心需求是实时 VLA 推理(视觉 → 语言 → 动作)。

8.2 VLA (Vision-Language-Action) 模型

Google RT-2, Figure AI 等使用的模式:VLM 输出动作指令。

代表工作:

  • RT-2 (Google 2023):PaLM-E + 动作 head,把动作 token 化进 LM vocab
  • OpenVLA (Stanford 2024):开源 7B VLA,在 7-DoF 机械臂上 work
  • Pi-0 (Physical Intelligence 2024):3B 模型 + flow matching action head
  • Figure 01/02(Figure AI):人形机器人,VLA + 强化学习联合

VLA 部署对硬件的特殊要求:

  • 视觉编码 + LM + 动作解码必须在 <100ms 端到端
  • 需要 INT4 量化 VLM 才能塞进 Jetson Thor 推理
  • 动作连续性比 token throughput 重要(10-30 Hz 控制频率)

九、硬件选型决策

flowchart TB
    start["要部署 LLM/MLLM"]
    q1{"哪个用户群"}
    q2{"模型大小"}

    start --> q1

    q1 -->|"消费者手机"| mobile["MLC-LLM + GGUF<br/>骁龙 8 Elite / iPhone 16+"]
    q1 -->|"AI PC / 桌面"| pc["MLC-LLM / Apple MLX /<br/>llama.cpp"]
    q1 -->|"边缘 / 机器人"| edge["Jetson Orin/Thor<br/>+ TensorRT-LLM"]
    q1 -->|"低延迟生产 API"| q2

    q2 -->|"≤70B"| groq["Groq LPU<br/>500 tok/s/user"]
    q2 -->|">70B / MoE"| h["H100/H200 + vLLM<br/>或 Trainium2"]

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    classDef decision fill:#f5f3eb,stroke:#bdb9ab,color:#1a1a1a;
    class start,mobile,pc,edge,groq,h stage
    class q1,q2 decision

简化口诀

  • 想要"跑得动" → MLC-LLM(跨平台一份代码)
  • 想要"跑得快" → Apple MLX(Mac)/ Groq(云)
  • 想要"塞进设备" → INT4 + GGUF + llama.cpp
  • 想要"机器人实时" → Jetson Thor + TensorRT-LLM

参考文献


上级 · F. 多模态 VLM