Apple M3 Ultra
台式机Apple 工作站级统一内存 SoC(Mac Studio,2025-03-12 上市):最高 32 核 CPU / 80 核 GPU,统一内存从 96GB 起、最高可选 512GB,内存带宽 819 GB/s。官方口径是「可在本机内存里跑 600B 参数以上的大模型」。Apple 不公布 TDP,该列留空。
15
运行记录
5
覆盖模型
1
覆盖框架
L0 自报 × 15
证据分布
典型性能表现
同硬件上各模型 × 框架 × 量化的已上架实测均值。
- llama.cpp · IQ2_XS Decode 70.2 · Prefill 526.5 ·
- llama.cpp · Q5_K_M Decode 31.9 · Prefill 239.3 ·
- llama.cpp · Q4_K_M Decode 39 · Prefill 292.5 ·
- llama.cpp · Q4_K_M Decode 15 · Prefill 112.5 ·
- llama.cpp · IQ3_S Decode 22.5 · Prefill 168.8 ·
- llama.cpp · IQ2_XS Decode 27.1 · Prefill 203.3 ·
- llama.cpp · Q4_K_M Decode 15 · Prefill 112.5 ·
- llama.cpp · IQ3_S Decode 22.5 · Prefill 168.8 ·
- llama.cpp · IQ2_XS Decode 27.1 · Prefill 203.3 ·
- llama.cpp · Q4_K_M Decode 14.6 · Prefill 109.5 ·
- llama.cpp · IQ3_S Decode 21.9 · Prefill 164.3 ·
- llama.cpp · IQ2_XS Decode 26.3 · Prefill 197.3 ·
- llama.cpp · Q8_0 Decode 74.3 · Prefill 557.3 ·
- llama.cpp · Q5_K_M Decode 108.3 · Prefill 812.3 ·
- llama.cpp · Q4_K_M Decode 130.4 · Prefill 978 ·
核心规格
- 厂商
- Apple
- 架构
- M3 Ultra
- 显存
- 512 GB
- 显存带宽
- 819 GB/s
- 发布日期
- 2025-03-12
运行记录
共 15 组配置
| 模型 | 框架 | 量化 | Decode | 生成耗时 | 样本数 |
|---|---|---|---|---|---|
| Qwen3.8-27B | llama.cpp | IQ2_XS | 70.2 tok/s | — | 1 |
| Qwen3.8-27B | llama.cpp | Q5_K_M | 31.9 tok/s | — | 1 |
| Qwen3.8-27B | llama.cpp | Q4_K_M | 39 tok/s | — | 1 |
| Mistral Large 3 70B | llama.cpp | Q4_K_M | 15 tok/s | — | 1 |
| Mistral Large 3 70B | llama.cpp | IQ3_S | 22.5 tok/s | — | 1 |
| Mistral Large 3 70B | llama.cpp | IQ2_XS | 27.1 tok/s | — | 1 |
| Llama 5 70B | llama.cpp | Q4_K_M | 15 tok/s | — | 1 |
| Llama 5 70B | llama.cpp | IQ3_S | 22.5 tok/s | — | 1 |
| Llama 5 70B | llama.cpp | IQ2_XS | 27.1 tok/s | — | 1 |
| Qwen 4 72B | llama.cpp | Q4_K_M | 14.6 tok/s | — | 1 |
| Qwen 4 72B | llama.cpp | IQ3_S | 21.9 tok/s | — | 1 |
| Qwen 4 72B | llama.cpp | IQ2_XS | 26.3 tok/s | — | 1 |
| Qwen 4 8B | llama.cpp | Q8_0 | 74.3 tok/s | — | 1 |
| Qwen 4 8B | llama.cpp | Q5_K_M | 108.3 tok/s | — | 1 |
| Qwen 4 8B | llama.cpp | Q4_K_M | 130.4 tok/s | — | 1 |