Apple M3 Ultra

台式机

Apple 工作站级统一内存 SoC(Mac Studio,2025-03-12 上市):最高 32 核 CPU / 80 核 GPU,统一内存从 96GB 起、最高可选 512GB,内存带宽 819 GB/s。官方口径是「可在本机内存里跑 600B 参数以上的大模型」。Apple 不公布 TDP,该列留空。

15

运行记录

5

覆盖模型

1

覆盖框架

L0 自报 × 15

证据分布

典型性能表现

同硬件上各模型 × 框架 × 量化的已上架实测均值。

  1. llama.cpp · IQ2_XS Decode 70.2 · Prefill 526.5 ·
  2. llama.cpp · Q5_K_M Decode 31.9 · Prefill 239.3 ·
  3. llama.cpp · Q4_K_M Decode 39 · Prefill 292.5 ·
  4. llama.cpp · Q4_K_M Decode 15 · Prefill 112.5 ·
  5. llama.cpp · IQ3_S Decode 22.5 · Prefill 168.8 ·
  6. llama.cpp · IQ2_XS Decode 27.1 · Prefill 203.3 ·
  7. llama.cpp · Q4_K_M Decode 15 · Prefill 112.5 ·
  8. llama.cpp · IQ3_S Decode 22.5 · Prefill 168.8 ·
  9. llama.cpp · IQ2_XS Decode 27.1 · Prefill 203.3 ·
  10. llama.cpp · Q4_K_M Decode 14.6 · Prefill 109.5 ·
  11. llama.cpp · IQ3_S Decode 21.9 · Prefill 164.3 ·
  12. llama.cpp · IQ2_XS Decode 26.3 · Prefill 197.3 ·
  13. llama.cpp · Q8_0 Decode 74.3 · Prefill 557.3 ·
  14. llama.cpp · Q5_K_M Decode 108.3 · Prefill 812.3 ·
  15. llama.cpp · Q4_K_M Decode 130.4 · Prefill 978 ·

核心规格

厂商
Apple
架构
M3 Ultra
显存
512 GB
显存带宽
819 GB/s
发布日期
2025-03-12

运行记录

共 15 组配置

模型框架量化Decode生成耗时样本数
Qwen3.8-27Bllama.cppIQ2_XS70.2 tok/s—1
Qwen3.8-27Bllama.cppQ5_K_M31.9 tok/s—1
Qwen3.8-27Bllama.cppQ4_K_M39 tok/s—1
Mistral Large 3 70Bllama.cppQ4_K_M15 tok/s—1
Mistral Large 3 70Bllama.cppIQ3_S22.5 tok/s—1
Mistral Large 3 70Bllama.cppIQ2_XS27.1 tok/s—1
Llama 5 70Bllama.cppQ4_K_M15 tok/s—1
Llama 5 70Bllama.cppIQ3_S22.5 tok/s—1
Llama 5 70Bllama.cppIQ2_XS27.1 tok/s—1
Qwen 4 72Bllama.cppQ4_K_M14.6 tok/s—1
Qwen 4 72Bllama.cppIQ3_S21.9 tok/s—1
Qwen 4 72Bllama.cppIQ2_XS26.3 tok/s—1
Qwen 4 8Bllama.cppQ8_074.3 tok/s—1
Qwen 4 8Bllama.cppQ5_K_M108.3 tok/s—1
Qwen 4 8Bllama.cppQ4_K_M130.4 tok/s—1