返回搜索结果

Llama-3.1-8B-Instruct · Q4_K_M

Apple M3 Max(MacBook Pro 14)36GBOllama 0.5.7L1 已复现

本页汇总 Llama-3.1-8B-Instruct(Q4_K_M)在 Apple M3 Max(MacBook Pro 14) 上以 Ollama 运行的 2 次实测数据,来自 2 个独立来源平台;指标为已上架实测的均值。

39.15 tok/s

Decode

解码速度

408.85 tok/s

Prefill

预填充速度

0.51 s

TTFT

首 token 延迟

5.8 GB

VRAM

显存占用

L1 已复现

2

实测次数

2

独立来源

Reddit、Hugging Face

来源平台

2026-08-18

最后验证

性能表现

  1. Ollama · Q4_K_M (当前)Decode 39.15 · Prefill 408.85 ·

核心数据

Decode(平均)
39.15 tok/s
Prefill(平均)
408.85 tok/s
TTFT(平均)
0.51 s
VRAM(平均)
5.8 GB
MTP 接受率
TTFB
— GB
功耗
47.3 W

基础配置

成员级字段取自最近一次实测

模型
Llama-3.1-8B-Instruct
量化方式
Q4_K_M
框架
Ollama
版本
0.5.7
上下文长度
8192 tokens

硬件信息

标称与实测并排陈列,能否运行由读者自判

GPU
Apple M3 Max(MacBook Pro 14)
标称显存
36 GB
实测显存(均值)
5.8 GB
系统
macOS 15.3

来源与证据

共 2 条实测记录,逐条可回溯到原始出处

  1. L0 自报Reddit原始链接 验证于 2026-07-21

    0.5.7 · macOS 15.3 · 8192 ctx

    38.9 tok/s

    Decode

    402.1 tok/s

    Prefill

    0.52 s

    TTFT

    5.8 GB

    VRAM

    MTP

    W

    功耗

    M3 Max 统一内存下 8B Q4 约 39 tok/s,功耗约 45W。
  2. L1 已复现Hugging Face原始链接 验证于 2026-08-18

    0.5.9 · macOS 15.3 · 8192 ctx

    39.4 tok/s

    Decode

    415.6 tok/s

    Prefill

    0.49 s

    TTFT

    5.8 GB

    VRAM

    MTP

    47.3 W

    功耗

    Ollama 0.5.9 复现 39.4 tok/s。