返回搜索结果

MiniMax-H3 · Online dynamic FP8

发起讨论
NVIDIA DGX Spark128GBvLLM-Omni vLLM-Omni 0.1.dev2381+g310b4b477L0 自报

本页汇总 MiniMax-H3(Online dynamic FP8)在 NVIDIA DGX Spark 上以 vLLM-Omni 运行的 1 次实测数据,来自 1 个独立来源平台;指标为已上架实测的均值。

80.58 s

生成耗时

图像按每张、视频按每段

89.17 GB

VRAM

显存占用

L0 自报

1

实测次数

1

独立来源

GitHub

来源平台

6 天前

最后验证

性能表现

该指标在同模型 + 同硬件的已上架数据里暂无记录

核心数据

生成耗时(平均)
80.58 s
VRAM(平均)
89.17 GB
功耗
— W
输出规格
768x448 · 56 frames · 20 steps · 24fps

基础配置

成员级字段取自最近一次实测

模型
MiniMax-H3
量化方式
Online dynamic FP8
框架
vLLM-Omni
版本
vLLM-Omni 0.1.dev2381+g310b4b477
批次大小
1
输出规格
768x448 · 56 frames · 20 steps · 24fps

硬件信息

标称与实测并排陈列,能否运行由读者自判

GPU
NVIDIA DGX Spark
标称显存
128 GB
实测显存(均值)
89.17 GB
系统
Linux ARM64
驱动
580.173.02
CUDA
13.0

获取与上手

原始模型资料

以下为基础模型入口,不保证与本次量化版本一致;部署请使用上方已核实权重。

启动命令

最近一次实测使用的命令
H3_DIFFUSION_ATTENTION_BACKEND=CUDNN_ATTN H3_EXECUTION_MODE=compile H3_CACHE_BACKEND=cache_dit H3_CACHE_CONFIG='{"Fn_compute_blocks":1,"Bn_compute_blocks":0,"max_warmup_steps":4,"max_cached_steps":-1,"residual_diff_threshold":0.10,"max_continuous_cached_steps":1,"enable_taylorseer":false}' docker compose up -d

来源与证据

共 1 条实测记录,逐条可回溯到原始出处

  1. L0 自报GitHub原始链接 验证于 2026-09-27

    vLLM-Omni 0.1.dev2381+g310b4b477 · Linux ARM64 · CUDA 13.0

    80.58 s

    生成耗时

    89.17 GB

    VRAM

    — W

    功耗

    单DGX Spark,balanced(cuDNN+compile+Cache-DiT0.10):请求2秒、20步,输出56帧/768×448/24fps。warm两次client mean80.579s;89.1659GiB是模型加载统一内存,非峰值,整机peak113.09GiB。排除首次编译;缓存非无损,full-compute111.373s。