返回搜索结果
MiniMax-H3 · Online dynamic FP8
NVIDIA DGX Spark128GBvLLM-Omni vLLM-Omni 0.1.dev2381+g310b4b477L0 自报
本页汇总 MiniMax-H3(Online dynamic FP8)在 NVIDIA DGX Spark 上以 vLLM-Omni 运行的 1 次实测数据,来自 1 个独立来源平台;指标为已上架实测的均值。
80.58 s
生成耗时
图像按每张、视频按每段
89.17 GB
VRAM
显存占用
L0 自报
1
实测次数
1
独立来源
GitHub
来源平台
6 天前
最后验证
性能表现
该指标在同模型 + 同硬件的已上架数据里暂无记录
核心数据
- 生成耗时(平均)
- 80.58 s
- VRAM(平均)
- 89.17 GB
- 功耗
- — W
- 输出规格
- 768x448 · 56 frames · 20 steps · 24fps
基础配置
成员级字段取自最近一次实测
- 模型
- MiniMax-H3
- 量化方式
- Online dynamic FP8
- 框架
- vLLM-Omni
- 版本
- vLLM-Omni 0.1.dev2381+g310b4b477
- 批次大小
- 1
- 输出规格
- 768x448 · 56 frames · 20 steps · 24fps
硬件信息
标称与实测并排陈列,能否运行由读者自判
- GPU
- NVIDIA DGX Spark
- 标称显存
- 128 GB
- 实测显存(均值)
- 89.17 GB
- 系统
- Linux ARM64
- 驱动
- 580.173.02
- CUDA
- 13.0
获取与上手
本次部署权重下载
启动命令
最近一次实测使用的命令H3_DIFFUSION_ATTENTION_BACKEND=CUDNN_ATTN H3_EXECUTION_MODE=compile H3_CACHE_BACKEND=cache_dit H3_CACHE_CONFIG='{"Fn_compute_blocks":1,"Bn_compute_blocks":0,"max_warmup_steps":4,"max_cached_steps":-1,"residual_diff_threshold":0.10,"max_continuous_cached_steps":1,"enable_taylorseer":false}' docker compose up -d来源与证据
共 1 条实测记录,逐条可回溯到原始出处
vLLM-Omni 0.1.dev2381+g310b4b477 · Linux ARM64 · CUDA 13.0
80.58 s
生成耗时
89.17 GB
VRAM
— W
功耗
单DGX Spark,balanced(cuDNN+compile+Cache-DiT0.10):请求2秒、20步,输出56帧/768×448/24fps。warm两次client mean80.579s;89.1659GiB是模型加载统一内存,非峰值,整机peak113.09GiB。排除首次编译;缓存非无损,full-compute111.373s。