文生视频
使用 FL2VA。适合连续镜头、人物动作、电影感场景和带声音描述的视频。
这是为当前 MiniMax H3 整合包整理的使用手册,覆盖工作流、模型搭配、参数调节、显存策略和常见故障。先从预设工作流开始,再逐步掌握节点。
当前整合包是 Windows 便携版,已经带有 Python、ComfyUI、模型和自定义节点。
双击桌面的“ComfyUI MiniMax H3”,或打开整合包内的启动器。
http://127.0.0.1:8188
点击 Load,从 ComfyUI/user/default/workflows 选择预设 JSON。
先保持模型和 Seed 不变,只修改提示词,确认画面方向后再调整帧数、分辨率和步数。
点击 Queue Prompt。结果默认写入整合包的 ComfyUI/output 目录。
模型家族不能混用。一个工作流里的扩散模型、文本编码器和 VAE 应属于同一条链路。
| 方向 | 扩散模型 | 文本/视觉编码器 | VAE |
|---|---|---|---|
| MiniMax H3 视频 | MiniMax_H3 FL2VA / REF2VA | qwen3vl_32b_minimax_h3_int8_convrot | minimax video + audio VAE |
| Flux-2 Klein 图片 | flux-2-klein-9b 或 FP8 | qwen_3_8b_fp8mixed | flux2-vae |
| Z-Image 图片 | z_image_turbo 或 Base | qwen_3_4b_fp4_mixed | ae.safetensors |
| Krea2 图片 | Krea2-MuseByStable | 工作流预设 | Krea2 VAE |
适合文生视频、首尾帧视频和参考图生视频。当前默认工作流是 1344×768、73 帧、24 FPS、25 步。
使用 FL2VA。适合连续镜头、人物动作、电影感场景和带声音描述的视频。
使用首帧和尾帧控制过渡,适合明确开始和结束状态的动作。
使用 REF2VA。适合保持人物、服装、场景或风格参考并生成动作。
49 帧约 2.04 秒,73 帧约 3.04 秒,97 帧约 4.04 秒,145 帧约 6.04 秒。
推荐起步:768×432 · 49 帧 · 24 FPS · 20 步 稳定后:960×544 · 73 帧 · 24 FPS · 20–25 步 质量优先:1280×720 · 73 帧 · 25 步
不要一次改很多参数。固定 Seed,只改一个变量,才能知道变化来自哪里。
| 参数 | 作用 | 当前建议 |
|---|---|---|
| 分辨率 | 画面细节、显存和速度 | 16GB 显存先 768×432 或 960×544;尺寸使用 32 的倍数 |
| 帧数 | 决定视频长度和资源占用 | 先 49 或 73 帧,确认动作后再提高 |
| FPS | 决定播放速度,不增加模型生成帧数 | MiniMax H3 保持 24 FPS |
| Steps | 采样迭代次数,影响细节与耗时 | 测试 12–16;日常 20–25;最终 25–30 |
| Seed | 固定随机起点,便于复现 | 调参固定;批量生成随机 |
| Sampler | 采样策略 | MiniMax 001/002 保持 res_multistep;003 保持 euler |
| CFG/Guidance | 提示词约束强度 | 优先使用工作流默认值,不要照搬 SDXL 参数 |
图片任务建议先用轻量模型确认构图,再使用高质量模型完成最终版本。
快速文生图,默认约 9 步。适合批量出图和提示词测试。常用尺寸 768×768、1024×1024、1280×768。
文生图,完整 9B 质量优先,FP8 更适合 16GB 显存。工作流默认约 4 步。
单图编辑、双图编辑、三图编辑和局部重绘。参考图强度越高,越保留原图。
适合写实人像、产品图、商业视觉和风格迁移,可配 realism LoRA。
提高 FPS、让动作更流畅。它不是重新生成视频,而是计算中间帧。
3B FP8 更省资源,7B FP8 质量更高。先用短片段测试,再处理完整视频。
视频长任务建议:先生成 49–73 帧小样 → 确认人物和动作 → 分段生成 → RIFE 插帧/SeedVR2 高清 → 视频剪辑拼接
当前是 RTX 4060 Ti 16GB 显存 + 16GB 系统内存。显存决定模型能否装下,系统内存决定换页和长任务稳定性。
| 配置 | 适合 | 建议 |
|---|---|---|
| 当前 16GB 显存 + 16GB RAM | 短视频、FP8 图片、短片放大 | MiniMax 先 768×432、49–73 帧 |
| 64GB RAM + 32GB 显存 | 高分辨率、长视频、Flux 9B、SeedVR2 7B | 可尝试 1280×720、97–145 帧;更长视频建议分段 |
图片 Flux 模型接收了视频 latent,或模型家族混用。检查 UNETLoader、CLIPLoader 和 VAE 是否匹配。
工作流保存的模型名与当前目录不一致。刷新页面,在下拉框重新选择实际存在的模型。
依次降低帧数、分辨率、模型尺寸,关闭辅助大模型,最后再考虑低显存模式。
这是便携 Python 开发文件或 CUDA 编译环境问题,不是提示词参数问题。