MiniMax

MiniMax H3

MiniMax 的全模态视频模型 —— 把图像、视频、音频作为同一份参考混合输入,一次调用即得带原生立体声的 2K 视频。

无需订阅
积分永不过期
了解更多

一次充值积分,通用所有模型,想用再用。 · 按需充值,不存在月度清零。

Powered by MiniMax's API on ZOOOP

核心能力

一次调用,全模态参考

最多把 9 张图像、3 段视频、3 段音频混进同一份参考上下文 —— H3 把它们作为整体一起理解,跨镜头延续同一个角色、运镜或音色,而不是把每个输入当成孤立的槽位。

原生立体声,同一次生成产出

每段成片自带声音。对白、音效、音乐与画面在同一次生成中产出并与动作对齐 —— 脚步声、台词、剪辑点自然同步,无需单独配乐或配音。

提示词级编辑

在你提供的素材上,用自然语言替换主体、更换背景、重新布光或改写一句台词 —— H3 在应用改动的同时,尽量保持未提及的部分不变。

首帧 / 尾帧控制

让首帧图动起来,并可选钉住尾帧,得到精确的首尾过渡 —— 驱动参考生成的同一个模型,也能干净地完成图生视频。

使用场景

角色一致的系列内容

角色一致的系列内容

每个主体给一张图,H3 就能让同一张脸、同一件产品或同一个吉祥物在每个镜头里都可辨认 —— 围绕一个反复出现的角色做多镜头故事的实用做法。

自带声音的音乐视频

自带声音的音乐视频

把节拍或曲子作为音频参考传入,H3 会让画面动作与之同步,并输出带内置立体声的成片 —— 无需单独音频处理即可发布。

音色匹配的对白

音色匹配的对白

把一段语音样本连同画面一起提交,生成的角色就以该音色说话 —— 让同一个可识别的声音贯穿整个系列。

产品与电商短片

产品与电商短片

用首/尾帧控制把一张产品静图变成 360 展示或功能循环,并自带声音 —— 一张参考图即成投放级社媒短片。

提示词级素材编辑

提示词级素材编辑

在已定稿的素材上替换主体、更换背景、调整灯光或改写台词 —— 无需重拍,直接在编辑层迭代。

竖屏短剧

竖屏短剧

9:16 剧本化短剧(古装悬疑、家庭冲突……)对白在同一次生成中配好声 —— 15 秒的开场钩子出模型即可用。

如何选对模型

按场景选模型,别按品牌选。你的积分在 ZOOOP 上处处通用。

一次调用的全模态参考 + 原生音频MiniMax H3
多参考 + 卡节拍音频Seedance 2.0
动漫 / 微表情 / 高性价比Hailuo 2.3
电影级画质 + 4K 放大Veo 3.1
单提示词多镜头分镜Kling V3
开源权重 + 指令编辑Wan 2.7

如何使用

01

从本页或视频生成器打开 MiniMax H3,选择模式 —— 文本 / 参考,或首尾帧。

02

写提示词;参考模式下最多加 9 张图、3 段视频、3 段音频作为主体、运动与声音的锚点。

03

选画幅比例与时长(最长 15 秒)—— 输出为 2K 并自带原生立体声。

04

生成。

深入了解

MiniMax H3 擅长什么,不擅长什么

当一个镜头要同时承载特定的角色、声音和音效时,MiniMax H3 就是首选。大多数流水线要把视频模型、语音合成模型和编辑器串在一起,而 H3 把文本、图像、视频、音频作为同一份共享上下文来读,一次调用就返回自带原生立体声的成片。这让它成为系列内容和参考驱动制作的实用之选 —— 过去需要三个工具外加一道拼接的活儿,现在一次生成就出来了。

把 H3 和同类拉开差距的能力是它的全模态参考。一次请求里,你可以给它最多九张图、三段视频、三段音轨,它把这些当作一个整体上下文、而非孤立的输入槽 —— 从照片取一张脸、从片段取一段运镜、从音轨取情绪或节拍,融进同一个场景。这正是让角色、产品或吉祥物在多镜头故事里保持可辨认的原因,也让一段语音样本能把同一个身份贯穿整个系列。由于参考是用自然语言表达、而不是固定的任务菜单,同一个模型也能做提示词级编辑 —— 在你已有的素材上替换主体、更换背景、重新布光或改写一句台词,未触及的区域保持稳定。

第二项旗舰能力是原生音频。每段成片的声音都与画面在同一次生成中产出 —— 对白、音效、音乐与动作对齐,台词、脚步、剪辑点一起落点。对短广告和社媒短片而言,这意味着出模型即可发布,无需单独配乐或配音。输出为 2K,画幅从电影感的 21:9 到竖屏 9:16,片长 5–15 秒(首尾帧图生视频为最长 10 秒),预告、产品循环、竖屏短剧无需切换模型即可覆盖。

不擅长的地方:论电影级分辨率与 4K 交付的最高一档,Veo 3.1 仍领先;论单提示词内描述的多镜头分镜,那是 Kling V3 的地盘;论最强的动漫与微表情且性价比最好,则选 Hailuo 2.3。H3 的甜区是参考驱动的一致性、音色匹配的对白,以及一次生成就拿到"画面 + 声音"。

一个合理的判断模型:当镜头需要一致的角色或声音、混合参考,或内置音频时,默认用 MiniMax H3;要电影级 4K 换 Veo 3.1,要多镜头序列换 Kling V3,要动漫与低成本打样换 Hailuo 2.3。无论选哪个,同一份积分处处通用。

常见问题

MiniMax H3 和普通视频模型有什么不同?+

大多数视频模型接收一个提示词加一张图,返回一段无声片段。H3 把文本、图像、视频、音频作为同一份共享上下文一起读取,返回自带声音的成片 —— 把生成、编辑、参考折叠进一个模型,而不用把视频模型、语音模型、编辑器串起来。

每段 H3 视频都有声音吗?+

是的 —— 每个结果都自带原生立体声,对白、音效、环境声与画面在同一次生成中产出。提供一段语音参考,角色就以该音色说话,从而省去流水线里单独的文本转语音步骤。

可以用什么作为参考?+

参考模式下,一次请求最多 9 张图、3 段视频、3 段音频(共 12 个文件)。至少要有一张图或一段视频;音频必须搭配视觉参考,且每段音频时长为 2–15 秒。H3 把它们作为一个上下文来读 —— 从照片取角色、从片段取运镜、从音轨取情绪,融进同一个场景。

H3 能编辑已有素材吗?+

能 —— 编辑是它的核心模式之一。传入一段素材和一条指令,替换角色或物体、更换背景、调整灯光或改写一句台词,H3 会尽量让未提及的部分贴近原片。多条改动可叠加到一次请求里。

H3 支持哪些分辨率、时长和画幅比例?+

输出 2K 并带原生音频。参考与文本模式产出 5–15 秒片段;首尾帧模式为 5–10 秒。画幅比例覆盖 21:9、16:9、4:3、1:1、3:4、9:16,一个模型即可覆盖电影感宽屏到竖屏社媒。

MiniMax H3 划算吗?+

划算 —— 作为一个带原生音频的 2K 模型,它在 ZOOOP 上属于成本较低的一档,且参考素材不单独计费(按生成的视频秒数付费)。放心迭代,而且你的积分永不过期。

更多模型

ByteDance
Seedance V2.0
ByteDance
Hailuo AI
Hailuo 2.3
Hailuo AI
Google
Veo 3.1
Google
Kling AI
Kling V3
Kling AI
OpenAI
GPT Image 2.0
OpenAI
MiniMax
Minimax Music V2.6
MiniMax
MiniMax
Minimax Music V2
MiniMax
MiniMax
Speech-2.8-HD
MiniMax
MiniMax
Speech-2.8-Turbo
MiniMax
ByteDance
Seedance V2.0 Fast
ByteDance
ByteDance
Seedance V1.5 Pro
ByteDance
ByteDance
Seedance V1.0 Pro
ByteDance
ByteDance
Seedance V1.0 Pro Fast
ByteDance
ByteDance
Seedance V1.0 Lite
ByteDance
ByteDance
Seedream 5.0 Pro
ByteDance
ByteDance
Seedream 5.0 Lite
ByteDance
ByteDance
Seedream 4.5
ByteDance
ByteDance
Seedream 4
ByteDance
ByteDance
Dreamactor V2
ByteDance
Kling AI
Kling O3
Kling AI
Kling AI
Kling V3 Pro
Kling AI
Kling AI
Kling V2.6 Pro
Kling AI
Kling AI
Kling V2.6
Kling AI
Kling AI
Kling Lipsync
Kling AI
Kling AI
Kling Avatar V2
Kling AI
Kling AI
Kling O1
Kling AI
Midjourney
Midjourney V8.2
Midjourney
Midjourney
Midjourney V8.1
Midjourney
Midjourney
Midjourney
Midjourney
Alibaba
Happy Horse V1.1
Alibaba
Alibaba
Happy Horse
Alibaba
xAI
Grok Imagine V1.5
xAI
xAI
Grok Imagine
xAI
xAI
xAI TTS
xAI
Google
Veo 3.1 Fast
Google
Google
Veo 3
Google
Google
Nano Banana Pro
Google
Google
Nano Banana 2
Google
Google
Nano Banana
Google
Google
Lyria 3 Pro
Google
Google
Lyria 3
Google
Google
Lyria2
Google
Google
Gemini 3.1 Flash TTS
Google
Wan AI
Wan V2.2
Wan AI
Wan AI
Wan V2.2 Turbo
Wan AI
Wan AI
Wan V2.5
Wan AI
Wan AI
Wan V2.6
Wan AI
Wan AI
Wan V2.6 Flash
Wan AI
Wan AI
Wan V2.7
Wan AI
Pixverse AI
Pixverse V6
Pixverse AI
Pixverse AI
Pixverse V5.5
Pixverse AI
Pixverse AI
Pixverse V5
Pixverse AI
Pixverse AI
Pixverse Lipsync
Pixverse AI
Vidu AI
Vidu Q3 Pro
Vidu AI
Vidu AI
Vidu Q3
Vidu AI
Vidu AI
Vidu Q3 Turbo
Vidu AI
Vidu AI
Vidu Q2 Pro
Vidu AI
Vidu AI
Vidu Q2 Turbo
Vidu AI
Luma AI
Luma Ray 2
Luma AI
Luma AI
Luma Ray 2 Flash
Luma AI
Flux AI
Flux 2 Pro
Flux AI
Flux AI
Flux 2
Flux AI
Flux AI
Flux 2 Flash
Flux AI
ElevenLabs
Multilingual V3
ElevenLabs
ElevenLabs
Multilingual V2
ElevenLabs
ElevenLabs
Sound Effects V2
ElevenLabs
Hailuo AI
Hailuo 2.3 Fast
Hailuo AI
Hailuo AI
Hailuo 02
Hailuo AI
Lightricks
LTX-2.3 Pro
Lightricks
Lightricks
LTX-2.3 Fast
Lightricks
Lightricks
LTX-2.3
Lightricks
Pika AI
Pika V2.2
Pika AI
Qwen
Qwen3-TTS
Qwen
Inworld
Inworld TTS
Inworld
Bilibili Index
Index TTS 2
Bilibili Index
Resemble AI
Chatterbox TTS Multilingual
Resemble AI
Open Source
ACE-Step
Open Source
Open Source
LUX TTS
Open Source
CassetteAI
Music Generator
CassetteAI
Recraft
Text to Vector V4.1
Recraft
Recraft
Text to Vector V4.1 Pro
Recraft
Recraft
Image to Vector
Recraft