
角色一致的系列内容
每个主体给一张图,H3 就能让同一张脸、同一件产品或同一个吉祥物在每个镜头里都可辨认 —— 围绕一个反复出现的角色做多镜头故事的实用做法。
MiniMax 的全模态视频模型 —— 把图像、视频、音频作为同一份参考混合输入,一次调用即得带原生立体声的 2K 视频。
一次充值积分,通用所有模型,想用再用。 · 按需充值,不存在月度清零。
Powered by MiniMax's API on ZOOOP
最多把 9 张图像、3 段视频、3 段音频混进同一份参考上下文 —— H3 把它们作为整体一起理解,跨镜头延续同一个角色、运镜或音色,而不是把每个输入当成孤立的槽位。
每段成片自带声音。对白、音效、音乐与画面在同一次生成中产出并与动作对齐 —— 脚步声、台词、剪辑点自然同步,无需单独配乐或配音。
在你提供的素材上,用自然语言替换主体、更换背景、重新布光或改写一句台词 —— H3 在应用改动的同时,尽量保持未提及的部分不变。
让首帧图动起来,并可选钉住尾帧,得到精确的首尾过渡 —— 驱动参考生成的同一个模型,也能干净地完成图生视频。

每个主体给一张图,H3 就能让同一张脸、同一件产品或同一个吉祥物在每个镜头里都可辨认 —— 围绕一个反复出现的角色做多镜头故事的实用做法。

把节拍或曲子作为音频参考传入,H3 会让画面动作与之同步,并输出带内置立体声的成片 —— 无需单独音频处理即可发布。

把一段语音样本连同画面一起提交,生成的角色就以该音色说话 —— 让同一个可识别的声音贯穿整个系列。

用首/尾帧控制把一张产品静图变成 360 展示或功能循环,并自带声音 —— 一张参考图即成投放级社媒短片。

在已定稿的素材上替换主体、更换背景、调整灯光或改写台词 —— 无需重拍,直接在编辑层迭代。

9:16 剧本化短剧(古装悬疑、家庭冲突……)对白在同一次生成中配好声 —— 15 秒的开场钩子出模型即可用。
按场景选模型,别按品牌选。你的积分在 ZOOOP 上处处通用。
从本页或视频生成器打开 MiniMax H3,选择模式 —— 文本 / 参考,或首尾帧。
写提示词;参考模式下最多加 9 张图、3 段视频、3 段音频作为主体、运动与声音的锚点。
选画幅比例与时长(最长 15 秒)—— 输出为 2K 并自带原生立体声。
生成。
当一个镜头要同时承载特定的角色、声音和音效时,MiniMax H3 就是首选。大多数流水线要把视频模型、语音合成模型和编辑器串在一起,而 H3 把文本、图像、视频、音频作为同一份共享上下文来读,一次调用就返回自带原生立体声的成片。这让它成为系列内容和参考驱动制作的实用之选 —— 过去需要三个工具外加一道拼接的活儿,现在一次生成就出来了。
把 H3 和同类拉开差距的能力是它的全模态参考。一次请求里,你可以给它最多九张图、三段视频、三段音轨,它把这些当作一个整体上下文、而非孤立的输入槽 —— 从照片取一张脸、从片段取一段运镜、从音轨取情绪或节拍,融进同一个场景。这正是让角色、产品或吉祥物在多镜头故事里保持可辨认的原因,也让一段语音样本能把同一个身份贯穿整个系列。由于参考是用自然语言表达、而不是固定的任务菜单,同一个模型也能做提示词级编辑 —— 在你已有的素材上替换主体、更换背景、重新布光或改写一句台词,未触及的区域保持稳定。
第二项旗舰能力是原生音频。每段成片的声音都与画面在同一次生成中产出 —— 对白、音效、音乐与动作对齐,台词、脚步、剪辑点一起落点。对短广告和社媒短片而言,这意味着出模型即可发布,无需单独配乐或配音。输出为 2K,画幅从电影感的 21:9 到竖屏 9:16,片长 5–15 秒(首尾帧图生视频为最长 10 秒),预告、产品循环、竖屏短剧无需切换模型即可覆盖。
不擅长的地方:论电影级分辨率与 4K 交付的最高一档,Veo 3.1 仍领先;论单提示词内描述的多镜头分镜,那是 Kling V3 的地盘;论最强的动漫与微表情且性价比最好,则选 Hailuo 2.3。H3 的甜区是参考驱动的一致性、音色匹配的对白,以及一次生成就拿到"画面 + 声音"。
一个合理的判断模型:当镜头需要一致的角色或声音、混合参考,或内置音频时,默认用 MiniMax H3;要电影级 4K 换 Veo 3.1,要多镜头序列换 Kling V3,要动漫与低成本打样换 Hailuo 2.3。无论选哪个,同一份积分处处通用。
大多数视频模型接收一个提示词加一张图,返回一段无声片段。H3 把文本、图像、视频、音频作为同一份共享上下文一起读取,返回自带声音的成片 —— 把生成、编辑、参考折叠进一个模型,而不用把视频模型、语音模型、编辑器串起来。
是的 —— 每个结果都自带原生立体声,对白、音效、环境声与画面在同一次生成中产出。提供一段语音参考,角色就以该音色说话,从而省去流水线里单独的文本转语音步骤。
参考模式下,一次请求最多 9 张图、3 段视频、3 段音频(共 12 个文件)。至少要有一张图或一段视频;音频必须搭配视觉参考,且每段音频时长为 2–15 秒。H3 把它们作为一个上下文来读 —— 从照片取角色、从片段取运镜、从音轨取情绪,融进同一个场景。
能 —— 编辑是它的核心模式之一。传入一段素材和一条指令,替换角色或物体、更换背景、调整灯光或改写一句台词,H3 会尽量让未提及的部分贴近原片。多条改动可叠加到一次请求里。
输出 2K 并带原生音频。参考与文本模式产出 5–15 秒片段;首尾帧模式为 5–10 秒。画幅比例覆盖 21:9、16:9、4:3、1:1、3:4、9:16,一个模型即可覆盖电影感宽屏到竖屏社媒。
划算 —— 作为一个带原生音频的 2K 模型,它在 ZOOOP 上属于成本较低的一档,且参考素材不单独计费(按生成的视频秒数付费)。放心迭代,而且你的积分永不过期。
Prompt*
Reference Images
Reference Videos
Reference Audio
选择比例*
视频分辨率*
时长*