MiniMax H3(海螺 3.0)详解:开源权重、原生音频的 AI 视频模型

模型5 分钟阅读

MiniMax H3——海螺 3.0 背后的模型——是 2026 年 7 月 31 日发布的视频模型,同时具备两件几乎没有对手能兼得的能力:在同一次生成中把立体声音频与画面一起产出,以及可下载的开源权重。它最高可达 2K(2560×1440),一次请求即可同时读取文本、图像、视频和音频,渲染速度比上一代快约 37%。下面讲清楚它到底能做什么、怎么写提示词,以及它相对 Seedance 和 Kling 在哪里更强、哪里更弱。

模型

MiniMax H3(海螺 3.0)是什么?

H3 是 MiniMax 的全模态视频模型,于 2026 年 7 月 31 日发布,作为海螺 3.0 应用的底层引擎。它最具标志性的特点是音频不是第二道工序:对白、音效、环境声和音乐与画面在同一次生成中一起产出,因此成片一出来就是完整的,而非无声的。它输出原生 2K、24fps,单条时长 4 到 15 秒,画幅从 21:9 到 9:16,并配有 Extend Video 工具可将序列延长到约 30 秒。

这里的「全模态」是字面意义上的:一次请求就能把文本、一张图、一段参考视频和一段音轨作为统一上下文,H3 会把它们全部协调到一起。发布数日后,MiniMax 在 Hugging Face 上公开了权重,并提供了原生 ComfyUI 支持——这正是 H3 在前沿级视频模型中的特殊之处,因为领先者大多保持闭源。在 ReelWand 上,H3 级别的生成正是音频驱动视频 Agent 的底层能力:你用自然语言给一位代言人下 brief,Agent 在服务端组装模型调用。

H3 规格速览

能力MiniMax H3(海螺 3.0)
原生音频立体声,与画面同一次生成(对白 / 音效 / 音乐 / 环境声)
最高分辨率最高 2K(2560×1440),24fps
单条时长原生 4–15 秒;经 Extend Video 可达 约 30 秒
输入全模态——文本 / 图像 / 视频 / 音频,同一次请求
权重Hugging Face 开源权重 + ComfyUI 支持
渲染速度比上一代快约 37%
API 价格$0.13/ 秒 的 2K 视频
入口海螺 App、MiniMax Hub、Open Platform API、OpenRouter、Luma Agents

定义 H3 的两点,恰恰是没有单一对手能同时做到的:一次生成即带原生音频,以及开放、可下载的权重。Seedance 更长、能到 4K,但闭源;Kling 更便宜,但不原生生成音频。

如何给 MiniMax H3 写提示词

  • 把音频也写进去,别只写画面。 既然声音与画面在同一次生成中产出,就在 brief 里写明对白台词、环境声和音乐情绪——「她在温暖的室内说出这句标语,轻柔的室内环境声」——而不是留成无声。
  • 有几种模态就都喂进去。 一张人脸图 + 一段声音样本 + 一句文字动作,比只有文字给 H3 更多可协调的信息。这正是全模态设计的价值所在。
  • 把镜头控制在 15 秒内,再延长。 原生单条为 4–15 秒。先把这一条拍对,再用 Extend Video 延长到约 30 秒,而不是一上来就硬拼时长。
  • 画幅要刻意选。 H3 覆盖 21:9 到 9:16——做 TikTok、Reels 和 Shorts 选 9:16,要电影感黑边选 21:9,别用默认值凑合。
  • 给相机一个动机。 「他说完这句时缓慢推近」胜过「电影感运镜」。说清运动本身,并把它和音频节拍绑在一起。

MiniMax H3 对比 Seedance 2.5 与 Kling

模型强项注意点
MiniMax H3(海螺 3.0)原生音频、开源权重、2K、渲染快原生最长 15 秒,非 4K
Seedance 2.530 秒单镜头、原生 4K、50 个参考输入闭源权重,无原生音频
Kling 3.0性价比、多镜头主体一致性无原生音频,单镜头较短
Veo 3.14K + 原生音频、顶级提示理解价格偏高,闭源

经验法则:当你需要声画一次生成,或想自己跑模型时,选 H3;需要一条又长的 4K 镜头时选 Seedance 2.5;预算是决定因素时选 Kling。详细对比见 MiniMax H3 对比 Kling

H3 在 ReelWand 工作流里的位置

原生音频正是一位「会说话的代言人」所需要的,而这恰是 ReelWand 的 数字人播报工作室 所围绕的能力。这个 Agent 内置一套服务端的风格 DNA——构图、打光、调色、口型同步的质量标准——拼进每一次 H3 请求,因此代言人成片无需你反复输入术语也能保持品牌一致、口型对齐。会话记忆意味着你的下一句提示会在两小时窗口内基于上一帧迭代,而不是从零重生成——你是在打磨一次表演,而不是拿整条镜头去赌。完整流程见 如何制作 AI 数字人播报视频

在一个被「导演化」的 Agent 里,把原生音频变成品牌一致的数字人。

用 H3 级别的音频做一位会说话的代言人

常见问题

MiniMax H3 是开源的吗?

H3 提供开放、可下载的权重,在 2026 年 7 月 31 日发布数日后即公开在 Hugging Face 上,并原生支持 ComfyUI。这让它成为少数几个你可以自己运行、而不必只通过 API 调用的前沿级视频模型之一。

MiniMax H3 会生成音频吗?

会——而且是原生生成。对白、音效、音乐和环境声与画面在同一次生成中以立体声一起产出,因此成片是完整的而非无声的。这是 H3 相对 Seedance 和 Kling 的核心差异点。

H3 支持什么分辨率和时长?

最高 2K(2560×1440),24fps,原生单条 4 到 15 秒。Extend Video 工具可把序列延长到约 30 秒。它不到 4K——那是 Seedance 2.5 的能力。

MiniMax H3 的 API 多少钱?

通过 Open Platform API 约为每秒 2K 视频 $0.13。H3 也可通过海螺 App、MiniMax Hub、OpenRouter 和 Luma Agents 访问。在 ReelWand 上,生成走积分制,视频计价高于静态图。

MiniMax H3 和 Seedance 2.5 该选哪个?

要原生音频、开源权重和快速 2K 渲染选 H3;要一条原生 4K 的 30 秒长镜头且强参考控制选 Seedance 2.5。H3 能一次产出带声音的成片;Seedance 更长更清晰,但无声且闭源。

立即体验

把它变成作品

62 个专精视觉 Agent,每一个都内置了本文所讲的手艺。挑一个,开始创作。

打开 ReelWand

继续阅读