MiniMax H3是什么
MiniMax H3 是 MiniMax 推出的新一代通用全模态生成模型,支持文本、图像、视频、声音等多模态信息的统一理解与生成。模型能够处理包含图片、视频、音频和自然语言描述的复杂上下文,并生成最高 2K 分辨率、15 秒长度、原生双声道音视频内容。
相比传统图像生成、视频生成模型分别处理单一任务的方式,MiniMax H3 通过统一多模态架构,将文生图、文生视频、音频生成、视频编辑、主体参考、动作迁移等能力融合到同一模型中,面向广告、电商、游戏、影视、产品设计等商业创作场景。
MiniMax H3 的模型特性
- 全模态上下文理解:支持同时理解文本、图片、视频和声音等多种输入信息,可根据复杂指令完成跨模态内容生成任务。
- 统一多模态生成能力:将文生图、文生视频、文生音频以及多种参考编辑任务融合,不再依赖多个专用模型组合。
- 高质量视频生成:支持最高 2K 分辨率视频生成,最长可输出 15 秒内容,并支持原生双声道音频生成。
- 视频到视频动作迁移(V2V Motion Transfer):支持参考视频中的动作迁移到目标角色或素材,实现更精准的视频编辑。
- 复杂指令遵循能力:支持通过自然语言描述多个参考条件,例如指定镜头语言、人物动作、声音风格和视觉元素关系。
- 商业级内容生成能力:针对品牌、电商、广告等应用优化,在文字呈现、品牌元素保持、视觉一致性方面进行增强。
MiniMax H3的应用场景
- 广告与电商短片: 用产品图与品牌素材作参考,一次生成带解说或音效的商业短片,画面文字与品牌信息的呈现是该模型强调的能力方向。
- 视频动作迁移: 通过 V2V Motion Transfer,把参考视频的镜头运动或人物动作迁移到新的角色与场景上,用于批量产出同一动作模板的不同版本。
- 动态海报与片头: 从静态设计稿出发生成带音效的动态版本,适合电影片头、活动主视觉等需要短时高质感画面的场合。
- 游戏与 UI/UX 演示: 生成游戏 UI 动效、界面演示片段,用于概念验证或对外展示。
- 音色与配音复用: 用参考音频指定角色声音,在多个镜头间保持一致的音色表现。
- AI 视频工具集成: 开发者通过异步任务接口把生成能力接入自有的创作工具或工作流产品。
MiniMax H3的产品定价
按官方开放平台的按量付费价目,MiniMax H3 按输出视频时长计费:2K 分辨率为每秒 0.13 美元,768P 为每秒 0.09 美元。输入素材另有计费规则——输入音频免费;输入图片前 5 张免费,超出部分每张 0.04 美元;输入视频按输入视频时长与输出分辨率计费,2K 为每秒 0.13 美元,768P 为每秒 0.09 美元。除按量付费外,MiniMax 开放平台还提供 Token Plan 订阅制,具体权益与最新价格以官网价格页为准。
如何使用MiniMax H3
- 立即体验:https://www.liblib.tv/
- 注册开放平台: 访问 https://platform.minimax.io 注册账号并在控制台创建 API Key。
- 准备上下文素材: 按需上传参考图片、参考视频或参考音频,并用自然语言在 prompt 中说明各素材与目标视频的关系。
- 创建生成任务: 调用视频生成接口,
model字段填MiniMax-H3,请求体采用多模态content[]结构,按text/image_url/video_url/audio_url区分元素类型。 - 轮询并下载: 接口返回
task_id后轮询任务状态,成功后取得file_id,再据此获取视频下载地址。
©版权声明:如无特殊说明,本站所有内容均为AIHub.cn原创发布和所有。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。否则,我站将依法保留追究相关法律责任的权利。
