industry模型与洞察20 分钟阅读

MiniMax H3 评测:规格、限制与 Seedance 对比测试

全面解析 MiniMax H3 的视频规格、参考素材限制、原生立体声音频,并为 OmniArt 上的 Seedance 2.0 用户提供可复现的对比测试方案。

OmniArt 团队
MiniMax H3 评测:规格、限制与 Seedance 对比测试

这篇 MiniMax H3 评测先明确一个重要前提:目前可获得的证据来自文档和服务商挑选的演示,并非 OmniArt 的独立基准测试。PixVerse 在 2026 年 7 月发布的评测中提到,H3 可生成 5–15 秒、24 FPS 的视频,支持原生立体声音频、1440p 模式、6 种宽高比、首尾帧输入和混合参考素材工作流。这些是有文档记录、值得验证的能力,不保证每个账户、接入渠道或创作需求都能以相同方式使用。

MiniMax H3 现已作为 Creator 及以上套餐可用的模型上线 OmniArt 视频工作区,支持 1440p、5–15 秒输出,并提供视频、转场和参考三种模式。现在可以直接在 OmniArt 执行下文的测试方案,但服务商演示仍不等同于独立基准测试。

说明

下文的 H3 参数均为服务商公开信息,来源是 PixVerse 的 MiniMax H3 评测。在安排正式制作前,请先确认当前 MiniMax 产品界面、模型名称、设置、价格、水印规则和使用条款。

MiniMax H3 公开规格

从这些规格来看,H3 面向的是多模态视频工作流,而不只是文本生成短片。它最重要的特性并非某个分辨率数字,而是能在接收较长文字简报的同时,综合使用图片、视频和音频参考素材来控制结果。

项目H3 公开能力实际需要验证的内容
时长5–15 秒是否每种模式都支持完整时长范围
帧率24 FPS导出文件能否保持恒定帧率
音频原生立体声音频台词时序、环境声连续性和声道质量
分辨率1440p 模式实际可用性、交付尺寸和导出限制
宽高比6 种:21:9、16:9、4:3、1:1、3:4 和 9:16各比例是否支持相同模式和质量
帧输入可使用 0、1 或 2 张图片控制首尾帧最终构图与目标尾帧的接近程度
一体化参考最多 9 张图片、3 段视频和 3 个音频文件,合计不超过 12 个文件模型如何处理相互冲突的输入
提示词长度最多 7,000 个字符更短、更有结构的简报是否更稳定

参考素材数量的计算方式值得特别注意。各类型上限相加是 15 个文件,但单次请求的合计上限为 12 个。放入 9 张图片和 3 段视频后,素材包已经满额,不能再加入 3 个音频文件。应在上传前规划参考素材预算,避免提交时才发现冲突。

H3 规格会怎样改变创作者的工作

参考素材的分工成为核心任务

一体化参考模式可以把身份、产品几何结构、摄影语言、运动和声音分别交给不同输入控制,但也会增加简报内部冲突的可能。高光质感的棚拍图、手持运动参考和安静的人声样本都可能有用,但模型仍需要知道每个文件具体负责什么。

为每项参考素材只分配一个任务:用图片保护主体,用视频定义运动或镜头节奏,用音频定义声音或时序。如果两项素材争夺同一个控制目标,先删掉其中一项,而不是继续增加提示词。

首尾帧应被视为运动测试

提供两张图片并不能定义它们之间的变化路径。一份可控的转场简报应该说明什么会改变、什么必须保持不变、变化由什么触发,以及镜头最终停在哪里。测试重点是结果能否自然抵达给定的尾帧构图,而不是在最后一秒突然跳向目标。

制作产品视频时,应在片段中的多个时间点检查轮廓、标签位置、材质和接触阴影。即使首帧和尾帧完全正确,中间过程不可用,整段视频仍然无法交付。

原生立体声音频需要单独审核

原生声音可以减少制作交接,但画面优秀与声音优秀是两项独立结果。应分别审核台词时序、空间底噪、前景音效、音乐平衡和左右声道定位。如果场景包含对白,还要检查侧脸和切换镜头时的口型,而不只是表现最好的正面画面。

OmniArt 当前把 H3 原生音频作为生成流程的一部分,不提供独立音频开关。在参考模式中,音频文件属于参考输入,仍须至少搭配一项视觉参考。

7,000 个字符是容量,不是目标

较长的提示词上限适合容纳镜头顺序、保留规则、台词、声音要求和参考素材分工,但不代表应该描述所有可能性。先从紧凑的制作简报开始,只在某项细节能解决明确失败时再加入。

实用的 H3 简报可以按以下顺序组织:

  1. 写明交付格式、时长和宽高比。
  2. 为每个参考文件指定唯一用途。
  3. 按时间顺序描述镜头流程。
  4. 每个镜头只指定一个主要主体动作和一种摄影机行为。
  5. 分别写出台词、前景声音和环境声。
  6. 最后补充身份、产品几何结构、服装和场景的保留规则。

MiniMax H3 与 OmniArt 上的 Seedance 2.0 对比

这是能力对比,不是胜负结论。两栏均以 OmniArt 当前模型注册信息和控制项为准,H3 的部分行为另参考服务商文档,仍需通过独立输出测试验证。本文没有执行条件受控的 H3 与 Seedance 基准测试。

能力OmniArt 当前的 MiniMax H3OmniArt 当前的 Seedance 2.0
时长5–15 秒4–15 秒
输出质量1440p标准版:480p、720p、1080p、2160p;快速版和 Mini 版:480p、720p
宽高比文生视频可选 21:9、16:9、4:3、1:1、3:4、9:16;加入视觉输入后自动跟随输入画面同样 6 种比例
图片驱动工作流视频、转场和参考模式;转场模式使用首尾帧视频、转场、参考、延长和修改模式;转场模式使用首尾帧
参考上限最多 9 张图片、3 段视频、3 段音频,合计 12 个;视频与音频各限 15 秒,音频必须搭配视觉参考最多 9 张图片、3 段视频、3 段音频;合计不超过 12 个
音频原生立体声输出,无独立音频开关;参考音频必须搭配视觉参考支持原生音频;参考音频需要搭配视觉参考
提示词容量文档记录最多 7,000 个字符;OmniArt 编辑器最多接受 10,000 个字符,仍应测试简洁提示词OmniArt 编辑器最多接受 10,000 个字符,但模型实际表现仍应以简洁提示词测试
OmniArt 可用性Creator 及以上套餐可选标准版、快速版和 Mini 版按套餐权限开放

这张表显示,两者的重叠度比模型名称暗示的更高。两套工作流都面向参考素材密集的短视频,最长均为 15 秒,混合参考包也都以 12 个文件为上限。因此,更有效的问题不是“谁的规格更大”,而是“哪一个模型更能保住这份简报里最重要的属性”。

H3 文档中的 1440p 模式处在常见的 1080p 和 2160p 交付规格之间。Seedance 标准版在 OmniArt 提供更高的最高设置,但输出尺寸并不能独自决定可用细节。应把两段视频统一到相同交付分辨率后,再比较纹理稳定性、文字、面部和产品边缘。

在 OmniArt,H3 每输出 1 秒消耗 9 积分。参考模式还会按参考视频每个向上取整秒收取 9 积分;前 5 张参考图片免费,之后每张 2 积分,参考音频不额外收费。提交前应按完整素材包估算,而不只看输出时长。

可复现的 H3 与 Seedance 对比方案

PixVerse 的 H3 与 Seedance 对比正确地把服务商示例当作测试素材,而不是可以照单全收的基准结论。要得到经得起追问的决定,请执行自己的配对测试,并保留包括失败结果在内的所有输出。

1. 选择一项制作风险

选择一种失败后会产生明确成本的需求,例如产品几何结构、跨镜头角色身份、手与道具的互动、尾帧准确度或台词时序。第一次测试不要把五项风险全部塞在一起。

2. 锁定素材包

两条路线使用相同且符合要求的图片、视频和音频。如果其中一条路线无法接受某项输入,应记录缺失的控制能力,而不是换用不同素材。替代素材会改变测试条件。

3. 锁定交付条件

保持时长和宽高比一致。先用适合草稿的设置生成,再把导出文件统一规格后评审。如果某条路线支持固定种子,请保持种子不变,并记录界面显示的每项设置。

4. 转换提示词语法,不改变意图

主体、动作、镜头顺序、摄影机方向、声音和保留规则都应保持一致,只改变各产品绑定参考素材所需的语法。Seedance 提示词指南说明了如何把制作简报转化为清晰的模型指令,同时保留底层意图。

5. 不要只运行一次

一条漂亮视频衡量的可能是运气,而不是可靠性。每条路线至少生成 3 次,保留失败结果,并计算剪辑师真正能使用的比例。如果模型只有借助未记录的特殊技巧才能成功,也要把额外劳动计入结果。

6. 为完整视频评分

用简单的 1–5 分制审核 5 个维度:

  • **简报遵循度:**所有要求的情节是否按正确顺序出现?
  • **参考素材还原度:**身份、产品形状、服装和场景是否保持可识别?
  • **运动连续性:**身体、道具和摄影机运动是否在物理上清晰可读?
  • **音频可用性:**台词、音效、环境声和立体声定位是否支撑场景?
  • **剪辑就绪度:**有多少秒可以不经修复直接进入真实时间线?

尽量由相同评审人员评分,并在条件允许时隐藏模型名称。最终选择应依据每次尝试获得的可用素材,而不是最好看的一张缩略图。

最值得先测的三份简报

产品功能短片

分别提供产品细节图和主视觉图,要求一段环绕展示、一次功能演示和干净的收尾帧。对轮廓、活动部件、标签和材质连续性评分。这个测试能揭示模型能否在说明产品的同时保持物体一致。

双人竖屏场景

为两位表演者各提供一张身份图片,再加入一小段表演参考和克制的对话。检查镜头变化中的面部身份、视线、动作连续性、口型同步和空间底噪。采用 9:16,模拟常见的社交媒体交付格式。

图形化片头序列

提供定义视觉语言的关键帧和一段控制节奏的运动视频。要求生成带有清晰标题卡、明确转场和原创声音底层的短片。评估重点是设计系统能否经受运动,而不是只看开场画面。

必须持续关注的限制

H3 的公开规格无法回答 OmniArt 排队时间、地区服务差异、水印规则,也无法证明服务商演示能稳定复现。OmniArt 当前已明确 Creator 及以上套餐权限、1440p 输出和上述积分规则,但产品控制项与价格仍可能变化。在把模型作为正式制作依赖前,请检查实时编辑器与积分预估。

权利合规同样是工作流责任。确认你有权使用相关面孔、声音、镜头、音乐、品牌素材并进行商业交付。模型允许上传某个文件,不代表自动授予使用权。

警告

不要拿 H3 官方精选演示与一次刚生成的 Seedance 结果对比,就称之为受控基准测试。前者的源素材、隐藏设置、尝试次数和编辑筛选均未知。演示适合用来设计测试,不适合直接宣布胜者。

结论

从文档来看,MiniMax H3 面向受控的多模态短视频:5–15 秒、24 FPS、立体声音频、1440p、文生视频的 6 种比例、视觉输入自适应画幅,以及最多 12 个文件的混合参考素材包。Creator 及以上套餐现在可以在 OmniArt 的视频、转场和参考模式中直接测试。尚未解决的问题,仍是它在你自己的素材和交付期限下能否稳定复现。

打开 OmniArt 上的 MiniMax H3,按素材包选择视频、转场或参考模式,并保存每次生成结果。然后用同一份简报测试 OmniArt 上的 Seedance 2.0 标准版,并参考 Seedance 2.0 提示词与用例指南。本文没有执行这项独立并排测试,因此请评审完整结果集,而不是只看各模型表现最好的片段。

常见问题

MiniMax H3 可以在 OmniArt 使用吗?

可以。Creator 及以上套餐可在 OmniArt 视频工作区选择 MiniMax H3。打开 OmniArt 上的 MiniMax H3,即可使用视频、转场或参考模式。

MiniMax H3 支持多长的视频和多少帧率?

PixVerse 所查阅的文档描述为 5–15 秒、24 FPS,OmniArt 当前也提供相同的 5–15 秒时长范围和 1440p 输出。

MiniMax H3 可以使用多少项参考素材?

参考模式最多支持 9 张图片、3 段视频和 3 个音频文件,合计上限为 12 个文件。参考视频与参考音频各自最多合计 15 秒,且音频必须至少搭配一张图片或一段视频。

MiniMax H3 在 OmniArt 消耗多少积分?

H3 每输出 1 秒消耗 9 积分。参考模式中,参考视频每个向上取整秒另收 9 积分;前 5 张参考图片免费,之后每张 2 积分,参考音频不额外收费。

MiniMax H3 能生成音频吗?

文档记录支持原生立体声音频,OmniArt 当前不提供独立音频开关。参考音频可以引导生成,但请求中必须至少包含一项视觉参考。应分别测试台词时序、音效、环境声、音乐平衡和声道表现。

MiniMax H3 比 Seedance 2.0 更好吗?

仅凭规格无法得出这个结论。请使用相同素材包、时长、宽高比、创作简报和评审标准进行配对测试,多次生成,并对可用素材、参考还原度、运动、音频和剪辑就绪度评分。

准备好创作了吗?

开始用 AI 生成精彩内容

免费开始