MiniMax H3 評測:規格、限制,還有一套比較計畫
MiniMax H3 評測:目前 OmniArt 上的控制項、參考素材上限、768p 與 2K 輸出,還有一套給 Seedance 創作者的受控比較計畫。

這篇 MiniMax H3 評測從一個有用的限制開始講起:目前手上的證據是文件和服務商自選的示範,不是 OmniArt 的獨立基準測試。PixVerse 2026 年 7 月的評測描述了 24 FPS 的 5–15 秒片段、立體聲音訊、一個 1440p 模式、六種文生影片畫面比例、首末影格輸入,還有一條混合參考素材的流程。那些是服務商聲稱、待你去測的能力,不是「每一份需求——或每一個產品介面——都會以同樣方式開放它們」的保證。
MiniMax H3 現在是 OmniArt 影片工作台裡 Creator 級距可選用的模型。創作者可以在影片、轉場和參考素材三種模式下,用 768p 或 2K 產出 5–15 秒的成品。有得用讓下面這套測試計畫在 OmniArt 裡可以真的執行,但它不會把服務商的示範變成獨立的基準測試。
說明
下面的 H3 數字是PixVerse MiniMax H3 評測裡轉述的服務商聲稱細節。排製作進度之前,先確認當下的 MiniMax 產品介面、模型名稱、設定、價格、浮水印政策和使用條款。
MiniMax H3 記載的規格
這份規格指向的是一條多模態的影片流程,而不是一個只吃文字的片段生成器。它最重要的特徵不是任何單一的解析度數字;而是能同時指揮圖片、影片和音訊參考素材,還照樣塞得下一份很長的文字需求。
| 面向 | 記載的 H3 能力 | 實務上要驗證什麼 |
|---|---|---|
| 長度 | 5–15 秒 | 是不是每個模式都開放完整範圍 |
| 影格率 | 24 FPS | 輸出有沒有維持固定影格率 |
| 音訊 | 服務商聲稱的立體聲 | 當下的產品介面實際回傳什麼、怎麼混的 |
| 解析度 | 一個 1440p 模式 | OmniArt 上以 2K 呈現,另有 768p 草稿選項 |
| 畫面比例 | 文生影片:21:9、16:9、4:3、1:1、3:4 和 9:16;有畫面輸入時由輸入決定構圖 | 由輸入推導的構圖,保住原本裁切的程度如何 |
| 影格輸入 | 零張、一張或兩張圖片做首末影格控制 | 最終構圖被貼近到什麼程度 |
| 全合一參考素材 | 最多 9 張圖片、3 段影片、3 段音訊,合計 12 份檔案 | 模型怎麼解決互相衝突的輸入和長度上限 |
| 提示詞長度 | 最多 7,000 字元 | 比較短、有結構的需求是不是表現更穩定 |
參考素材的算術值得注意。分項上限加起來是 15,但整個請求的合計上限是 12 份檔案。一組九張圖片加三段影片已經滿了;它不可能再放三段音訊。參考影片合計最多 15 秒,參考音訊也是合計最多 15 秒。音訊不能單獨組成一個參考素材請求;至少要放一張圖片或一段影片。上傳素材之前先規劃參考素材的預算,不要等到送出的時候才發現衝突。
H3 的規格替創作者改變了什麼
指揮參考素材變成主要工作
一個全合一的參考素材模式,可以把識別、產品幾何、鏡頭語言、動作和聲音拆到不同的輸入裡。它同時也製造了更多讓一份需求自打嘴巴的機會。一張光亮的棚拍照、一段手持的動態片段,還有一份安靜的人聲參考素材,可能各自都有用,但模型還是需要知道每一份檔案控制的是哪個性質。
給每一份參考素材一個職責。用圖片保護主體、用影片定義動作或運鏡節奏、用音檔定義人聲或時間點。如果兩份素材在搶同一個職責,先拿掉一個,不要再加提示詞文字。
首末影格要當成一次動態測試來看
給兩張圖片並不會定義它們之間那條路徑。一份受控的轉場需求要說明什麼會變、什麼固定不動、是什麼造成那個變化,還有鏡頭最後停在哪裡。要測的是結果有沒有自然地走到你給的那個最終構圖,而不是在最後一秒硬彈過去。
做產品的時候,在片子的好幾個時間點檢查輪廓、標籤位置、材質和接觸陰影。第一格和最後一格對了,救不回一個沒法用的中段。
音訊的說法需要自己一輪檢查
原生音訊可以減少交接,但一段好看的片子和一條好聽的音軌是兩個不同的成果。服務商文件描述的是立體聲,而 OmniArt 目前沒有開放獨立的 H3 音訊控制項。在你圍繞對白、空間聲響、前景音效、音樂平衡或左右定位做規劃之前,先檢查交付出來的那份素材本身。
在參考素材模式裡,音檔是引導性的輸入,而且仍然需要至少一份視覺參考素材。不能把「可以用參考音訊」當成「每一份輸出都會附一條可上線的音軌」的證據。
七千字元是容量,不是目標
很長的提示詞額度,對鏡頭順序、保留規則、對白、聲音和參考素材職責都很有用。它不是在邀請你把每一種可能性都描述一遍。從一份精簡的製作需求開始,只有在它能解掉某個具體失敗時才加細節。
一份實用的 H3 需求可以照這個順序寫:
- 講出交付格式、長度和比例。
- 給每一份參考素材檔案一個角色。
- 依時間順序描述鏡頭序列。
- 每顆鏡頭只指定一個主體主要動作和一個鏡頭行為。
- 對白、前景音和環境音分開指定。
- 最後寫識別、產品幾何、服裝和場景的保留規則。
OmniArt 上的 MiniMax H3 對 Seedance 2.0
這是能力比較,不是宣布誰贏。兩欄反映的是目前 OmniArt 的模型清單和控制項,H3 的行為則來自服務商文件,仍然需要獨立的輸出測試。這篇文章沒有跑一場受控的 H3 對 Seedance 基準測試。
| 能力 | 今天在 OmniArt 上的 MiniMax H3 | 今天在 OmniArt 上的 Seedance 2.0 |
|---|---|---|
| 長度 | 5–15 秒 | 4–15 秒 |
| 輸出畫質 | 768p 或 2K | Standard:480p、720p、1080p、2160p;Fast 和 Mini:480p、720p |
| 畫面比例 | 文生影片提供 21:9、16:9、4:3、1:1、3:4 和 9:16;只要有畫面輸入,構圖就跟著輸入走 | 同樣六種比例 |
| 以圖為主的流程 | 影片、轉場和參考素材;轉場用首末影格 | 影片、轉場、參考素材、延長和修改;轉場用首末影格 |
| 參考素材上限 | 最多 9 張圖片、3 段影片、3 段音訊;合計 12 份;影片和音訊各自合計 15 秒;音訊需要一份視覺參考素材 | 最多 9 張圖片、3 段影片、3 段音訊;合計 12 份 |
| 音訊 | 沒有獨立的音訊控制項;參考音訊只有在搭配視覺參考素材時才能用 | 支援原生音訊;參考音訊需要一份視覺參考素材 |
| 提示詞額度 | 文件記載最多 7,000 字元;OmniArt 的編寫框吃到 10,000,所以簡潔的提示詞仍然值得測 | OmniArt 的編寫框吃到 10,000 字元,但模型實際有效的行為應該用簡潔的提示詞去測 |
| 在 OmniArt 的可用性 | Creator 級距以上的方案可選用 | Standard、Fast 和 Mini 依方案權限開放 |
這張表透露出來的重疊,比模型名稱聽起來的多。兩條流程都是為參考素材很重的短影片而建、都涵蓋最長 15 秒的片段,混合參考素材組也都封在 12 份檔案。所以有生產力的問題不是「哪一份規格比較大?」,而是「在這份需求裡,哪一個模型守得住最重要的那個性質?」
H3 的 2K 選項落在常見的 1080p 和 2160p 交付設定之間,而 768p 給團隊一條比較便宜的草稿路線。Seedance Standard 在 OmniArt 上有更高的最高設定,但光看輸出尺寸決定不了可用的細節。把兩段片子都正規化到同一個交付解析度之後,再比較質感穩定度、文字排版、臉,還有產品邊緣。
在 OmniArt 上,H3 在 768p 是每輸出秒 8 點數,2K 是每秒 12 點數。參考素材模式會用同一個選定解析度的費率,替參考影片的每一秒(無條件進位)計費;前五張參考圖包含在內,之後每張 4 點數。參考音訊不加點數。送出一次跑之前,先估整包來源素材,不要只估輸出長度。
一套受控的 H3 對 Seedance 測試計畫
PixVerse 的 H3 對 Seedance 比較很正確地把服務商範例當成素材,而不是一場盲測基準。要做一個站得住腳的決定,就自己跑一場條件對齊的測試,並且把每一個輸出都留下來,包括失敗的。
1. 挑一個製作風險
挑一份「一旦失敗成本很明確」的需求。好的候選包括產品幾何、跨剪點的角色識別、手跟道具的互動、末格準確度,或對白的時間點。不要在第一次測試就把五個都塞進去。
2. 鎖住來源素材包
兩條路線都用同一批符合資格的圖片、影片和音訊。如果某條路線吃不下某個輸入,就記下那個缺掉的控制項,不要換一份別的素材上去。替代品會改變這場測試。
3. 鎖住交付條件
長度和畫面比例對齊。用一個實際的草稿設定生成,然後把輸出檔正規化再看。哪條路線有開 Seed 就固定住,並記下介面上顯示的每一個設定。
4. 翻譯提示詞,不是翻譯意圖
主體、動作、鏡頭順序、運鏡指示、聲音和保留規則都維持不變。只改各個產品綁定參考素材所需要的語法。Seedance 提示詞指南示範了怎麼把一份製作需求變成清楚的模型指令,而不流失底下的意圖。
5. 跑不只一次
一條好看的片子量到的是運氣,跟量到可靠度一樣多。每條路線至少生成三次、把不成功的結果留著,然後算出剪輯師真的用得上的比例。如果模型要靠某個沒有記載的繞道方法才成功,就把那份額外的工也記進結果裡。
6. 替整段片子打分
用簡單的 1–5 分檢視五個面向:
- **需求服從度:**每一個要求的節拍都以正確順序出現了嗎?
- **參考素材擬真度:**識別、產品形狀、服裝和場景都還認得出來嗎?
- **動態連貫性:**身體、道具和運鏡在物理上都還讀得懂嗎?
- **音訊有沒有用:**對白、音效、環境音和立體聲定位有支撐這個場景嗎?
- **能不能直接進剪輯:**有幾秒不用修就能進真的時間軸?
盡量用同一批評審,並在打分時把模型名稱蓋掉。最後的選擇要看每次嘗試能拿到多少可用素材,不是看哪一張縮圖最強。
三份值得先測的需求
一支產品功能片
用分開的產品細節照和主視覺照,然後要求一個轉台視角、一次功能示範,還有一格乾淨的結尾。替輪廓、活動零件、標籤和材質連續性打分。這會測出一個模型能不能一邊解釋一件物品、一邊守住它。
一場兩人的直式場景
每位演出者各給一張識別照、一段簡短的表演參考素材,還有一段克制的對白往返。替跨鏡頭的臉部識別、視線、手勢連續性、對嘴和空間聲響打分。用 9:16 去壓一個社群交付常見的格式。
一段圖像式片頭
給關鍵格定義視覺語言,再給一段動態片段定義節奏。要求一小段序列,字卡要讀得清楚、轉場要刻意,還要一條原創的聲音床。要打分的是這套設計系統在動起來之後活不活得下來,而不是只評第一張畫面。
要一直放在檯面上的限制
H3 公布的規格回答不了 OmniArt 的排隊時間、各地區服務商的行為、浮水印規則,或服務商示範的可重複性。目前 OmniArt 的介面確實確立了 Creator 級距的權限、768p 和 2K 輸出,還有上面那些點數規則,但產品控制項和定價都可能改變。在把這個模型當成製作上的依賴之前,先確認當下的編寫框和費用估算。
權利同樣是流程上的責任。臉孔、聲音、影片素材、音樂、品牌資產和商業交付的授權都要確認。模型收得下一份檔案,不代表你有權使用它。
注意
不要拿一支官方 H3 展示片跟一次現跑的 Seedance 生成比,然後說那是受控基準測試。來源素材、藏起來的設定、嘗試次數和編輯挑選都是未知的。展示片是用來設計測試的,不是用來宣布贏家的。
結論
MiniMax H3 記載的功能組是為有指揮性的多模態短影片設計的:5–15 秒、24 FPS、六種文生影片比例、視覺流程下由輸入推導的構圖,還有 12 份檔案的混合參考素材預算。OmniArt 對 Creator 級距以上的方案開放 768p 和 2K 輸出,以及影片、轉場和參考素材三種模式。沒解決的問題是:用你自己的素材跑時的可重複性,以及服務商聲稱的音訊行為在交付檔案裡到底長什麼樣。
打開 OmniArt 上的 MiniMax H3,選一個對得上你來源素材包的模式,把每一次嘗試都存下來。然後用同一份需求跑 OmniArt 上的 Seedance 2.0 Standard,搭配 Seedance 2.0 提示詞與使用情境指南。因為這篇文章沒有跑那場獨立的並排基準測試,請看整組輸出來判斷,而不是只看各個模型最好的那一條。
常見問題
OmniArt 上有 MiniMax H3 嗎?
有。MiniMax H3 在 OmniArt 影片工作台裡對 Creator 級距以上的方案開放選用。打開 OmniArt 上的 MiniMax H3 就能用影片、轉場或參考素材模式。
MiniMax H3 支援多長的影片和多少影格率?
PixVerse 檢視過的文件描述的是 24 FPS 的 5–15 秒片段,而 OmniArt 目前在 768p 或 2K 下開放同樣的長度範圍。
MiniMax H3 可以用多少份參考素材?
參考素材模式支援最多九張圖片、三段影片和三段音訊,合計最多 12 份檔案。參考影片合計可以到 15 秒、參考音訊合計可以到 15 秒,而音訊需要至少一張圖片或一段影片。
MiniMax H3 在 OmniArt 上要多少點數?
H3 在 768p 是每輸出秒 8 點數,2K 是每秒 12 點數。在參考素材模式裡,參考影片用同一個選定的每秒費率;前五張參考圖包含在內,之後每張 4 點數,參考音訊不加點數。
MiniMax H3 會生成音訊嗎?
服務商文件描述的是立體聲,但 OmniArt 沒有開放獨立的 H3 音訊控制項。只有在請求同時包含至少一份視覺參考素材時,參考音訊才能引導這次生成。在把音訊算進製作計畫之前,先檢查交付出來的檔案。
MiniMax H3 比 Seedance 2.0 好嗎?
光看規格沒辦法確立這件事。用同樣的來源素材包、長度、比例、創作需求和檢視標準跑一場條件對齊的測試。比較好幾次嘗試,並替可用素材、參考素材擬真度、動態、音訊和能不能直接進剪輯打分。
準備好開始創作了嗎?
用 AI 生成精彩內容