Tutorial教學與操作指南閱讀時間 17 分鐘

替 agent 安裝 MiniMax H3 的提示詞寫作 skill

安裝 MiniMax H3 的提示詞寫作 skill、挑對影片任務模式,並把創意簡報轉成 base 或 Ref2VA 要求的精確輸出結構,供 agent 使用。

OmniArt 團隊
替 agent 安裝 MiniMax H3 的提示詞寫作 skill

MiniMax H3 的提示詞寫作 skill,給了 AI agent 一套明確的做法,把一份創意需求轉成 H3 可以直接吃的視聽提示詞。你不必要求 agent 自己即興生出一個格式;你安裝一個 skill、辨識生成模式,然後拿到那個模式要求的欄位和參考標籤。

這篇教學談的是怎麼把這個 skill 裝起來、怎麼操作它,而不是把所有 H3 提示詞技巧收集齊全。它跟著 MiniMax 官方 MiniMax-H3 儲存庫裡的檔案走,包含 h3-prompt-writing skill、它的 base 模式指南和完整參考指南。想了解參考素材的角色分工、保留規則和上線用的提示詞,請另外開著現有的 MiniMax H3 提示詞指南

安裝 MiniMax H3 提示詞寫作 skill

在你使用 AI 編碼或創作 agent 的那個專案裡,執行 MiniMax 儲存庫公布的單一 skill 安裝指令:

npx skills add https://github.com/MiniMax-AI/MiniMax-H3 --skill h3-prompt-writing

第一道指令只會安裝 h3-prompt-writing。這個儲存庫目前把那個提示詞寫作 skill 和八個特定風格的影片生成 skill 綁在一起,所以用名稱指定 skill,可以讓這次設定保持乾淨。

裝好的 skill 有兩份參考指南:

  • references/base-en.txt 涵蓋 T2VA、I2VA、FL2VA 和 L2VA。
  • references/ref-en.txt 涵蓋完整參考模式 Ref2VA。

這個分野比片子的題材更重要。agent 應該從這份需求的輸入關係去挑指南,然後保留那份指南的欄位名稱、章節順序、標籤和時間標記法。

要求改寫之前,先決定 H3 的任務模式

只要你知道模式,就明確告訴 agent。如果你不知道,就描述你手上有哪些邊界影格和參考素材,讓它自己歸類這份需求。

模式輸入與關係這個 skill 該產出什麼
T2VA只有文字完全從文字簡報建立的一條完整視聽時間軸
I2VA提供了首格一條從那一格精確出發、往前發展的路徑
FL2VA提供了首格和尾格一條連接兩個邊界影格的連續路徑
L2VA提供了尾格一個合理的開場,逐步收斂到最後那一格
Ref2VA被引用的圖片或影片,可選擇加上音訊角色一份六段式的完整參考分析和鏡頭描述

T2VA、I2VA、FL2VA 和 L2VA 是這個 skill 的 base 模式。它們共用同一套三欄本體。I2VA、FL2VA 和 L2VA 會在那套本體上方多加一行精確的對齊指示;T2VA 則直接從第一個欄位開始。

Ref2VA 不只是同一套範本多掛幾個附件。它有自己一份六段式的契約,用來定義參考素材、歸類它們的角色、分析保留程度,並描述每一份參考素材在什麼時候生效。

不要只因為一份需求寫得很細就選 Ref2VA。要在被引用的內容必須被定義、而且必須貫穿整份輸出被追蹤時,才選它。

記住 base 模式的精確輸出結構

每一種 base 模式的本體,都照這個順序用這三個欄位名稱:

integrated_multimodal_description: [Shot 1] ...

overall_soundscape: ...

non_diegetic_music: ...

integrated_multimodal_description 沿著時間軸承載視覺風格、構圖、主體、環境、動作、運鏡、對白、歌唱,以及同步的畫內聲音。overall_soundscape 總結整支片的環境音、動作音和人的非語言聲音。non_diegetic_music 描述觀眾聽得到、但角色聽不到的音樂;沒有的話就是 N/A

對齊那一行會隨關鍵影格模式改變。官方指南指定了這幾種寫法:

I2VA
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.

FL2VA
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.

L2VA
How the reference pictures align with the target video — <Picture 1> (from [Shot N]) aligns with the S.SS-second mark of the target video.

在改寫完成的版本裡,N 要換成實際的最後一個鏡次編號,S.SS 要換成有效時長,並且剛好保留兩位小數。這一行放最前面,接一個空行,然後才是三欄本體。T2VA 沒有對齊行。

鏡頭的時間標記有自己的慣例:[Shot 1] 不帶時間戳,之後的鏡頭則以嚴格遞增的切點時間開頭,像是 [Shot 2] At 00:03.500, ...。一份 base 模式的輸出,只有在選定的模式、對齊行、最後一個鏡頭和時長彼此吻合時,才算準備好。

記住 Ref2VA 的精確輸出結構

完整參考模式必須照這個順序回傳六個段落:

subject_definitions:
...

summary:
[reference generation] ...

retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - ...

detailed_description:
...

overall_soundscape:
...

non_diegetic_music:
...

每一種標籤各有各的職責:

  • <Subject N> 用來命名可重複使用的可見內容,例如一個人、物件、場景、風格、動作、介面或效果。
  • <Picture N> 用來命名一張當成具體目標影格、關鍵影格、構圖錨點或分鏡參考的圖片。
  • <Video N> 用來命名一支被拿來剪輯、續接,或提供整支片時間結構的來源影片。
  • <Audio N> 用來命名一段獨立的音訊訊號,或一條被複製或引用的、已啟用的同步音軌。

這幾類的編號各自獨立。從一支參考影片裡抽出來的視覺主體,仍然用 <Subject N><Video N> 代表的是那份素材本身或它整支片的關係。同樣地,一個含有聲音的影片檔,不會自動產生一筆 <Audio N>

summary 開頭要放一個或多個官方任務類型,用方括號括起來:keyframe completionreference generationvideo editingvideo continuationaudio reuseaudio reference。適用多個類型時用 + 串起來。

接著 retention_analysis 要給每一個標籤一個明確的關係。可見內容用 fully_preservedpartially_preservedattribute_transferweak_reference。音訊用 fully_copypartially_copyreferenceweak_reference。這個標記要描述你想要的關係,不是拿來當品質評分用的。

最後,Ref2VA 把 base 的 integrated_multimodal_description 欄位換成 detailed_description。做生成任務時,MiniMax 的指南通常要求這裡寫 350–500 個英文字,細節要足以確立每一顆鏡頭的構圖、主體、環境、光線、動作、狀態變化、運鏡、聲音和參考素材的使用方式。對白密集的作品,則優先把完整的口說時間軸塞進去,而不是機械式地湊到那個字數區間。

向 agent 要一份 base 模式提示詞

裝好之後,用名稱呼叫這個 skill,並給它一份精簡的製作簡報。這個 skill 內附的 agent 設定,預設請求裡用的是 $h3-prompt-writing

這是一份可以直接貼上的 FL2VA 請求:

Use $h3-prompt-writing to rewrite this request as a MiniMax H3 FL2VA prompt.

Duration: 8.00 seconds.
Picture 1: the supplied first frame, a closed field notebook on a rain-darkened café table.
Picture 2: the supplied last frame, the same notebook open to a pressed violet flower.
Action: one hand enters, opens the notebook, and stops on the flower page.
Camera: one continuous shot with a slow, small push in.
Sound: quiet café room tone, rain against glass, paper and cover movement.
Dialogue: none.
Non-diegetic music: none.

Preserve the table position, notebook identity, hand continuity, lighting direction, and final composition. Return only the final rewrite in the official base-mode structure.

有用的部分是:模式講明白、時長精確、每一張圖的角色清楚、轉場路徑做得到、聲音的取捨有交代,還有對輸出的限制。agent 應該先回傳 FL2VA 的對齊行,接著用那三個共用欄位,並且把 Picture 2 落在 8.00 秒。

要做 I2VA,就把第二張圖換成從首格發展出來的動作。要做 L2VA,就描述提供的尾格之前預計發生的事件。要做 T2VA,就拿掉圖片的引用,並給 agent 足夠的資訊,讓它從文字建構出開場構圖和整條視聽序列。

向 agent 要一份完整參考提示詞

每一份素材都講清楚角色時,Ref2VA 的請求效果比較好。下面是一份可以直接貼上的 agent 請求,它把識別、動態和音訊的引導分開來寫:

Use $h3-prompt-writing to rewrite this request as a MiniMax H3 full-reference Ref2VA prompt.

Target: a 10-second, three-shot product demonstration.
Picture 1: preserve the reusable bottle identity, silhouette, cap, label placement, and material finish.
Video 1: reference only the demonstrator's hand action and the three-shot cut rhythm; do not reuse its product, set, or wardrobe.
Audio 1: reference the percussion tempo for edit timing without copying the source signal.

Shot flow:
1. Establish the bottle centered on a stone counter.
2. A hand presses the pump once and the lotion lands on the back of the other hand.
3. End on the bottle and a small lotion smear beside it.

No dialogue or visible text beyond the preserved label. Use new room ambience and restrained audience-only percussion. Return only the six official Ref2VA sections in their required order, with consistent labels and explicit retention markers.

這份請求並沒有幫 agent 把 subject_definitions 寫好。它給的是足夠的來源交代和重用意圖,讓這個 skill 自己去建構那些定義、把 summary 歸類成 reference generation 加 audio reference,並且解釋每一個標籤預期的保留或轉移方式。 如果某一份素材只該影響一個屬性,就把它說出來:一支動態片段可以引導手部動作,而不必同時控制演出者、服裝、場景、產品、運鏡或音訊。

用兩道流程的 agent 工作法

把這個 skill 的輸出當成一份有結構的草稿,後面接一道確定性的審查。

  1. 寫出來源清單。 把每一條文字指示、每一張影格、圖片、影片和音訊素材都列出來。說明每一份素材該控制什麼、不該控制什麼。
  2. 鎖定任務模式。 在改寫之前先選好 T2VA、I2VA、FL2VA、L2VA 或 Ref2VA。
  3. 給 agent 交付限制。 包含時長、鏡頭數、邊界影格的時間點、對白、可見文字,以及有沒有音樂。
  4. 只要官方結構。 這樣一來,欄位漏掉、段落順序被調換,以及提示詞之外的多餘評論,都很容易被發現。
  5. 審查時不要動簡報。 先檢查結構、參考素材、時間、口說文字和音訊的擺放位置。
  6. 一次只修一層。 請 agent 修正某一處具體的不吻合,同時保留已經通過的段落。

第二道流程請用一個目標明確的指示:

Review the rewrite against the h3-prompt-writing guide. Keep the creative brief unchanged. Correct only field order, unresolved reference labels, shot timestamps, duration alignment, dialogue preservation, and diegetic versus non-diegetic audio placement. Return the corrected prompt only.

這道審查提示詞降低了一次格式修正悄悄變成創意重寫的機會。

生成之前先審查輸出

每次 agent 改寫完,都用這份清單檢查:

  • 模式: 輸出用的是對應實際輸入關係的那份指南。
  • base 結構: T2VA 從 integrated_multimodal_description 開始;I2VA、FL2VA 和 L2VA 在它上面放對的對齊指示。
  • Ref2VA 結構: 六個欄位各出現一次,順序正確;用的是 detailed_description 而不是 integrated_multimodal_description
  • 標籤: 每一個 <Subject N><Picture N><Video N><Audio N> 在所有段落裡都維持同一個意思。後面不會冒出沒有定義過的標籤。
  • 參考角色: 主體、具體影格、整支片的關係和音訊訊號,各自用對的標籤類型。
  • 保留程度: 每一個被追蹤的參考素材,都有一個和需求一致、而且在允許清單內的關係標記。
  • 鏡頭: [Shot 1] 不帶時間戳。之後的切點時間嚴格遞增,而且都落在要求的時長之內。
  • 邊界影格: I2VA 從首格出發、FL2VA 走到尾格,而 L2VA 收斂到它拿到的那張尾格。
  • 口說與文字: 對白、歌詞和畫面裡看得見的文字,都保留原本的語言和用字。改寫的敘述部分維持英文。
  • 音訊: 對白和同步的畫內事件留在主描述裡;整支片的環境音屬於 overall_soundscape;只有觀眾聽得到的配樂屬於 non_diegetic_music
  • 可行性: 描述的動作塞得進時長,而且最後一刻是收乾淨的,不是被意外切掉。
  • 輸出乾淨度: agent 沒有多寫劇情摘要、沒有加上不存在的素材、沒有互相衝突的角色,也沒有在要求的提示詞之外寫評論。

從 agent 草稿走到 OmniArt

這個 skill 最有價值的地方是當成前置層:它把一份素材清單和創意簡報,轉成一組你可以在生成之前先檢查的提示詞。把通過的輸出和它的來源檔案放在一起保留,因為那些標籤只有在素材順序和意義保持穩定時才有用。

接著把審過的提示詞和對應素材帶進 OmniArt 的影片創作工作台。如果你要改的是創意簡報本身、而不是它的 H3 欄位結構,就回到 MiniMax H3 提示詞指南。分工其實很單純:用那份指南決定你要什麼,用 h3-prompt-writing 把它表達成選定的 H3 契約,再用這份清單在結構錯誤跑進生成之前把它擋下來。

準備好開始創作了嗎?

用 AI 生成精彩內容

免費開始