Cara memasang skill penulisan prompt MiniMax H3
Pasang skill penulisan prompt MiniMax H3, pilih mode video yang tepat, lalu ubah brief kreatif menjadi struktur dasar atau Ref2VA yang akurat untuk agen.

Skill penulisan prompt MiniMax H3 memberi agen AI cara yang terdefinisi untuk mengubah permintaan kreatif menjadi prompt audiovisual yang siap digunakan di H3. Alih-alih membiarkan agen menentukan format sendiri, Anda memasang satu skill, mengenali mode pembuatan, lalu menerima kolom dan label referensi yang diwajibkan mode tersebut.
Tutorial ini membahas cara menyiapkan dan menggunakan skill, bukan mengumpulkan semua teknik prompting H3. Isinya mengikuti berkas di repositori resmi MiniMax-H3, termasuk skill h3-prompt-writing, panduan mode dasar, dan panduan referensi penuh. Untuk pembahasan lebih luas tentang peran referensi, aturan preservasi, dan prompt produksi, buka panduan prompt MiniMax H3 secara terpisah.
Pasang skill penulisan prompt MiniMax H3
Jalankan perintah pemasangan satu skill yang diterbitkan di repositori MiniMax dari proyek tempat Anda memakai agen pemrograman atau kreatif AI:
npx skills add https://github.com/MiniMax-AI/MiniMax-H3 --skill h3-prompt-writing
Perintah ini hanya memasang h3-prompt-writing. Repositori juga memuat delapan skill pembuatan video untuk gaya tertentu, jadi pemilihan berdasarkan nama membuat penyiapan tetap berfokus pada penulisan prompt.
Skill yang terpasang memiliki dua panduan referensi:
references/base-en.txtmencakup T2VA, I2VA, FL2VA, dan L2VA.references/ref-en.txtmencakup Ref2VA referensi penuh.
Pemisahan ini lebih penting daripada tema klip. Agen harus memilih panduan berdasarkan hubungan input dalam permintaan, lalu mempertahankan nama kolom, urutan bagian, label, dan notasi waktu panduan tersebut.
Pilih mode tugas H3 sebelum meminta penulisan ulang
Sebutkan mode secara eksplisit jika Anda sudah mengetahuinya. Jika belum, jelaskan frame batas dan materi referensi yang tersedia agar agen dapat mengklasifikasikan permintaan.
| Mode | Input dan hubungan | Hasil yang harus dibuat skill |
|---|---|---|
| T2VA | Teks saja | Linimasa audiovisual lengkap dari brief |
| I2VA | Frame pertama disediakan | Jalur yang dimulai tepat dari frame itu dan berlanjut |
| FL2VA | Frame pertama dan terakhir disediakan | Jalur berkelanjutan di antara kedua frame batas |
| L2VA | Frame terakhir disediakan | Awal yang masuk akal dan menyatu ke frame akhir |
| Ref2VA | Gambar atau video referensi, dengan audio opsional | Analisis dan deskripsi referensi penuh dalam enam bagian |
T2VA, I2VA, FL2VA, dan L2VA adalah mode dasar skill. Semuanya memakai isi tiga kolom yang sama. I2VA, FL2VA, dan L2VA menambahkan instruksi penyelarasan yang presisi di atasnya; T2VA langsung dimulai dari kolom pertama.
Ref2VA bukan template yang sama dengan lebih banyak lampiran. Mode ini memiliki kontrak enam bagian tersendiri untuk mendefinisikan referensi, mengklasifikasikan perannya, menganalisis retensi, dan menjelaskan kapan setiap referensi berlaku.
Jangan memilih Ref2VA hanya karena permintaannya terperinci. Pilih mode ini saat konten referensi perlu didefinisikan dan dilacak di seluruh output.
Pahami struktur output mode dasar yang tepat
Untuk semua mode dasar, isi memakai tiga nama kolom ini dalam urutan berikut:
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...
integrated_multimodal_description memuat gaya visual, komposisi, subjek, lingkungan, aksi, kamera, dialog, nyanyian, dan suara diegetik tersinkron di sepanjang linimasa. overall_soundscape merangkum suasana, suara aksi, dan suara manusia nonverbal di seluruh klip. non_diegetic_music menjelaskan musik yang terdengar oleh penonton, tetapi tidak oleh tokoh; gunakan N/A jika tidak ada.
Baris penyelarasan berubah sesuai mode keyframe. Panduan resmi menetapkan bentuk berikut:
I2VA
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
FL2VA
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.
L2VA
How the reference pictures align with the target video — <Picture 1> (from [Shot N]) aligns with the S.SS-second mark of the target video.
Dalam hasil akhir, N menjadi nomor shot terakhir yang sebenarnya dan S.SS menjadi durasi efektif dengan tepat dua angka desimal. Baris ini ditulis pertama, disusul satu baris kosong dan isi tiga kolom. T2VA tidak memiliki baris penyelarasan.
Waktu shot juga mengikuti aturan: [Shot 1] tidak memiliki stempel waktu, sedangkan shot berikutnya dimulai dengan waktu potong yang terus meningkat di dalam durasi, seperti [Shot 2] At 00:03.500, .... Mode, penyelarasan, shot terakhir, dan durasi harus cocok.
Pahami struktur output Ref2VA yang tepat
Mode referensi penuh harus mengembalikan enam bagian dalam urutan berikut:
subject_definitions:
...
summary:
[reference generation] ...
retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - ...
detailed_description:
...
overall_soundscape:
...
non_diegetic_music:
...
Setiap label memiliki fungsi berbeda:
<Subject N>menamai konten visual yang dapat digunakan kembali, seperti orang, objek, adegan, gaya, aksi, antarmuka, atau efek.<Picture N>menamai gambar yang digunakan sebagai frame target, keyframe, jangkar komposisi, atau referensi storyboard.<Video N>menamai video sumber untuk penyuntingan, kelanjutan, atau struktur waktu keseluruhan video.<Audio N>menamai sinyal audio mandiri atau trek tersinkron yang diaktifkan untuk disalin atau dijadikan referensi.
Setiap kategori diberi nomor secara terpisah. Subjek visual yang diambil dari video referensi tetap memakai <Subject N>; <Video N> mewakili berkas atau hubungannya dengan keseluruhan video. Keberadaan suara dalam video juga tidak otomatis membuat entri <Audio N>.
summary dimulai dengan satu atau beberapa jenis tugas resmi dalam kurung siku: keyframe completion, reference generation, video editing, video continuation, audio reuse, atau audio reference. Beberapa jenis yang berlaku dihubungkan dengan +.
retention_analysis memberi hubungan eksplisit untuk setiap label. Konten visual menggunakan fully_preserved, partially_preserved, attribute_transfer, atau weak_reference; audio menggunakan fully_copy, partially_copy, reference, atau weak_reference. Penanda ini menjelaskan hubungan yang dimaksud, bukan skor kualitas umum.
Terakhir, Ref2VA mengganti integrated_multimodal_description dengan detailed_description. Untuk tugas pembuatan, panduan MiniMax biasanya meminta 350–500 kata bahasa Inggris yang merinci komposisi, subjek, lingkungan, pencahayaan, aksi, perubahan keadaan, kamera, suara, dan penggunaan referensi setiap shot. Konten dengan banyak dialog memprioritaskan linimasa ujaran lengkap, bukan sekadar memenuhi jumlah kata.
Minta prompt mode dasar dari agen
Setelah pemasangan, panggil skill berdasarkan nama dan berikan brief produksi yang ringkas. Konfigurasi agen bawaannya menggunakan $h3-prompt-writing dalam permintaan default.
Permintaan FL2VA ini dapat langsung disalin:
Use $h3-prompt-writing to rewrite this request as a MiniMax H3 FL2VA prompt.
Duration: 8.00 seconds.
Picture 1: the supplied first frame, a closed field notebook on a rain-darkened café table.
Picture 2: the supplied last frame, the same notebook open to a pressed violet flower.
Action: one hand enters, opens the notebook, and stops on the flower page.
Camera: one continuous shot with a slow, small push in.
Sound: quiet café room tone, rain against glass, paper and cover movement.
Dialogue: none.
Non-diegetic music: none.
Preserve the table position, notebook identity, hand continuity, lighting direction, and final composition. Return only the final rewrite in the official base-mode structure.
Bagian pentingnya adalah mode yang eksplisit, durasi tepat, peran jelas setiap gambar, transisi yang dapat dilakukan, keputusan suara, dan batas output. Agen harus mengembalikan baris FL2VA terlebih dahulu, memakai tiga kolom, dan mencapai Picture 2 pada 8.00 detik.
Untuk I2VA, ganti gambar kedua dengan aksi yang berkembang dari frame pertama. Untuk L2VA, jelaskan kejadian sebelum frame akhir yang diberikan. Untuk T2VA, hapus referensi gambar dan berikan informasi yang cukup untuk membangun komposisi pembuka serta urutan audiovisual.
Minta prompt referensi penuh dari agen
Permintaan Ref2VA bekerja lebih baik saat setiap materi memiliki peran yang disebutkan. Permintaan ini memisahkan identitas, gerakan, dan panduan audio:
Use $h3-prompt-writing to rewrite this request as a MiniMax H3 full-reference Ref2VA prompt.
Target: a 10-second, three-shot product demonstration.
Picture 1: preserve the reusable bottle identity, silhouette, cap, label placement, and material finish.
Video 1: reference only the demonstrator's hand action and the three-shot cut rhythm; do not reuse its product, set, or wardrobe.
Audio 1: reference the percussion tempo for edit timing without copying the source signal.
Shot flow:
1. Establish the bottle centered on a stone counter.
2. A hand presses the pump once and the lotion lands on the back of the other hand.
3. End on the bottle and a small lotion smear beside it.
No dialogue or visible text beyond the preserved label. Use new room ambience and restrained audience-only percussion. Return only the six official Ref2VA sections in their required order, with consistent labels and explicit retention markers.
Permintaan ini tidak mencoba menulis subject_definitions untuk agen. Isinya memberikan asal dan maksud penggunaan ulang yang cukup agar skill menyusun definisi, mengklasifikasikan ringkasan sebagai pembuatan referensi ditambah referensi audio, serta menjelaskan preservasi atau transfer setiap label.
Jika suatu materi hanya boleh memengaruhi satu properti, nyatakan dengan jelas: video gerakan dapat mengarahkan tangan tanpa mengendalikan pemeran, pakaian, set, produk, kamera, atau audio.
Gunakan alur kerja agen dua tahap
Perlakukan output skill sebagai draf terstruktur yang diikuti pemeriksaan deterministik.
- Tulis inventaris sumber. Daftar semua instruksi, frame, gambar, video, dan audio, lalu sebutkan apa yang harus dan tidak boleh dikendalikan setiap materi.
- Kunci mode tugas. Pilih T2VA, I2VA, FL2VA, L2VA, atau Ref2VA sebelum menulis ulang.
- Berikan batas pengiriman. Sertakan durasi, jumlah shot, waktu frame batas, dialog, teks terlihat, dan keberadaan musik.
- Minta hanya struktur resmi. Kolom hilang, bagian salah urut, dan komentar tambahan menjadi mudah ditemukan.
- Tinjau tanpa mengubah brief. Periksa struktur, referensi, waktu, teks ujaran, dan penempatan audio terlebih dahulu.
- Revisi satu lapisan setiap kali. Minta satu ketidaksesuaian diperbaiki sambil mempertahankan bagian yang disetujui.
Untuk tahap kedua, gunakan instruksi ini:
Review the rewrite against the h3-prompt-writing guide. Keep the creative brief unchanged. Correct only field order, unresolved reference labels, shot timestamps, duration alignment, dialogue preservation, and diegetic versus non-diegetic audio placement. Return the corrected prompt only.
Prompt peninjauan ini mengurangi kemungkinan koreksi format diam-diam berubah menjadi penulisan ulang kreatif.
Tinjau output sebelum pembuatan
Gunakan daftar ini setelah setiap penulisan ulang:
- Mode: output memakai panduan sesuai hubungan input yang sebenarnya.
- Struktur dasar: T2VA dimulai dengan
integrated_multimodal_description; I2VA, FL2VA, dan L2VA menaruh instruksi yang benar di atasnya. - Struktur Ref2VA: keenam kolom muncul sekali dalam urutan yang benar;
detailed_descriptiondigunakan, bukanintegrated_multimodal_description. - Label: setiap
<Subject N>,<Picture N>,<Video N>, dan<Audio N>mempertahankan satu makna tanpa label yang belum didefinisikan kemudian. - Peran referensi: subjek, frame konkret, hubungan keseluruhan video, dan sinyal audio memakai jenis yang benar.
- Retensi: setiap referensi yang dilacak memiliki penanda yang diizinkan dan sesuai permintaan.
- Shot:
[Shot 1]tidak memiliki stempel waktu; waktu potong berikutnya meningkat dan berada dalam durasi. - Frame batas: I2VA dimulai dari frame pertama, FL2VA mencapai frame terakhir, dan L2VA menyatu ke frame akhir yang disediakan.
- Ujaran dan teks: dialog, lirik, dan teks terlihat mempertahankan bahasa serta kata asli; deskripsi penulisan ulang tetap berbahasa Inggris.
- Audio: ujaran dan suara diegetik tersinkron tetap dalam deskripsi; suasana seluruh klip ada di
overall_soundscape; musik khusus penonton ada dinon_diegetic_music. - Kelayakan: aksi muat dalam durasi dan momen akhir selesai tanpa terpotong tanpa sengaja.
- Kebersihan output: agen tidak menambah ringkasan alur, materi yang tidak didukung, peran bertentangan, atau komentar tambahan.
Pindahkan draf agen ke OmniArt
Skill ini paling berguna sebagai lapisan persiapan: inventaris dan brief diubah menjadi prompt yang dapat diperiksa sebelum pembuatan. Simpan output yang diterima bersama berkas sumber karena label hanya berguna jika urutan dan makna materi tetap stabil.
Kemudian bawa prompt yang sudah ditinjau dan materi terkait ke studio pembuatan video OmniArt. Jika Anda perlu memperbaiki brief, bukan struktur kolom H3, kembali ke panduan prompt MiniMax H3. Gunakan panduan untuk menentukan tujuan, h3-prompt-writing untuk menyatakannya dalam kontrak H3 yang dipilih, dan daftar pemeriksaan untuk menghentikan kesalahan struktur sebelum pembuatan.
Siap membuat?
Mulai membuat konten menakjubkan dengan AI