tutorialÖğreticiler ve nasıl yapılır rehberleri9 dk okuma

MiniMax H3 prompt yazma becerisini agentlara kurun

MiniMax H3 prompt yazma becerisini kurun, doğru video modunu seçin ve yaratıcı brifleri agentlar için kesin Base ya da Ref2VA yapılarına güvenle dönüştürün.

OmniArt Ekibi
MiniMax H3 prompt yazma becerisini agentlara kurun

MiniMax H3 prompt yazma becerisi, bir AI agentının yaratıcı bir talebi H3 için hazır görsel-işitsel bir prompta dönüştürmesini belirli bir yönteme bağlar. Agentın biçimi doğaçlama belirlemesi yerine bir beceri kurar, üretim modunu saptar ve o modun beklediği alanlarla referans etiketlerini alırsınız.

Bu eğitim, H3 prompt tekniklerinin tamamını derlemek yerine beceriyi kurup kullanmayı açıklar. İçerik, h3-prompt-writing becerisi, Base modları kılavuzu ve tam referans kılavuzu dahil olmak üzere resmi MiniMax-H3 deposundaki dosyaları izler. Referans rolleri, koruma kuralları ve prodüksiyon promptları hakkında daha geniş bilgi için MiniMax H3 prompt kılavuzunu ayrıca açın.

MiniMax H3 prompt yazma becerisini kurun

AI kodlama ya da yaratıcı agentınızı kullandığınız projede MiniMax deposunun yayımladığı tek beceri kurulum komutunu çalıştırın:

npx skills add https://github.com/MiniMax-AI/MiniMax-H3 --skill h3-prompt-writing

Bu komut yalnızca h3-prompt-writing becerisini kurar. Depoda belirli stillere yönelik sekiz video üretim becerisi daha bulunur; ada göre seçim yaptığınızda bu kurulum prompt yazmaya odaklanır.

Kurulan beceri iki referans kılavuzu içerir:

  • references/base-en.txt, T2VA, I2VA, FL2VA ve L2VA modlarını kapsar.
  • references/ref-en.txt, tam referanslı Ref2VA modunu kapsar.

Bu ayrım, klibin konusundan daha önemlidir. Agent, talepteki girdilerin ilişkisine göre kılavuzu seçmeli, ardından alan adlarını, bölüm sırasını, etiketleri ve zaman gösterimini korumalıdır.

Yeniden yazmadan önce H3 görev modunu seçin

Modu biliyorsanız agenta açıkça bildirin. Bilmiyorsanız mevcut sınır kareleriyle referans dosyalarını açıklayın ve talebi sınıflandırmasını sağlayın.

ModGirdiler ve ilişkiBecerinin oluşturması gereken çıktı
T2VAYalnızca metinBriften oluşturulan eksiksiz görsel-işitsel zaman akışı
I2VAİlk kare verilirTam o kareden başlayıp ilerleyen bir yol
FL2VAİlk ve son kare verilirİki sınır karesini bağlayan kesintisiz bir yol
L2VASon kare verilirMakul bir başlangıçtan son kareye yaklaşan bir yol
Ref2VAReferans görselleri ya da videoları, isteğe bağlı sesAltı bölümlü tam referans analizi ve çekim açıklaması

T2VA, I2VA, FL2VA ve L2VA, becerinin Base modlarıdır. Bu modlar üç alanlı bir gövdeyi paylaşır. I2VA, FL2VA ve L2VA bu gövdenin üstüne kesin bir hizalama talimatı ekler; T2VA ise doğrudan ilk alanla başlar.

Ref2VA, daha fazla ek içeren aynı şablon değildir. Referansları tanımlamak, rollerini sınıflandırmak, korunma düzeyini incelemek ve her referansın ne zaman etkili olduğunu açıklamak için ayrı bir altı bölümlü sözleşme kullanır.

Bir talep ayrıntılı olduğu için Ref2VA modunu seçmeyin. Referans içeriğinin çıktıda tanımlanıp izlenmesi gerektiğinde bu modu seçin.

Base modlarının kesin çıktı yapısını öğrenin

Her Base modunun gövdesi şu üç alan adını bu sırayla kullanır:

integrated_multimodal_description: [Shot 1] ...

overall_soundscape: ...

non_diegetic_music: ...

integrated_multimodal_description, zaman akışı boyunca görsel stili, kompozisyonu, özneleri, ortamı, eylemleri, kamerayı, diyaloğu, şarkıyı ve eşzamanlı diegetik sesi taşır. overall_soundscape, klibin tamamındaki ortam seslerini, fiziksel sesleri ve sözsüz insan seslerini özetler. non_diegetic_music, karakterlerin değil yalnızca izleyicinin duyduğu müziği açıklar; böyle bir müzik yoksa N/A yazılır.

Hizalama satırı keyframe moduna göre değişir. Resmi kılavuz şu biçimleri belirler:

I2VA
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.

FL2VA
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.

L2VA
How the reference pictures align with the target video — <Picture 1> (from [Shot N]) aligns with the S.SS-second mark of the target video.

Tamamlanan yeniden yazımda N gerçek son çekim numarasına, S.SS ise tam iki ondalık basamaklı etkili süreye dönüşür. Bu satır önce gelir, ardından bir boş satır ve üç alanlı gövde yazılır. T2VA modunda hizalama satırı bulunmaz.

Çekim zamanlaması da bir kurala uyar: [Shot 1] zaman damgası taşımaz, sonraki çekimler ise süre içinde kesin biçimde artan bir kesme zamanıyla başlar; örneğin [Shot 2] At 00:03.500, ... kullanılır. Mod, hizalama, son çekim ve süre birbiriyle uyuşmalıdır.

Ref2VA modunun kesin çıktı yapısını öğrenin

Tam referans modu altı bölümü şu sırayla döndürmelidir:

subject_definitions:
...

summary:
[reference generation] ...

retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - ...

detailed_description:
...

overall_soundscape:
...

non_diegetic_music:
...

Her etiket farklı bir görev üstlenir:

  • <Subject N>, kişi, nesne, sahne, stil, eylem, arayüz ya da efekt gibi yeniden kullanılabilen görünür içeriği adlandırır.
  • <Picture N>, somut hedef kare, keyframe, kompozisyon çapası ya da storyboard referansı olarak kullanılan görseli adlandırır.
  • <Video N>, düzenleme, devam üretimi ya da videonun genel zaman yapısı için kullanılan kaynak videoyu adlandırır.
  • <Audio N>, kopyalanan ya da referans alınan bağımsız ses sinyalini veya etkinleştirilmiş eşzamanlı ses parçasını adlandırır.

Kategoriler birbirinden bağımsız numaralanır. Referans videosundan alınan görünür bir özne yine <Subject N> kullanır; <Video N> dosyayı veya bütün videoyla ilişkisini temsil eder. Bir video dosyasının ses içermesi de otomatik olarak <Audio N> kaydı oluşturmaz.

summary, köşeli parantez içindeki bir veya birkaç resmi görev türüyle başlar: keyframe completion, reference generation, video editing, video continuation, audio reuse ya da audio reference kullanılır. Birden fazla tür + ile birleştirilir.

retention_analysis, her etikete açık bir ilişki atar. Görünür içerik fully_preserved, partially_preserved, attribute_transfer ya da weak_reference kullanır; ses ise fully_copy, partially_copy, reference ya da weak_reference kullanır. İşaret, genel kalite puanı değil amaçlanan ilişkiyi açıklar.

Son olarak Ref2VA, integrated_multimodal_description yerine detailed_description kullanır. MiniMax kılavuzu üretim görevleri için genellikle her çekimin kompozisyonunu, öznelerini, ortamını, ışığını, eylemlerini, durum değişimlerini, kamera hareketini, sesini ve referans kullanımını ayrıntılandıran 350–500 İngilizce kelime ister. Diyalog yoğun işlerde mekanik kelime sayısından önce konuşma zaman akışının tamamı korunur.

Agenttan Base modu promptu isteyin

Kurulumdan sonra beceriyi adıyla çağırın ve kısa bir prodüksiyon brifi verin. Birlikte gelen agent yapılandırması varsayılan talepte $h3-prompt-writing kullanır.

Şu FL2VA talebini doğrudan kopyalayabilirsiniz:

Use $h3-prompt-writing to rewrite this request as a MiniMax H3 FL2VA prompt.

Duration: 8.00 seconds.
Picture 1: the supplied first frame, a closed field notebook on a rain-darkened café table.
Picture 2: the supplied last frame, the same notebook open to a pressed violet flower.
Action: one hand enters, opens the notebook, and stops on the flower page.
Camera: one continuous shot with a slow, small push in.
Sound: quiet café room tone, rain against glass, paper and cover movement.
Dialogue: none.
Non-diegetic music: none.

Preserve the table position, notebook identity, hand continuity, lighting direction, and final composition. Return only the final rewrite in the official base-mode structure.

Açık mod, kesin süre, her görselin net rolü, uygulanabilir geçiş yolu, ses tercihleri ve çıktı kısıtı yararlı bilgileri oluşturur. Agent önce FL2VA hizalama satırını döndürmeli, üç ortak alanı kullanmalı ve 8.00 saniyede Picture 2 karesine ulaşmalıdır.

I2VA için ikinci görselin yerine ilk kareden gelişen eylemleri yazın. L2VA için verilen son kareden önceki olayı açıklayın. T2VA için görsel referanslarını kaldırın ve agentın açılış kompozisyonuyla görsel-işitsel diziyi metinden kurmasına yetecek bilgiyi verin.

Agenttan tam referans promptu isteyin

Her dosyanın belirtilmiş bir rolü olduğunda Ref2VA talepleri daha iyi çalışır. Kopyalanabilir bu talep kimlik, hareket ve ses yönlendirmesini ayırır:

Use $h3-prompt-writing to rewrite this request as a MiniMax H3 full-reference Ref2VA prompt.

Target: a 10-second, three-shot product demonstration.
Picture 1: preserve the reusable bottle identity, silhouette, cap, label placement, and material finish.
Video 1: reference only the demonstrator's hand action and the three-shot cut rhythm; do not reuse its product, set, or wardrobe.
Audio 1: reference the percussion tempo for edit timing without copying the source signal.

Shot flow:
1. Establish the bottle centered on a stone counter.
2. A hand presses the pump once and the lotion lands on the back of the other hand.
3. End on the bottle and a small lotion smear beside it.

No dialogue or visible text beyond the preserved label. Use new room ambience and restrained audience-only percussion. Return only the six official Ref2VA sections in their required order, with consistent labels and explicit retention markers.

Bu talep, agent yerine subject_definitions yazmaya çalışmaz. Beceri tanımları kuracak, özeti referans üretimi ve ses referansı olarak sınıflandıracak, ardından her etiketin korunmasını ya da aktarımını açıklayacak kadar kaynak ve yeniden kullanım amacı verir. Bir dosya yalnızca tek özelliği etkileyecekse bunu belirtin: Hareket videosu oyuncuyu, kıyafeti, seti, ürünü, kamerayı ya da sesi yönetmeden el hareketine yol gösterebilir.

İki aşamalı agent iş akışı kullanın

Beceri çıktısını yapılandırılmış bir taslak olarak ele alın ve ardından belirli bir inceleme uygulayın.

  1. Kaynak envanterini yazın. Tüm metin talimatlarını, kareleri, görselleri, videoları ve sesleri listeleyin; her dosyanın neyi yönetip yönetmemesi gerektiğini belirtin.
  2. Görev modunu kilitleyin. Yeniden yazmadan önce T2VA, I2VA, FL2VA, L2VA ya da Ref2VA modunu seçin.
  3. Teslim kısıtlarını verin. Süreyi, çekim sayısını, sınır kare zamanlarını, diyaloğu, görünür metni ve müziği ekleyin.
  4. Yalnızca resmi yapıyı isteyin. Eksik alanları, yanlış bölüm sırasını ve prompt dışı yorumları böylece kolayca görürsünüz.
  5. Brifi değiştirmeden inceleyin. Önce yapıyı, referansları, zamanlamayı, konuşma metnini ve ses yerleşimini denetleyin.
  6. Her seferinde bir katmanı düzeltin. Kabul edilen bölümleri koruyarak belirli bir uyuşmazlığı düzeltmesini isteyin.

İkinci aşamada şu talimatı kullanın:

Review the rewrite against the h3-prompt-writing guide. Keep the creative brief unchanged. Correct only field order, unresolved reference labels, shot timestamps, duration alignment, dialogue preservation, and diegetic versus non-diegetic audio placement. Return the corrected prompt only.

Bu inceleme promptu, bir biçim düzeltmesinin sessizce yaratıcı bir yeniden yazıma dönüşme olasılığını azaltır.

Üretimden önce çıktıyı inceleyin

Agentın her yeniden yazımından sonra şu listeyi kullanın:

  • Mod: Çıktı gerçek girdi ilişkisine uygun kılavuzu kullanır.
  • Base yapısı: T2VA integrated_multimodal_description ile başlar; I2VA, FL2VA ve L2VA doğru talimatı üstüne yerleştirir.
  • Ref2VA yapısı: Altı alan birer kez ve doğru sırada görünür; integrated_multimodal_description yerine detailed_description kullanılır.
  • Etiketler: Her <Subject N>, <Picture N>, <Video N> ve <Audio N> bütün bölümlerde aynı anlamı korur; sonradan tanımsız etiket çıkmaz.
  • Referans rolleri: Özneler, somut kareler, bütün video ilişkileri ve ses sinyalleri doğru etiket türünü kullanır.
  • Koruma: İzlenen her referansın taleple uyumlu, izin verilen bir ilişki işareti bulunur.
  • Çekimler: [Shot 1] zaman damgası taşımaz; sonraki kesme zamanları artar ve süre içinde kalır.
  • Sınır kareleri: I2VA ilk kareden başlar, FL2VA son kareye ulaşır ve L2VA verilen son kareye yaklaşır.
  • Konuşma ve metin: Diyaloglar, şarkı sözleri ve görünür metin özgün diliyle sözcüklerini korur; yeniden yazım açıklaması İngilizce kalır.
  • Ses: Diyalog ve eşzamanlı diegetik ses ana açıklamada, genel ortam overall_soundscape alanında, yalnızca izleyiciye yönelik müzik non_diegetic_music alanında kalır.
  • Uygulanabilirlik: Eylemler süreye sığar ve son an istemeden kesilmek yerine tamamlanır.
  • Çıktı temizliği: Agent olay özeti, desteklenmeyen dosya, çelişkili rol ya da prompt dışı yorum eklemez.

Agent taslağından OmniArt'a geçin

Beceri en çok bir hazırlık katmanı olarak işe yarar: Envanterle brifi, üretimden önce inceleyebileceğiniz bir prompta dönüştürür. Etiketler yalnızca dosya sırası ve anlamı sabit kaldığında yararlı olduğu için kabul edilen çıktıyı kaynak dosyalarla birlikte saklayın.

Ardından incelenen promptu ve ilgili dosyaları OmniArt video oluşturma stüdyosuna taşıyın. H3 alan yapısı yerine yaratıcı brifi geliştirmek istiyorsanız MiniMax H3 prompt kılavuzuna dönün. Kılavuzla hedefinizi belirleyin, h3-prompt-writing ile seçilen H3 sözleşmesinde ifade edin ve kontrol listesiyle üretimden önce yapı hatalarını durdurun.

Üretmeye hazır mısınız?

AI ile harika içerikler üretmeye başlayın

Ücretsiz başla