tutorialบทสอนและคู่มืออ่าน 5 นาที

วิธีติดตั้งทักษะเขียนพรอมต์ MiniMax H3 สำหรับเอเจนต์

ติดตั้งทักษะเขียนพรอมต์ MiniMax H3 เลือกโหมดวิดีโอให้ถูกต้อง แล้วแปลงบรีฟสร้างสรรค์เป็นโครงสร้างโหมดพื้นฐานหรือ Ref2VA ที่แม่นยำสำหรับเอเจนต์

ทีม OmniArt
วิธีติดตั้งทักษะเขียนพรอมต์ MiniMax H3 สำหรับเอเจนต์

ทักษะเขียนพรอมต์ MiniMax H3 ช่วยให้เอเจนต์ AI เปลี่ยนคำขอสร้างสรรค์เป็นพรอมต์ภาพและเสียงที่พร้อมใช้กับ H3 ด้วยวิธีที่กำหนดไว้ แทนที่จะให้เอเจนต์คิดรูปแบบขึ้นเอง คุณติดตั้งทักษะ ระบุโหมดการสร้าง และรับฟิลด์กับป้ายกำกับไฟล์อ้างอิงที่โหมดนั้นต้องใช้

บทเรียนนี้มุ่งที่การตั้งค่าและใช้ทักษะ ไม่ได้รวบรวมเทคนิคเขียนพรอมต์ H3 ทุกแบบ เนื้อหาอ้างอิงไฟล์ในคลัง MiniMax-H3 อย่างเป็นทางการ รวมถึงทักษะ h3-prompt-writing คู่มือโหมดพื้นฐาน และคู่มือไฟล์อ้างอิงเต็มรูปแบบ หากต้องการแนวทางเพิ่มเติมเกี่ยวกับหน้าที่ของไฟล์อ้างอิง กฎการคงรายละเอียด และพรอมต์งานจริง ให้อ่านคู่มือพรอมต์ MiniMax H3แยกต่างหาก

ติดตั้งทักษะเขียนพรอมต์ MiniMax H3

เรียกใช้คำสั่งติดตั้งทักษะเดียวที่เผยแพร่ในคลัง MiniMax จากโปรเจกต์ที่คุณใช้เอเจนต์ AI สำหรับเขียนโค้ดหรือสร้างงาน

npx skills add https://github.com/MiniMax-AI/MiniMax-H3 --skill h3-prompt-writing

คำสั่งนี้ติดตั้งเฉพาะ h3-prompt-writing คลังดังกล่าวยังรวมทักษะสร้างวิดีโอเฉพาะสไตล์อีก 8 ทักษะ การเลือกตามชื่อจึงช่วยให้การตั้งค่าครั้งนี้เน้นเฉพาะการเขียนพรอมต์

ทักษะที่ติดตั้งมีคู่มืออ้างอิง 2 ไฟล์

  • references/base-en.txt ครอบคลุม T2VA I2VA FL2VA และ L2VA
  • references/ref-en.txt ครอบคลุม Ref2VA แบบอ้างอิงเต็มรูปแบบ

การแบ่งนี้สำคัญกว่าหัวข้อของคลิป เอเจนต์ควรเลือกคู่มือตามความสัมพันธ์ของอินพุตในคำขอ จากนั้นคงชื่อฟิลด์ ลำดับส่วน ป้ายกำกับ และรูปแบบเวลาให้ตรงคู่มือ

เลือกโหมดงาน H3 ก่อนขอให้เขียนใหม่

ถ้าทราบโหมดแล้วให้ระบุกับเอเจนต์โดยตรง หากยังไม่ทราบ ให้อธิบายเฟรมขอบเขตและไฟล์อ้างอิงที่มี เพื่อให้เอเจนต์จำแนกคำขอได้

โหมดอินพุตและความสัมพันธ์สิ่งที่ทักษะควรสร้าง
T2VAข้อความเท่านั้นไทม์ไลน์ภาพและเสียงครบถ้วนจากบรีฟ
I2VAมีเฟรมแรกเส้นทางที่เริ่มตรงจากเฟรมนั้นแล้วดำเนินต่อ
FL2VAมีเฟรมแรกและเฟรมสุดท้ายเส้นทางต่อเนื่องที่เชื่อมเฟรมขอบเขตทั้งสอง
L2VAมีเฟรมสุดท้ายจุดเริ่มที่สมเหตุผลและค่อย ๆ เข้าสู่เฟรมสุดท้าย
Ref2VAมีภาพหรือวิดีโออ้างอิง พร้อมเสียงได้ตามต้องการการวิเคราะห์และคำอธิบายอ้างอิงเต็มรูปแบบ 6 ส่วน

T2VA I2VA FL2VA และ L2VA คือ โหมดพื้นฐาน ของทักษะ โดยใช้เนื้อหา 3 ฟิลด์ร่วมกัน I2VA FL2VA และ L2VA เพิ่มคำสั่งจัดแนวที่แน่นอนไว้ด้านบน ส่วน T2VA เริ่มที่ฟิลด์แรกทันที

Ref2VA ไม่ใช่เทมเพลตเดิมที่เพิ่มไฟล์แนบ แต่มีข้อกำหนด 6 ส่วนแยกต่างหากเพื่อกำหนดไฟล์อ้างอิง จัดประเภทหน้าที่ วิเคราะห์การคงรายละเอียด และบอกจังหวะที่แต่ละไฟล์มีผล

อย่าเลือก Ref2VA เพียงเพราะคำขอละเอียด ให้เลือกเมื่อจำเป็นต้องกำหนดและติดตามเนื้อหาอ้างอิงตลอดเอาต์พุต

ทำความเข้าใจโครงสร้างเอาต์พุตโหมดพื้นฐาน

เนื้อหาของทุกโหมดพื้นฐานใช้ชื่อฟิลด์ 3 รายการตามลำดับนี้

integrated_multimodal_description: [Shot 1] ...

overall_soundscape: ...

non_diegetic_music: ...

integrated_multimodal_description ระบุสไตล์ภาพ องค์ประกอบ ตัวแบบ สภาพแวดล้อม การกระทำ กล้อง บทพูด การร้องเพลง และเสียงในฉากที่ซิงก์ตามไทม์ไลน์ overall_soundscape สรุปเสียงแวดล้อม เสียงการกระทำ และเสียงมนุษย์ที่ไม่ใช่คำพูดตลอดคลิป non_diegetic_music อธิบายเพลงที่ผู้ชมได้ยินแต่ตัวละครไม่ได้ยิน หากไม่มีให้ใช้ N/A

บรรทัดจัดแนวเปลี่ยนตามโหมดคีย์เฟรม คู่มืออย่างเป็นทางการกำหนดรูปแบบดังนี้

I2VA
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.

FL2VA
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.

L2VA
How the reference pictures align with the target video — <Picture 1> (from [Shot N]) aligns with the S.SS-second mark of the target video.

ในฉบับเขียนใหม่ที่เสร็จแล้ว N ต้องเป็นหมายเลขช็อตสุดท้ายจริง และ S.SS ต้องเป็นระยะเวลาที่มีทศนิยม 2 ตำแหน่งพอดี บรรทัดนี้อยู่บรรทัดแรก ตามด้วยบรรทัดว่าง 1 บรรทัดแล้วจึงเป็นเนื้อหา 3 ฟิลด์ T2VA ไม่มีบรรทัดจัดแนว

เวลาของช็อตก็มีกติกา [Shot 1] ไม่มีไทม์สแตมป์ ส่วนช็อตถัดไปเริ่มด้วยเวลาตัดที่เพิ่มขึ้นอย่างเคร่งครัดและอยู่ในระยะเวลา เช่น [Shot 2] At 00:03.500, ... โหมด การจัดแนว ช็อตสุดท้าย และระยะเวลาต้องตรงกัน

ทำความเข้าใจโครงสร้างเอาต์พุต Ref2VA

โหมดอ้างอิงเต็มรูปแบบต้องส่งคืน 6 ส่วนตามลำดับนี้

subject_definitions:
...

summary:
[reference generation] ...

retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - ...

detailed_description:
...

overall_soundscape:
...

non_diegetic_music:
...

ป้ายกำกับแต่ละแบบมีหน้าที่ต่างกัน

  • <Subject N> ระบุเนื้อหาที่มองเห็นและนำกลับมาใช้ได้ เช่น คน วัตถุ ฉาก สไตล์ การกระทำ อินเทอร์เฟซ หรือเอฟเฟกต์
  • <Picture N> ระบุภาพที่ใช้เป็นเฟรมเป้าหมาย คีย์เฟรม จุดยึดองค์ประกอบ หรือสตอรีบอร์ดอ้างอิง
  • <Video N> ระบุวิดีโอต้นฉบับที่ใช้แก้ไข ทำต่อ หรือกำหนดโครงสร้างเวลาของวิดีโอทั้งชิ้น
  • <Audio N> ระบุสัญญาณเสียงแยกหรือแทร็กซิงก์ที่เปิดใช้และนำมาคัดลอกหรืออ้างอิง

หมวดหมู่เหล่านี้นับหมายเลขแยกกัน ตัวแบบที่มองเห็นซึ่งดึงจากวิดีโออ้างอิงยังใช้ <Subject N> ส่วน <Video N> แทนไฟล์หรือความสัมพันธ์กับวิดีโอทั้งชิ้น วิดีโอมีเสียงไม่ได้หมายความว่าจะสร้างรายการ <Audio N> โดยอัตโนมัติ

summary เริ่มด้วยประเภทงานอย่างเป็นทางการในวงเล็บเหลี่ยมอย่างน้อย 1 ประเภท ได้แก่ keyframe completion reference generation video editing video continuation audio reuse หรือ audio reference ถ้ามีหลายประเภทให้เชื่อมด้วย +

retention_analysis กำหนดความสัมพันธ์ที่ชัดเจนให้ทุกป้ายกำกับ เนื้อหาภาพใช้ fully_preserved partially_preserved attribute_transfer หรือ weak_reference ส่วนเสียงใช้ fully_copy partially_copy reference หรือ weak_reference เครื่องหมายนี้อธิบายความสัมพันธ์ที่ต้องการ ไม่ใช่คะแนนคุณภาพทั่วไป

สุดท้าย Ref2VA ใช้ detailed_description แทน integrated_multimodal_description สำหรับงานสร้าง คู่มือ MiniMax มักกำหนดคำอธิบายภาษาอังกฤษ 350–500 คำ โดยลงรายละเอียดองค์ประกอบ ตัวแบบ สภาพแวดล้อม แสง การกระทำ การเปลี่ยนสถานะ กล้อง เสียง และการใช้ไฟล์อ้างอิงของแต่ละช็อต งานที่มีบทพูดมากควรให้ความสำคัญกับไทม์ไลน์คำพูดครบถ้วนมากกว่าการนับคำแบบตายตัว

ขอพรอมต์โหมดพื้นฐานจากเอเจนต์

หลังติดตั้ง ให้เรียกทักษะตามชื่อและส่งบรีฟงานที่กระชับ การกำหนดค่าเอเจนต์ที่ให้มาจะใช้ $h3-prompt-writing ในคำขอเริ่มต้น

คัดลอกคำขอ FL2VA นี้ได้ทันที

Use $h3-prompt-writing to rewrite this request as a MiniMax H3 FL2VA prompt.

Duration: 8.00 seconds.
Picture 1: the supplied first frame, a closed field notebook on a rain-darkened café table.
Picture 2: the supplied last frame, the same notebook open to a pressed violet flower.
Action: one hand enters, opens the notebook, and stops on the flower page.
Camera: one continuous shot with a slow, small push in.
Sound: quiet café room tone, rain against glass, paper and cover movement.
Dialogue: none.
Non-diegetic music: none.

Preserve the table position, notebook identity, hand continuity, lighting direction, and final composition. Return only the final rewrite in the official base-mode structure.

ส่วนสำคัญคือโหมดที่ระบุชัด ระยะเวลาที่แน่นอน หน้าที่ของแต่ละภาพ เส้นทางเปลี่ยนผ่านที่ทำได้ การตัดสินใจเรื่องเสียง และข้อจำกัดเอาต์พุต เอเจนต์ควรส่งบรรทัดจัดแนว FL2VA ก่อน ใช้ 3 ฟิลด์ร่วมกัน และไปถึง Picture 2 ที่ 8.00 วินาที

สำหรับ I2VA ให้แทนภาพที่สองด้วยการกระทำที่ดำเนินต่อจากเฟรมแรก สำหรับ L2VA ให้อธิบายเหตุการณ์ก่อนถึงเฟรมสุดท้าย สำหรับ T2VA ให้นำภาพอ้างอิงออกและให้ข้อมูลพอที่เอเจนต์จะสร้างองค์ประกอบเริ่มต้นกับลำดับภาพและเสียงจากข้อความ

ขอพรอมต์อ้างอิงเต็มรูปแบบจากเอเจนต์

คำขอ Ref2VA ทำงานได้ดีขึ้นเมื่อทุกไฟล์มีหน้าที่ชัดเจน คำขอที่คัดลอกได้นี้แยกอัตลักษณ์ การเคลื่อนไหว และแนวทางเสียง

Use $h3-prompt-writing to rewrite this request as a MiniMax H3 full-reference Ref2VA prompt.

Target: a 10-second, three-shot product demonstration.
Picture 1: preserve the reusable bottle identity, silhouette, cap, label placement, and material finish.
Video 1: reference only the demonstrator's hand action and the three-shot cut rhythm; do not reuse its product, set, or wardrobe.
Audio 1: reference the percussion tempo for edit timing without copying the source signal.

Shot flow:
1. Establish the bottle centered on a stone counter.
2. A hand presses the pump once and the lotion lands on the back of the other hand.
3. End on the bottle and a small lotion smear beside it.

No dialogue or visible text beyond the preserved label. Use new room ambience and restrained audience-only percussion. Return only the six official Ref2VA sections in their required order, with consistent labels and explicit retention markers.

คำขอนี้ไม่ได้เขียน subject_definitions แทนเอเจนต์ แต่ให้ที่มาและเจตนาใช้ซ้ำเพียงพอที่ทักษะจะสร้างคำจำกัดความ จัดประเภทสรุปเป็นการสร้างด้วยไฟล์อ้างอิงร่วมกับการอ้างอิงเสียง และอธิบายการคงหรือถ่ายโอนของทุกป้ายกำกับ หากไฟล์หนึ่งควรมีผลต่อคุณสมบัติเดียว ให้ระบุไว้ วิดีโอการเคลื่อนไหวอาจกำกับมือโดยไม่ควบคุมนักแสดง เสื้อผ้า ฉาก สินค้า กล้อง หรือเสียง

ใช้ขั้นตอนเอเจนต์ 2 รอบ

มองเอาต์พุตของทักษะเป็นร่างที่มีโครงสร้างแล้วตรวจซ้ำตามกติกา

  1. เขียนรายการแหล่งที่มา ระบุคำสั่งข้อความ เฟรม ภาพ วิดีโอ และเสียงทั้งหมด พร้อมบอกว่าแต่ละไฟล์ควรและไม่ควรควบคุมอะไร
  2. ล็อกโหมดงาน เลือก T2VA I2VA FL2VA L2VA หรือ Ref2VA ก่อนเขียนใหม่
  3. แจ้งข้อจำกัดการส่งมอบ ระบุระยะเวลา จำนวนช็อต เวลาเฟรมขอบเขต บทพูด ข้อความที่มองเห็น และเพลง
  4. ขอเฉพาะโครงสร้างทางการ เพื่อให้พบฟิลด์ที่หาย ส่วนที่สลับลำดับ และคำอธิบายนอกพรอมต์ได้ง่าย
  5. ตรวจโดยไม่เปลี่ยนบรีฟ ตรวจโครงสร้าง ไฟล์อ้างอิง เวลา ข้อความพูด และตำแหน่งเสียงก่อน
  6. แก้ทีละชั้น ขอให้แก้ข้อไม่ตรงกันจุดเดียวโดยคงส่วนที่ยอมรับแล้ว

รอบที่สองใช้คำสั่งนี้

Review the rewrite against the h3-prompt-writing guide. Keep the creative brief unchanged. Correct only field order, unresolved reference labels, shot timestamps, duration alignment, dialogue preservation, and diegetic versus non-diegetic audio placement. Return the corrected prompt only.

พรอมต์ตรวจนี้ลดโอกาสที่การแก้รูปแบบจะกลายเป็นการเปลี่ยนความคิดสร้างสรรค์โดยไม่ตั้งใจ

ตรวจเอาต์พุตก่อนสร้าง

ใช้รายการนี้หลังเอเจนต์เขียนใหม่ทุกครั้ง

  • โหมด : เอาต์พุตใช้คู่มือที่ตรงกับความสัมพันธ์ของอินพุตจริง
  • โครงสร้างพื้นฐาน : T2VA เริ่มด้วย integrated_multimodal_description ส่วน I2VA FL2VA และ L2VA วางคำสั่งจัดแนวที่ถูกต้องไว้ด้านบน
  • โครงสร้าง Ref2VA : ฟิลด์ทั้ง 6 ปรากฏครั้งเดียวตามลำดับ และใช้ detailed_description แทน integrated_multimodal_description
  • ป้ายกำกับ : <Subject N> <Picture N> <Video N> และ <Audio N> ทุกตัวคงความหมายเดิมทุกส่วน และไม่มีป้ายกำกับที่ยังไม่กำหนด
  • หน้าที่อ้างอิง : ตัวแบบ เฟรมที่เจาะจง ความสัมพันธ์กับวิดีโอทั้งชิ้น และสัญญาณเสียงใช้ประเภทป้ายกำกับถูกต้อง
  • การคงรายละเอียด : ทุกไฟล์อ้างอิงที่ติดตามมีเครื่องหมายความสัมพันธ์ที่อนุญาตและตรงคำขอ
  • ช็อต : [Shot 1] ไม่มีไทม์สแตมป์ เวลาตัดต่อไปเพิ่มขึ้นและอยู่ในระยะเวลาที่ขอ
  • เฟรมขอบเขต : I2VA เริ่มจากเฟรมแรก FL2VA ไปถึงเฟรมสุดท้าย และ L2VA เข้าสู่เฟรมสุดท้ายที่ให้มา
  • คำพูดและข้อความ : บทพูด เนื้อเพลง และข้อความในฉากคงภาษาและคำเดิม ส่วนคำอธิบายที่เขียนใหม่เป็นภาษาอังกฤษ
  • เสียง : บทพูดและเสียงในฉากที่ซิงก์อยู่ในคำอธิบาย เสียงแวดล้อมทั้งคลิปอยู่ใน overall_soundscape และเพลงสำหรับผู้ชมเท่านั้นอยู่ใน non_diegetic_music
  • ความเป็นไปได้ : การกระทำพอดีกับระยะเวลา และช่วงท้ายจบสมบูรณ์โดยไม่ถูกตัดโดยไม่ตั้งใจ
  • ความสะอาด : เอเจนต์ไม่เพิ่มสรุปเนื้อเรื่อง ไฟล์ที่ไม่รองรับ หน้าที่ขัดแย้ง หรือคำอธิบายนอกพรอมต์

ย้ายจากร่างของเอเจนต์ไปยัง OmniArt

ทักษะนี้เหมาะที่สุดในฐานะชั้นเตรียมงาน โดยเปลี่ยนรายการไฟล์และบรีฟเป็นพรอมต์ที่ตรวจได้ก่อนสร้าง เก็บเอาต์พุตที่ยอมรับแล้วไว้กับไฟล์ต้นฉบับ เพราะป้ายกำกับจะมีประโยชน์เมื่ออันดับและความหมายของไฟล์คงที่เท่านั้น

จากนั้นนำพรอมต์ที่ตรวจแล้วพร้อมไฟล์ตรงกันไปยังสตูดิโอสร้างวิดีโอของ OmniArt หากต้องการปรับบรีฟแทนโครงสร้างฟิลด์ H3 ให้กลับไปที่คู่มือพรอมต์ MiniMax H3 ใช้คู่มือเพื่อตัดสินใจสิ่งที่ต้องการ ใช้ h3-prompt-writing เพื่อถ่ายทอดตามข้อกำหนด H3 ที่เลือก และใช้รายการตรวจเพื่อหยุดข้อผิดพลาดเชิงโครงสร้างก่อนสร้าง

พร้อมสร้างหรือยัง?

เริ่มสร้างคอนเทนต์ที่ยอดเยี่ยมด้วย AI

เริ่มฟรี