วิธีติดตั้งทักษะเขียนพรอมต์ MiniMax H3 สำหรับเอเจนต์
ติดตั้งทักษะเขียนพรอมต์ MiniMax H3 เลือกโหมดวิดีโอให้ถูกต้อง แล้วแปลงบรีฟสร้างสรรค์เป็นโครงสร้างโหมดพื้นฐานหรือ Ref2VA ที่แม่นยำสำหรับเอเจนต์

ทักษะเขียนพรอมต์ MiniMax H3 ช่วยให้เอเจนต์ AI เปลี่ยนคำขอสร้างสรรค์เป็นพรอมต์ภาพและเสียงที่พร้อมใช้กับ H3 ด้วยวิธีที่กำหนดไว้ แทนที่จะให้เอเจนต์คิดรูปแบบขึ้นเอง คุณติดตั้งทักษะ ระบุโหมดการสร้าง และรับฟิลด์กับป้ายกำกับไฟล์อ้างอิงที่โหมดนั้นต้องใช้
บทเรียนนี้มุ่งที่การตั้งค่าและใช้ทักษะ ไม่ได้รวบรวมเทคนิคเขียนพรอมต์ H3 ทุกแบบ เนื้อหาอ้างอิงไฟล์ในคลัง MiniMax-H3 อย่างเป็นทางการ รวมถึงทักษะ h3-prompt-writing คู่มือโหมดพื้นฐาน และคู่มือไฟล์อ้างอิงเต็มรูปแบบ หากต้องการแนวทางเพิ่มเติมเกี่ยวกับหน้าที่ของไฟล์อ้างอิง กฎการคงรายละเอียด และพรอมต์งานจริง ให้อ่านคู่มือพรอมต์ MiniMax H3แยกต่างหาก
ติดตั้งทักษะเขียนพรอมต์ MiniMax H3
เรียกใช้คำสั่งติดตั้งทักษะเดียวที่เผยแพร่ในคลัง MiniMax จากโปรเจกต์ที่คุณใช้เอเจนต์ AI สำหรับเขียนโค้ดหรือสร้างงาน
npx skills add https://github.com/MiniMax-AI/MiniMax-H3 --skill h3-prompt-writing
คำสั่งนี้ติดตั้งเฉพาะ h3-prompt-writing คลังดังกล่าวยังรวมทักษะสร้างวิดีโอเฉพาะสไตล์อีก 8 ทักษะ การเลือกตามชื่อจึงช่วยให้การตั้งค่าครั้งนี้เน้นเฉพาะการเขียนพรอมต์
ทักษะที่ติดตั้งมีคู่มืออ้างอิง 2 ไฟล์
references/base-en.txtครอบคลุม T2VA I2VA FL2VA และ L2VAreferences/ref-en.txtครอบคลุม Ref2VA แบบอ้างอิงเต็มรูปแบบ
การแบ่งนี้สำคัญกว่าหัวข้อของคลิป เอเจนต์ควรเลือกคู่มือตามความสัมพันธ์ของอินพุตในคำขอ จากนั้นคงชื่อฟิลด์ ลำดับส่วน ป้ายกำกับ และรูปแบบเวลาให้ตรงคู่มือ
เลือกโหมดงาน H3 ก่อนขอให้เขียนใหม่
ถ้าทราบโหมดแล้วให้ระบุกับเอเจนต์โดยตรง หากยังไม่ทราบ ให้อธิบายเฟรมขอบเขตและไฟล์อ้างอิงที่มี เพื่อให้เอเจนต์จำแนกคำขอได้
| โหมด | อินพุตและความสัมพันธ์ | สิ่งที่ทักษะควรสร้าง |
|---|---|---|
| T2VA | ข้อความเท่านั้น | ไทม์ไลน์ภาพและเสียงครบถ้วนจากบรีฟ |
| I2VA | มีเฟรมแรก | เส้นทางที่เริ่มตรงจากเฟรมนั้นแล้วดำเนินต่อ |
| FL2VA | มีเฟรมแรกและเฟรมสุดท้าย | เส้นทางต่อเนื่องที่เชื่อมเฟรมขอบเขตทั้งสอง |
| L2VA | มีเฟรมสุดท้าย | จุดเริ่มที่สมเหตุผลและค่อย ๆ เข้าสู่เฟรมสุดท้าย |
| Ref2VA | มีภาพหรือวิดีโออ้างอิง พร้อมเสียงได้ตามต้องการ | การวิเคราะห์และคำอธิบายอ้างอิงเต็มรูปแบบ 6 ส่วน |
T2VA I2VA FL2VA และ L2VA คือ โหมดพื้นฐาน ของทักษะ โดยใช้เนื้อหา 3 ฟิลด์ร่วมกัน I2VA FL2VA และ L2VA เพิ่มคำสั่งจัดแนวที่แน่นอนไว้ด้านบน ส่วน T2VA เริ่มที่ฟิลด์แรกทันที
Ref2VA ไม่ใช่เทมเพลตเดิมที่เพิ่มไฟล์แนบ แต่มีข้อกำหนด 6 ส่วนแยกต่างหากเพื่อกำหนดไฟล์อ้างอิง จัดประเภทหน้าที่ วิเคราะห์การคงรายละเอียด และบอกจังหวะที่แต่ละไฟล์มีผล
อย่าเลือก Ref2VA เพียงเพราะคำขอละเอียด ให้เลือกเมื่อจำเป็นต้องกำหนดและติดตามเนื้อหาอ้างอิงตลอดเอาต์พุต
ทำความเข้าใจโครงสร้างเอาต์พุตโหมดพื้นฐาน
เนื้อหาของทุกโหมดพื้นฐานใช้ชื่อฟิลด์ 3 รายการตามลำดับนี้
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...
integrated_multimodal_description ระบุสไตล์ภาพ องค์ประกอบ ตัวแบบ สภาพแวดล้อม การกระทำ กล้อง บทพูด การร้องเพลง และเสียงในฉากที่ซิงก์ตามไทม์ไลน์ overall_soundscape สรุปเสียงแวดล้อม เสียงการกระทำ และเสียงมนุษย์ที่ไม่ใช่คำพูดตลอดคลิป non_diegetic_music อธิบายเพลงที่ผู้ชมได้ยินแต่ตัวละครไม่ได้ยิน หากไม่มีให้ใช้ N/A
บรรทัดจัดแนวเปลี่ยนตามโหมดคีย์เฟรม คู่มืออย่างเป็นทางการกำหนดรูปแบบดังนี้
I2VA
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
FL2VA
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.
L2VA
How the reference pictures align with the target video — <Picture 1> (from [Shot N]) aligns with the S.SS-second mark of the target video.
ในฉบับเขียนใหม่ที่เสร็จแล้ว N ต้องเป็นหมายเลขช็อตสุดท้ายจริง และ S.SS ต้องเป็นระยะเวลาที่มีทศนิยม 2 ตำแหน่งพอดี บรรทัดนี้อยู่บรรทัดแรก ตามด้วยบรรทัดว่าง 1 บรรทัดแล้วจึงเป็นเนื้อหา 3 ฟิลด์ T2VA ไม่มีบรรทัดจัดแนว
เวลาของช็อตก็มีกติกา [Shot 1] ไม่มีไทม์สแตมป์ ส่วนช็อตถัดไปเริ่มด้วยเวลาตัดที่เพิ่มขึ้นอย่างเคร่งครัดและอยู่ในระยะเวลา เช่น [Shot 2] At 00:03.500, ... โหมด การจัดแนว ช็อตสุดท้าย และระยะเวลาต้องตรงกัน
ทำความเข้าใจโครงสร้างเอาต์พุต Ref2VA
โหมดอ้างอิงเต็มรูปแบบต้องส่งคืน 6 ส่วนตามลำดับนี้
subject_definitions:
...
summary:
[reference generation] ...
retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - ...
detailed_description:
...
overall_soundscape:
...
non_diegetic_music:
...
ป้ายกำกับแต่ละแบบมีหน้าที่ต่างกัน
<Subject N>ระบุเนื้อหาที่มองเห็นและนำกลับมาใช้ได้ เช่น คน วัตถุ ฉาก สไตล์ การกระทำ อินเทอร์เฟซ หรือเอฟเฟกต์<Picture N>ระบุภาพที่ใช้เป็นเฟรมเป้าหมาย คีย์เฟรม จุดยึดองค์ประกอบ หรือสตอรีบอร์ดอ้างอิง<Video N>ระบุวิดีโอต้นฉบับที่ใช้แก้ไข ทำต่อ หรือกำหนดโครงสร้างเวลาของวิดีโอทั้งชิ้น<Audio N>ระบุสัญญาณเสียงแยกหรือแทร็กซิงก์ที่เปิดใช้และนำมาคัดลอกหรืออ้างอิง
หมวดหมู่เหล่านี้นับหมายเลขแยกกัน ตัวแบบที่มองเห็นซึ่งดึงจากวิดีโออ้างอิงยังใช้ <Subject N> ส่วน <Video N> แทนไฟล์หรือความสัมพันธ์กับวิดีโอทั้งชิ้น วิดีโอมีเสียงไม่ได้หมายความว่าจะสร้างรายการ <Audio N> โดยอัตโนมัติ
summary เริ่มด้วยประเภทงานอย่างเป็นทางการในวงเล็บเหลี่ยมอย่างน้อย 1 ประเภท ได้แก่ keyframe completion reference generation video editing video continuation audio reuse หรือ audio reference ถ้ามีหลายประเภทให้เชื่อมด้วย +
retention_analysis กำหนดความสัมพันธ์ที่ชัดเจนให้ทุกป้ายกำกับ เนื้อหาภาพใช้ fully_preserved partially_preserved attribute_transfer หรือ weak_reference ส่วนเสียงใช้ fully_copy partially_copy reference หรือ weak_reference เครื่องหมายนี้อธิบายความสัมพันธ์ที่ต้องการ ไม่ใช่คะแนนคุณภาพทั่วไป
สุดท้าย Ref2VA ใช้ detailed_description แทน integrated_multimodal_description สำหรับงานสร้าง คู่มือ MiniMax มักกำหนดคำอธิบายภาษาอังกฤษ 350–500 คำ โดยลงรายละเอียดองค์ประกอบ ตัวแบบ สภาพแวดล้อม แสง การกระทำ การเปลี่ยนสถานะ กล้อง เสียง และการใช้ไฟล์อ้างอิงของแต่ละช็อต งานที่มีบทพูดมากควรให้ความสำคัญกับไทม์ไลน์คำพูดครบถ้วนมากกว่าการนับคำแบบตายตัว
ขอพรอมต์โหมดพื้นฐานจากเอเจนต์
หลังติดตั้ง ให้เรียกทักษะตามชื่อและส่งบรีฟงานที่กระชับ การกำหนดค่าเอเจนต์ที่ให้มาจะใช้ $h3-prompt-writing ในคำขอเริ่มต้น
คัดลอกคำขอ FL2VA นี้ได้ทันที
Use $h3-prompt-writing to rewrite this request as a MiniMax H3 FL2VA prompt.
Duration: 8.00 seconds.
Picture 1: the supplied first frame, a closed field notebook on a rain-darkened café table.
Picture 2: the supplied last frame, the same notebook open to a pressed violet flower.
Action: one hand enters, opens the notebook, and stops on the flower page.
Camera: one continuous shot with a slow, small push in.
Sound: quiet café room tone, rain against glass, paper and cover movement.
Dialogue: none.
Non-diegetic music: none.
Preserve the table position, notebook identity, hand continuity, lighting direction, and final composition. Return only the final rewrite in the official base-mode structure.
ส่วนสำคัญคือโหมดที่ระบุชัด ระยะเวลาที่แน่นอน หน้าที่ของแต่ละภาพ เส้นทางเปลี่ยนผ่านที่ทำได้ การตัดสินใจเรื่องเสียง และข้อจำกัดเอาต์พุต เอเจนต์ควรส่งบรรทัดจัดแนว FL2VA ก่อน ใช้ 3 ฟิลด์ร่วมกัน และไปถึง Picture 2 ที่ 8.00 วินาที
สำหรับ I2VA ให้แทนภาพที่สองด้วยการกระทำที่ดำเนินต่อจากเฟรมแรก สำหรับ L2VA ให้อธิบายเหตุการณ์ก่อนถึงเฟรมสุดท้าย สำหรับ T2VA ให้นำภาพอ้างอิงออกและให้ข้อมูลพอที่เอเจนต์จะสร้างองค์ประกอบเริ่มต้นกับลำดับภาพและเสียงจากข้อความ
ขอพรอมต์อ้างอิงเต็มรูปแบบจากเอเจนต์
คำขอ Ref2VA ทำงานได้ดีขึ้นเมื่อทุกไฟล์มีหน้าที่ชัดเจน คำขอที่คัดลอกได้นี้แยกอัตลักษณ์ การเคลื่อนไหว และแนวทางเสียง
Use $h3-prompt-writing to rewrite this request as a MiniMax H3 full-reference Ref2VA prompt.
Target: a 10-second, three-shot product demonstration.
Picture 1: preserve the reusable bottle identity, silhouette, cap, label placement, and material finish.
Video 1: reference only the demonstrator's hand action and the three-shot cut rhythm; do not reuse its product, set, or wardrobe.
Audio 1: reference the percussion tempo for edit timing without copying the source signal.
Shot flow:
1. Establish the bottle centered on a stone counter.
2. A hand presses the pump once and the lotion lands on the back of the other hand.
3. End on the bottle and a small lotion smear beside it.
No dialogue or visible text beyond the preserved label. Use new room ambience and restrained audience-only percussion. Return only the six official Ref2VA sections in their required order, with consistent labels and explicit retention markers.
คำขอนี้ไม่ได้เขียน subject_definitions แทนเอเจนต์ แต่ให้ที่มาและเจตนาใช้ซ้ำเพียงพอที่ทักษะจะสร้างคำจำกัดความ จัดประเภทสรุปเป็นการสร้างด้วยไฟล์อ้างอิงร่วมกับการอ้างอิงเสียง และอธิบายการคงหรือถ่ายโอนของทุกป้ายกำกับ
หากไฟล์หนึ่งควรมีผลต่อคุณสมบัติเดียว ให้ระบุไว้ วิดีโอการเคลื่อนไหวอาจกำกับมือโดยไม่ควบคุมนักแสดง เสื้อผ้า ฉาก สินค้า กล้อง หรือเสียง
ใช้ขั้นตอนเอเจนต์ 2 รอบ
มองเอาต์พุตของทักษะเป็นร่างที่มีโครงสร้างแล้วตรวจซ้ำตามกติกา
- เขียนรายการแหล่งที่มา ระบุคำสั่งข้อความ เฟรม ภาพ วิดีโอ และเสียงทั้งหมด พร้อมบอกว่าแต่ละไฟล์ควรและไม่ควรควบคุมอะไร
- ล็อกโหมดงาน เลือก T2VA I2VA FL2VA L2VA หรือ Ref2VA ก่อนเขียนใหม่
- แจ้งข้อจำกัดการส่งมอบ ระบุระยะเวลา จำนวนช็อต เวลาเฟรมขอบเขต บทพูด ข้อความที่มองเห็น และเพลง
- ขอเฉพาะโครงสร้างทางการ เพื่อให้พบฟิลด์ที่หาย ส่วนที่สลับลำดับ และคำอธิบายนอกพรอมต์ได้ง่าย
- ตรวจโดยไม่เปลี่ยนบรีฟ ตรวจโครงสร้าง ไฟล์อ้างอิง เวลา ข้อความพูด และตำแหน่งเสียงก่อน
- แก้ทีละชั้น ขอให้แก้ข้อไม่ตรงกันจุดเดียวโดยคงส่วนที่ยอมรับแล้ว
รอบที่สองใช้คำสั่งนี้
Review the rewrite against the h3-prompt-writing guide. Keep the creative brief unchanged. Correct only field order, unresolved reference labels, shot timestamps, duration alignment, dialogue preservation, and diegetic versus non-diegetic audio placement. Return the corrected prompt only.
พรอมต์ตรวจนี้ลดโอกาสที่การแก้รูปแบบจะกลายเป็นการเปลี่ยนความคิดสร้างสรรค์โดยไม่ตั้งใจ
ตรวจเอาต์พุตก่อนสร้าง
ใช้รายการนี้หลังเอเจนต์เขียนใหม่ทุกครั้ง
- โหมด : เอาต์พุตใช้คู่มือที่ตรงกับความสัมพันธ์ของอินพุตจริง
- โครงสร้างพื้นฐาน : T2VA เริ่มด้วย
integrated_multimodal_descriptionส่วน I2VA FL2VA และ L2VA วางคำสั่งจัดแนวที่ถูกต้องไว้ด้านบน - โครงสร้าง Ref2VA : ฟิลด์ทั้ง 6 ปรากฏครั้งเดียวตามลำดับ และใช้
detailed_descriptionแทนintegrated_multimodal_description - ป้ายกำกับ :
<Subject N><Picture N><Video N>และ<Audio N>ทุกตัวคงความหมายเดิมทุกส่วน และไม่มีป้ายกำกับที่ยังไม่กำหนด - หน้าที่อ้างอิง : ตัวแบบ เฟรมที่เจาะจง ความสัมพันธ์กับวิดีโอทั้งชิ้น และสัญญาณเสียงใช้ประเภทป้ายกำกับถูกต้อง
- การคงรายละเอียด : ทุกไฟล์อ้างอิงที่ติดตามมีเครื่องหมายความสัมพันธ์ที่อนุญาตและตรงคำขอ
- ช็อต :
[Shot 1]ไม่มีไทม์สแตมป์ เวลาตัดต่อไปเพิ่มขึ้นและอยู่ในระยะเวลาที่ขอ - เฟรมขอบเขต : I2VA เริ่มจากเฟรมแรก FL2VA ไปถึงเฟรมสุดท้าย และ L2VA เข้าสู่เฟรมสุดท้ายที่ให้มา
- คำพูดและข้อความ : บทพูด เนื้อเพลง และข้อความในฉากคงภาษาและคำเดิม ส่วนคำอธิบายที่เขียนใหม่เป็นภาษาอังกฤษ
- เสียง : บทพูดและเสียงในฉากที่ซิงก์อยู่ในคำอธิบาย เสียงแวดล้อมทั้งคลิปอยู่ใน
overall_soundscapeและเพลงสำหรับผู้ชมเท่านั้นอยู่ในnon_diegetic_music - ความเป็นไปได้ : การกระทำพอดีกับระยะเวลา และช่วงท้ายจบสมบูรณ์โดยไม่ถูกตัดโดยไม่ตั้งใจ
- ความสะอาด : เอเจนต์ไม่เพิ่มสรุปเนื้อเรื่อง ไฟล์ที่ไม่รองรับ หน้าที่ขัดแย้ง หรือคำอธิบายนอกพรอมต์
ย้ายจากร่างของเอเจนต์ไปยัง OmniArt
ทักษะนี้เหมาะที่สุดในฐานะชั้นเตรียมงาน โดยเปลี่ยนรายการไฟล์และบรีฟเป็นพรอมต์ที่ตรวจได้ก่อนสร้าง เก็บเอาต์พุตที่ยอมรับแล้วไว้กับไฟล์ต้นฉบับ เพราะป้ายกำกับจะมีประโยชน์เมื่ออันดับและความหมายของไฟล์คงที่เท่านั้น
จากนั้นนำพรอมต์ที่ตรวจแล้วพร้อมไฟล์ตรงกันไปยังสตูดิโอสร้างวิดีโอของ OmniArt หากต้องการปรับบรีฟแทนโครงสร้างฟิลด์ H3 ให้กลับไปที่คู่มือพรอมต์ MiniMax H3 ใช้คู่มือเพื่อตัดสินใจสิ่งที่ต้องการ ใช้ h3-prompt-writing เพื่อถ่ายทอดตามข้อกำหนด H3 ที่เลือก และใช้รายการตรวจเพื่อหยุดข้อผิดพลาดเชิงโครงสร้างก่อนสร้าง
พร้อมสร้างหรือยัง?
เริ่มสร้างคอนเทนต์ที่ยอดเยี่ยมด้วย AI