คู่มือพรอมป์ต์ MiniMax H3: ควบคุมอินพุตอ้างอิงทุกชนิด
เรียนรู้การเขียนพรอมป์ต์ MiniMax H3 สำหรับภาพ วิดีโอ เสียง และข้อความอ้างอิง กำหนดบทบาทให้แต่ละแอสเซ็ต ป้องกันความขัดแย้ง และกำกับช็อตวิดีโอ AI ตามเวลา

แนวคิดที่มีประโยชน์ของพรอมป์ต์ MiniMax H3 ไม่ใช่ “เขียนรายละเอียดให้มากขึ้น” แต่คือ “มอบงานเดียวให้ทุกอินพุต” H3 รับข้อความ ภาพ วิดีโอ และเสียงเป็นชุดข้อมูลอ้างอิงเดียวกันได้ ดังนั้นผู้สร้างจึงดึงอัตลักษณ์ผลิตภัณฑ์จากภาพนิ่ง การเคลื่อนไหวจากคลิป จังหวะจากเสียง และทิศทางช็อตจากพรอมป์ต์ได้ ความยืดหยุ่นนี้มีประโยชน์ก็ต่อเมื่อโมเดลแยกได้ว่าแหล่งใดควบคุมส่วนใดของผลลัพธ์
คู่มือพรอมป์ต์ MiniMax H3 นี้เปลี่ยนหลักการดังกล่าวเป็นรูปแบบที่ทำซ้ำได้ คุณจะได้เรียนรู้การผูกแอสเซ็ตแต่ละรายการกับบทบาท ป้องกันข้อมูลอ้างอิงที่ขัดแย้งกัน เขียนกฎการคงสภาพ และแบ่ง generation 4–15 วินาทีเป็นจังหวะตามเวลา เทมเพลตหกแบบท้ายบทครอบคลุมวิดีโอผลิตภัณฑ์ การเคลื่อนไหวตัวละคร บทสนทนา การตัดต่อวิดีโอ UI motion และการเปลี่ยนผ่านจากเฟรมแรกสู่เฟรมสุดท้าย
หมายเหตุ
นี่คือคู่มือพรอมป์ต์ที่ยึดตามเอกสาร ไม่ใช่รายงานการสร้าง H3 ที่ OmniArt ทดสอบ มันอ้างอิงจากคู่มือการสร้าง H3 ปัจจุบันและเอกสารอ้างอิง API อย่างเป็นทางการของ MiniMax H3 ยังไม่ได้รับการยืนยันในแค็ตตาล็อกโมเดลที่เป็นแหล่งความจริงของ OmniArt ณ วันที่ 31 กรกฎาคม 2026 ป้ายกำกับอินเทอร์เฟซและไวยากรณ์ข้อมูลอ้างอิงอาจต่างกันระหว่าง พื้นผิวของ MiniMax เองและโฮสต์ปลายทาง
MiniMax H3, Hailuo 3.0 หรือ Hailuo 03?
เอกสารปัจจุบันของ MiniMax เรียกโมเดลว่า MiniMax H3 และระบุ identifier โมเดล API อย่างเป็นทางการคือ MiniMax-H3 คุณอาจพบ Hailuo 3.0, Hailuo 03 หรือ Hailuo-3.0 ในข่าวเปิดตัวและแค็ตตาล็อกของบุคคลที่สาม เพราะ Hailuo คือแบรนด์ผลิตภัณฑ์วิดีโอของ MiniMax
ใช้ชื่อที่พื้นผิวตรงหน้าคุณกำหนด สำหรับ MiniMax V2 API อย่างเป็นทางการที่มีเอกสารในเวลาที่เผยแพร่ นั่นหมายถึง MiniMax-H3; อย่าสันนิษฐานว่า alias ใน marketplace ใช้เป็น identifier ของ API ทางการได้ด้วย คู่มือนี้ใช้ MiniMax H3 สำหรับโมเดล และ reference generation สำหรับโหมดที่รวมอินพุตภาพ วิดีโอ และเสียง “Omni reference” เป็นคำบรรยายที่มีประโยชน์สำหรับเวิร์กโฟลว์สื่อผสมนี้ แต่ API ทางการเรียกว่า reference-to-video
ทำความรู้จักโหมดสร้าง H3 ทั้งสาม
การเลือกโหมดที่ถูกต้องต้องมาก่อนการเขียนพรอมป์ต์
| โหมด | อินพุต | ใช้เมื่อ |
|---|---|---|
| ข้อความเป็นวิดีโอ | ต้องมีพรอมป์ต์ข้อความ | สร้างฉากจากคำบรรยายเพียงอย่างเดียวได้ |
| ภาพเฟรมแรก/สุดท้ายเป็นวิดีโอ | ต้องมีพรอมป์ต์และเฟรมแรก เฟรมสุดท้าย หรือทั้งสอง | องค์ประกอบเปิดหรือปิดที่แม่นยำมีความสำคัญ |
| Reference generation | ต้องมีพรอมป์ต์และภาพ วิดีโอ หรือเสียงอ้างอิง | ต้องการอัตลักษณ์ การออกแบบ การเคลื่อนไหว กล้อง เสียง จังหวะ หรือสไตล์จากแอสเซ็ตที่อัปโหลด |
สเปกอย่างเป็นทางการปัจจุบันระบุเอาต์พุต 2K และระยะเวลาจำนวนเต็มตั้งแต่ 4 ถึง 15 วินาที ทุกคำขอต้องมีพรอมป์ต์ข้อความที่ไม่ว่าง ความยาวสูงสุด 7,000 ตัวอักษร คำขอข้อมูลอ้างอิงรวมภาพได้สูงสุดเก้าภาพ วิดีโอสามรายการ และคลิปเสียงสามรายการ โดยรวมแอสเซ็ตได้ไม่เกิน 12 รายการ วิดีโออ้างอิงรวมกันได้ไม่เกิน 15 วินาที เช่นเดียวกับคลิปเสียงอ้างอิง เสียงอ้างอิงส่งเดี่ยว ๆ ไม่ได้ ต้องมีภาพหรือวิดีโออย่างน้อยหนึ่งรายการร่วมด้วย
Text-to-video ต้องใช้อัตราส่วนภาพที่ระบุชัด Reference generation ใช้อัตราส่วนที่ระบุชัด หรือให้ H3 เลือกแบบ adaptive ได้ ขณะที่การสร้างจากเฟรมแรก/สุดท้ายจะยึดตามภาพที่อัปโหลด ตัวเลือกอัตราส่วนที่มีเอกสารคือ 21:9, 16:9, 4:3, 1:1, 3:4 และ 9:16
มีขอบเขตเวิร์กโฟลว์ที่ตายตัวหนึ่งข้อ: โหมดเฟรมแรก/สุดท้ายและ reference generation ผสมกันในคำขอ API เดียวไม่ได้ หากเฟรมขอบเขตที่แม่นยำสำคัญ ให้ใช้โหมดเฟรมแรก/สุดท้าย หากอัตลักษณ์ การเคลื่อนไหว สไตล์ หรือการถ่ายโอนเสียงสำคัญกว่า ให้ใช้ reference generation และบรรยายองค์ประกอบเปิดด้วยข้อความ
สร้างพรอมป์ต์ H3 เป็นแผนผังบทบาท
API ของ H3 รับสื่อเป็นรายการแบบมี type และ role เช่น reference_image, reference_video และ reference_audio บทบาทเชิงเทคนิคเหล่านั้นระบุประเภทสื่อ พรอมป์ต์ของคุณควรไปไกลกว่านั้นอีกขั้น โดยระบุความรับผิดชอบเชิงสร้างสรรค์ของแอสเซ็ตแต่ละรายการ
ใช้ลำดับนี้:
DELIVERABLE
What the final clip is for, its duration, and its format.
ROLE MAP
Reference image 1 = subject identity and immutable appearance.
Reference image 2 = environment or visual style only.
Reference video 1 = body motion and timing only.
Reference audio 1 = rhythm and edit timing only.
SHOT
Subject, action, environment, lighting, and camera direction.
TIMELINE
Time-coded beats that add up to the selected duration.
PRESERVE
Features that must remain unchanged from named references.
EXCLUDE
A short list of the most damaging unwanted changes.
ป้ายกำกับแบบมีหมายเลขข้างต้นเป็นป้ายเชิงความหมายสำหรับบรีฟ ไม่ได้สัญญาว่าทุกอินเทอร์เฟซ H3 จะมี handle แบบ Reference image 1 ตามตัวอักษร ใน API อย่างเป็นทางการ ไฟล์เป็นรายการแยกกันในอาร์เรย์ content ใน visual interface ให้ใช้ชื่อไฟล์แนบหรือไวยากรณ์ mention ที่พื้นผิวนั้นมี แล้วรักษาหลักตรรกะแอสเซ็ตหนึ่งรายการต่อหนึ่งงานเหมือนเดิม
ให้แต่ละแอสเซ็ตมีงานหลักหนึ่งอย่าง
ข้อมูลอ้างอิงมีข้อมูลมากกว่าที่คุณต้องการถ่ายโอนโดยทั่วไป คลิปเต้นมีผู้แสดง เสื้อผ้า สถานที่ กล้อง แสง การเคลื่อนไหว และอาจมีดนตรี หากคุณขอ H3 ให้ “ทำตามวิดีโอ” คุณสมบัติทั้งหมดนั้นจะแข่งกันกับภาพตัวละครของคุณ
ให้ผูกแบบแคบกว่า:
- ภาพอ้างอิง: อัตลักษณ์ ใบหน้า เสื้อผ้า รูปทรงผลิตภัณฑ์ โลโก้ พาเลต หรือการออกแบบสภาพแวดล้อม
- วิดีโออ้างอิง: การเคลื่อนไหวร่างกาย เส้นทางกล้อง จังหวะแอ็กชัน ปฏิสัมพันธ์ทางกายภาพ หรือจังหวะการตัดต่อ
- เสียงอ้างอิง: ลักษณะเสียงพูด จังหวะการพูด จังหวะดนตรี บรรยากาศ หรือสัญญาณเหตุการณ์
- พรอมป์ต์ข้อความ: ฉากสุดท้าย กฎการถ่ายโอน ไทม์ไลน์ ลำดับความสำคัญ และคำสั่งคงสภาพ
เมื่อแอสเซ็ตหนึ่งต้องทำสองงาน ให้ระบุทั้งคู่และทำให้เส้นแบ่งชัดเจน: “Reference video 1 ควบคุมเส้นทางกล้องและจังหวะแอ็กชัน; ไม่ต้องสนใจผู้แสดง เสื้อผ้า สถานที่ color grade และเสียงของมัน”
ป้องกันไม่ให้ข้อมูลอ้างอิงขัดแย้งกัน
ความขัดแย้งของข้อมูลอ้างอิงมักเป็นปัญหาคำสั่งก่อนเป็นปัญหาโมเดล ภาพสองภาพอาจมีแจ็กเก็ตคนละแบบ คลิปการเคลื่อนไหวอาจใช้รูปร่างต่างกัน หรือจังหวะเสียงอาจบอกนัยการตัดที่ขัดกับการเคลื่อนกล้องต่อเนื่องที่ร้องขอ
ใช้ลำดับความสำคัญแบบเขียนไว้เมื่ออินพุตทับซ้อนกัน:
Priority order:
1. Reference image 1 controls character identity and wardrobe.
2. Reference video 1 controls movement and timing only.
3. Reference image 2 controls lighting palette and set design only.
4. The text prompt controls camera framing and final composition.
จากนั้นแก้ความขัดแย้งแทนหวังว่า H3 จะอนุมานความต้องการของคุณ หากภาพอัตลักษณ์มีผมยาวปล่อยแต่ motion video มีหมวก ให้ระบุว่าตัวละครสุดท้ายคงผมหรือสวมหมวก หากข้อมูลอ้างอิงผลิตภัณฑ์แสดงฉลากที่อ่านได้แต่ภาพสไตล์เป็นแนว painterly ให้บอกว่า stylization ใช้กับสภาพแวดล้อมเท่านั้น ขณะที่บรรจุภัณฑ์ยังคง photorealistic
นิสัยสามอย่างช่วยลดความขัดแย้ง:
- ใช้ชุดข้อมูลอ้างอิงที่เล็กที่สุดเท่าที่มีประโยชน์ อินพุตมากขึ้นสร้างความไม่ลงรอยได้มากขึ้น เพิ่มไฟล์เฉพาะเมื่อให้ข้อมูลที่พรอมป์ต์บรรยายได้ไม่เชื่อถือ
- แยกเนื้อหาออกจากสไตล์ ระบุว่าข้อมูลอ้างอิงใดเป็นเจ้าของตัวแบบ และใดเป็นเจ้าของการนำเสนอ
- เลือกอำนาจกล้องหนึ่งแหล่ง ถ่ายโอนกล้องจากวิดีโอ หรือกำกับด้วยข้อความ หากต้องใช้ทั้งคู่ ให้ระบุว่าวิดีโอให้จังหวะ ขณะที่ข้อความแทนที่ framing
หากต้องการเวิร์กโฟลว์ตามอาการที่กว้างขึ้น ให้เปิด7 วิธีแก้พรอมป์ต์วิดีโอ AIควบคู่คู่มือนี้ระหว่างปรับซ้ำ
เขียนคำสั่งคงสภาพที่ตรวจสอบได้
“ทำให้สม่ำเสมอ” คลุมเครือเกินไป บล็อกการคงสภาพควรระบุคุณสมบัติที่มองเห็นและตรวจได้ในทุกเฟรม
สำหรับตัวละคร:
Preserve from reference image 1 throughout every frame: facial structure,
eye color, hairstyle and length, jacket cut, jacket color, and body proportions.
Do not replace the performer with the person from reference video 1.
สำหรับผลิตภัณฑ์:
Preserve from reference image 1: bottle silhouette, cap shape, label placement,
navy wordmark, coral seal, material finish, and relative proportions.
No duplicate product, redesigned packaging, extra text, or changing logo.
anchor เชิงบวกควรมาก่อน; ข้อยกเว้นเป็นราวกัน ไม่ใช่พรอมป์ต์ทั้งหมด คงรายการเชิงลบให้สั้นและเฉพาะเจาะจง ข้อห้ามคลุมเครือสิบข้ออาจลดทอน invariants สี่ข้อที่ตัดสินจริงว่าช็อตใช้ได้หรือไม่
หากตัวละครเดียวกันจะปรากฏในคลิปหลายคลิปที่สร้างแยกกัน ให้คงบล็อกอัตลักษณ์และเสื้อผ้าเหมือนกันทุกพรอมป์ต์ เวิร์กโฟลว์ตัวละครสม่ำเสมอ อธิบายวิธีสร้างแพ็กเก็ตข้อมูลอ้างอิงที่ใช้ซ้ำได้ตลอดลำดับที่ยาวขึ้น
กำกับเวลา ไม่ใช่แค่เนื้อหา
H3 รองรับคลิป 4 ถึง 15 วินาที แต่ย่อหน้ายาวไม่ได้บอกโมเดลว่าเหตุการณ์แต่ละอย่างเกิดเมื่อใด ไทม์ไลน์เปลี่ยนพรอมป์ต์ให้เป็นแผนช็อตที่กระชับ
สำหรับคลิป 10 วินาที:
0–2 seconds: locked medium-wide establishing shot; subject holds still.
2–6 seconds: subject performs the referenced action at the source tempo.
6–9 seconds: camera makes one slow 20-degree arc to the right.
9–10 seconds: subject settles; hold a clean final composition for the edit.
คงแต่ละ beat ให้ทำได้จริง แอ็กชันหลักหนึ่งอย่างบวกการเคลื่อนกล้องหนึ่งครั้งมักชัดกว่าการแปลงสภาพที่ไม่เกี่ยวกันเป็นสาย ให้ช่วงเวลารวมเท่าระยะที่เลือก วางรายละเอียดสำคัญของผลิตภัณฑ์หรือใบหน้าไว้ใน beat ที่ช้ากว่า และสำรองครึ่งวินาทีหรือหนึ่งวินาทีสุดท้ายสำหรับจุดตัดที่นิ่ง
เสียงใช้ clock เดียวกันได้:
At 2.0 seconds, the first downbeat starts the hand movement.
At 6.0 seconds, the bass hit motivates the camera arc.
From 9.0 seconds, let the music tail continue under the held final frame.
หากต้องการคำศัพท์เรื่องเลนส์ แสง และกล้องเพิ่ม ดูคู่มือพรอมป์ต์วิดีโอ AI แบบ cinematic
เทมเพลตพรอมป์ต์ MiniMax H3 หกแบบ
แทนรายละเอียดในวงเล็บเหลี่ยม แนบเฉพาะแอสเซ็ตที่ระบุ และปรับป้ายกำกับให้เข้ากับอินเทอร์เฟซที่ใช้ เทมเพลตเหล่านี้เป็นจุดเริ่มต้นแบบมีโครงสร้างอิงโหมดอินพุต H3 ที่มีเอกสาร ไม่ได้อ้างว่าเป็นผู้ชนะ benchmark หรือรับประกันเอาต์พุต
เทมเพลต 1: เปิดตัวผลิตภัณฑ์ด้วยข้อมูลอ้างอิงการเคลื่อนไหวและดนตรี
- โหมด: Reference generation
- แอสเซ็ต: ภาพผลิตภัณฑ์สะอาดหนึ่งภาพ วิดีโอการเคลื่อนกล้องหนึ่งรายการ และเสียงดนตรีอ้างอิงตามต้องการ
Create a 10-second 9:16 product reveal for a paid social placement.
Role map:
- Reference image 1 controls the product's exact design, proportions, packaging,
colors, materials, label placement, and wordmark.
- Reference video 1 controls camera path and acceleration only. Ignore its subject,
location, lighting, color grade, and audio.
- Reference audio 1 controls beat and edit timing only.
Scene: The product stands centered on a warm-violet studio plinth. Soft lilac key
light from camera left, restrained coral rim light, subtle atmospheric haze.
Timeline:
- 0–2 seconds: static wide reveal on the first soft beat.
- 2–7 seconds: transfer the smooth push-and-arc movement from reference video 1.
- 7–9 seconds: one narrow highlight travels across the product surface.
- 9–10 seconds: camera settles; hold the label front-facing and readable.
Preserve reference image 1 exactly: silhouette, cap, material finish, label layout,
brand colors, and wordmark. Keep one product only. No redesigned packaging,
duplicate objects, extra text, warped label, or abrupt camera shake.
สำหรับการเตรียมภาพนิ่งก่อนพรอมป์ต์นี้ ใช้เวิร์กโฟลว์ภาพเป็นวิดีโอผลิตภัณฑ์
เทมเพลต 2: ถ่ายโอนการเคลื่อนไหวตัวละครโดยไม่ให้อัตลักษณ์เพี้ยน
- โหมด: Reference generation
- แอสเซ็ต: ภาพตัวละครหนึ่งภาพ วิดีโอการเคลื่อนไหวหนึ่งรายการ และภาพสภาพแวดล้อมตามต้องการ
Create an 8-second 16:9 cinematic character performance.
Priority order:
1. Reference image 1 controls face, hair, body proportions, and wardrobe.
2. Reference video 1 controls body choreography and action timing only.
3. Reference image 2 controls the environment palette and architecture only.
4. This prompt controls framing and lighting.
The character from reference image 1 performs the complete movement from reference
video 1 in a moonlit station based on reference image 2. Medium full shot, camera
locked at chest height, soft directional light, realistic weight and foot contact.
Timeline:
- 0–1 seconds: character holds the starting pose.
- 1–7 seconds: perform the reference choreography once at its original tempo.
- 7–8 seconds: settle naturally and look toward camera left.
Preserve facial structure, hairstyle, coat shape, coat color, boots, and body
proportions from reference image 1 in every frame. Do not inherit the motion video's
performer, face, clothing, background, camera movement, or audio. No extra limbs,
sliding feet, costume changes, or cuts.
เทมเพลต 3: การแสดงบทสนทนาด้วยข้อมูลอ้างอิงเสียง
- โหมด: Reference generation
- แอสเซ็ต: ภาพตัวละครหนึ่งภาพ และคลิปเสียงพูดหรือเสียงที่ได้รับอนุญาตหนึ่งคลิป
คำเตือน
อัปโหลดเฉพาะเสียงที่คุณเป็นเจ้าของหรือมีสิทธิ์อนุญาตอย่างชัดแจ้งให้ใช้ โมเดลที่ รับเสียงอ้างอิงไม่ได้มอบสิทธิ์ให้คุณเลียนแบบเสียงของบุคคลอื่น
Create a 9-second 16:9 single-character dialogue shot.
Role map:
- Reference image 1 controls the speaker's appearance, wardrobe, and room design.
- Reference audio 1 controls spoken timing, cadence, emotional progression, and pauses.
Shot: Medium close-up, eye-level, 50 mm cinematic framing. The speaker begins calm,
briefly smiles after the central pause, then finishes with quiet confidence. Natural
blinks and restrained hand movement. Camera remains static; soft room tone underneath.
Timeline:
- 0–1 seconds: silent eye contact and a small inhale.
- 1–8 seconds: performance follows reference audio 1 exactly in timing and pauses.
- 8–9 seconds: mouth closes, expression settles, hold for the edit.
Preserve face, hairstyle, skin tone, jacket, background layout, and lighting direction
from reference image 1. Keep one speaker. No camera move, cutaway, background speech,
new words, exaggerated gestures, or wardrobe changes.
เทมเพลต 4: แทนที่สภาพแวดล้อมของวิดีโอต้นทาง
- โหมด: Reference generation
- แอสเซ็ต: วิดีโอต้นทางหนึ่งรายการ ภาพสภาพแวดล้อมหนึ่งภาพ และภาพตัวแบบตามต้องการ
Create a 12-second 16:9 environmental replacement based on the source clip.
Role map:
- Reference video 1 controls shot length, subject action, physical timing, camera path,
framing progression, and interaction with the ground.
- Reference image 1 controls the replacement environment, architecture, palette,
weather, and lighting mood.
- Reference image 2 controls the subject's face and wardrobe, if supplied.
Replace the source video's location with the environment from reference image 1.
Preserve the original action and camera movement continuously. Match subject lighting,
contact shadows, reflections, and atmospheric perspective to the new environment.
Timeline follows reference video 1. Maintain one continuous shot with the original
action beats and no added event.
Preserve the source subject's position, scale, motion, and ground contact. Preserve
identity and wardrobe from reference image 2 when present. Do not copy the original
background, signage, bystanders, color grade, or source audio. No cuts, teleporting,
floating feet, or changing architecture.
เทมเพลต 5: UI motion ที่มีแบรนด์ซิงก์กับจังหวะ
- โหมด: Reference generation
- แอสเซ็ต: ภาพเลย์เอาต์ UI หนึ่งภาพ วิดีโอสไตล์การเคลื่อนไหวหนึ่งรายการ และเสียงอ้างอิงตามต้องการ
Create a 7-second 1:1 UI motion-design clip for a product announcement.
Priority order:
1. Reference image 1 controls exact layout, hierarchy, component positions, text,
logo, colors, corner shapes, and typography appearance.
2. Reference video 1 controls transition character and easing only.
3. Reference audio 1 controls the timing of three motion beats only.
Animate the interface from reference image 1 without redesigning it. Begin with the
main panel at rest. Use the restrained slide-and-scale transition quality from
reference video 1. Keep the camera orthographic and the background static.
Timeline:
- 0–1 seconds: complete layout at rest.
- 1–3 seconds: cards enter in sequence on beat one.
- 3–5 seconds: primary control changes state on beat two.
- 5–6 seconds: one subtle emphasis pulse on beat three.
- 6–7 seconds: complete interface holds sharp and readable.
Preserve every word, logo shape, component proportion, spacing relationship, and brand
color from reference image 1. No invented labels, misspelled text, extra panels,
perspective tilt, camera movement, glow overload, or elastic distortion.
เทมเพลต 6: การแปลงสภาพจากเฟรมแรกสู่เฟรมสุดท้ายอย่างแม่นยำ
- โหมด: First/last-frame image-to-video
- แอสเซ็ต: ภาพเฟรมแรกหนึ่งภาพและภาพเฟรมสุดท้ายหนึ่งภาพ; ไม่มีสื่ออ้างอิง
Create a 10-second transformation from the supplied first frame to the supplied last
frame. Preserve the subject's identity and the camera's fixed position throughout.
Timeline:
- 0–2 seconds: hold the first-frame composition; only subtle ambient movement.
- 2–7 seconds: the scene transforms progressively from the center outward. Materials
change continuously with believable physical contact and no hard cut.
- 7–9 seconds: remaining details resolve into the last-frame design.
- 9–10 seconds: arrive exactly at the supplied last frame and hold it cleanly.
One continuous locked shot. Preserve subject scale, face, silhouette, horizon, lens,
and framing during the transition. No reference-style transfer, new characters,
camera movement, jump cut, flicker, or overshoot beyond the final composition.
อย่าแนบภาพ วิดีโอ หรือเสียงอ้างอิงของเทมเพลตอื่นกับคำขอนี้ API ทางการถือว่าการสร้างจากเฟรมแรก/สุดท้ายและ reference generation เป็นโหมดที่แยกจากกัน
ลำดับการปรับซ้ำที่ใช้งานได้จริง
อย่าเปลี่ยนคำสั่งเรื่องอัตลักษณ์ การเคลื่อนไหว กล้อง สไตล์ และเสียงพร้อมกันหลัง render ที่น่าผิดหวังครั้งเดียว นั่นทำให้เรียนรู้ไม่ได้ว่าคำสั่งใดช่วย
ปรับซ้ำเป็นสามรอบ:
- ล็อกบทบาทและ invariants ใช้ชุดข้อมูลอ้างอิงที่เล็กที่สุดและตรวจว่าตัวแบบหรือผลิตภัณฑ์ยังจดจำได้
- ล็อกแอ็กชันและไทม์ไลน์ เพิ่มแหล่งการเคลื่อนไหวหรือ beat ตามเวลา โดยคงสไตล์ให้เรียบง่าย
- เพิ่มการปรุงแต่ง เพิ่มสภาพแวดล้อม แสง grade สัญญาณเสียง และรายละเอียดจบงานหลังสองเลเยอร์แรกเสถียร
เมื่อผลลัพธ์เพี้ยน ให้ลดความซับซ้อนก่อนเพิ่มภาษาปฏิเสธ ลบข้อมูลอ้างอิงที่สำคัญน้อยที่สุด ย่อไทม์ไลน์ หรือมอบงานที่แคบลงให้หนึ่งแหล่ง เปรียบเทียบหลาย variant กับ checklist เดียวกัน: อัตลักษณ์ รูปทรง การเคลื่อนไหว กล้อง จังหวะเสียง และความนิ่งของเฟรมสุดท้าย
เริ่มต้นจาก OmniArt
MiniMax H3 ยังไม่ได้รับการยืนยันว่าเลือกใช้ได้ใน OmniArt ดังนั้นบทความนี้จึงไม่ลิงก์ไปยัง route สำหรับสร้าง H3 หรือกล่าวอ้างเวิร์กโฟลว์ H3 ใน OmniArt ตรวจรายชื่อโมเดลวิดีโอ OmniArt ปัจจุบันเพื่อดูโมเดลที่มีในวันนี้
วิธีแผนผังบทบาทยังถ่ายโอนไปยังโมเดลวิดีโอแบบขับเคลื่อนด้วยข้อมูลอ้างอิงที่รองรับได้ดี: เตรียมภาพอัตลักษณ์หนึ่งภาพ แหล่งการเคลื่อนไหวหนึ่งรายการ และบล็อกการคงสภาพสั้น ๆ ก่อนเปิดพื้นที่ทำงาน คงพรอมป์ต์ให้เป็นกลางต่อโมเดลจนบรีฟสร้างสรรค์เสถียร แล้วค่อยปรับป้ายไฟล์แนบและไวยากรณ์เฉพาะฟีเจอร์ให้เข้ากับโมเดลที่คุณเลือกจริง วิธีนี้ทำให้คุณมี direction sheet ที่นำกลับมาใช้ได้ตอนนี้ และมีพรอมป์ต์ H3 ที่สะอาดหากโมเดลเข้าร่วม OmniArt ในภายหลัง
สำหรับอัตรา API ทางการ การคิดค่าวิดีโออ้างอิง และตัวอย่างต้นทุนที่คำนวณแล้ว ใช้คู่มือราคาและสเปก MiniMax H3 ซึ่งใช้หน้าราคาของ MiniMax เองแทนราคา reseller
พร้อมสร้างหรือยัง?
เริ่มสร้างคอนเทนต์ที่ยอดเยี่ยมด้วย AI