พรอมต์ของ MAI-Image-2.6 : 4 บทเรียนจาก Microsoft
MAI-Image-2.6 ของ Microsoft ขึ้นอันดับ 2 บน Arena แต่สิ่งที่ใช้ได้นานกว่าคือพรอมต์ที่เผยแพร่มาพร้อมกัน สี่รูปแบบการเขียน สี่กฎที่ย้ายไปใช้กับโมเดลไหนก็ได้

วันที่ 10 สิงหาคม 2026 Microsoft AI ประกาศเปิดตัว MAI-Image-2.6 และระบุว่าอยู่อันดับสองบนกระดานจัดอันดับสร้างภาพจากข้อความของ Arena ดีขึ้น +79 Elo จาก MAI-Image-2.5 โดยรวม และเฉพาะการเรนเดอร์ข้อความดีขึ้น +91 Elo นั่นคือพาดหัว และพาดหัวจากกระดานจัดอันดับมักหมดอายุเร็ว
ส่วนที่อยู่ได้นานกว่าในการเปิดตัวครั้งนี้เงียบกว่านั้นมาก ในหน้าของ MAI-Image-2 MAI-Image-2.5 และ MAI-Image-2.6 Microsoft เผยแพร่พรอมต์จริงที่อยู่เบื้องหลังภาพตัวอย่างเอาไว้ด้วย พรอมต์ชุดนี้ไม่ใช่การหยิบมารวมกันแบบสุ่ม แต่เป็นสี่วิธีเขียนถึงโมเดลสร้างภาพที่ต่างกันอย่างชัดเจน และแต่ละอันกำลังทำงานเฉพาะอย่าง คือบรรยาย บีบอัด แก้ไข และอ้างอิง
MAI-Image ไม่มีอยู่ในรายการโมเดลของ OmniArt บทความนี้จึงไม่ใช่รีวิวโมเดลที่คุณรันได้ที่นี่ สิ่งที่อ่านคือฝีมือการเขียนพรอมต์ที่ปรากฏอยู่ เพราะฝีมือแบบนี้ย้ายที่ได้ รูปแบบทั้งสี่ด้านล่างใช้ได้กับโมเดลสร้างภาพที่มีคุณภาพในปัจจุบันทุกตัว และข้อสรุปของแต่ละข้อมีรูปร่างเดียวกัน คือ สิ่งที่คุณใส่ลงในพรอมต์เป็นตัวกำหนดว่าคุณจะได้ความล้มเหลวแบบไหน
MAI-Image 2 2.5 และ 2.6 ส่งอะไรออกมาบ้าง
สามรุ่นในเวลาไม่ถึงห้าเดือน แต่ละครั้งมีจุดศูนย์ถ่วงต่างกัน
| รุ่น | ประกาศเมื่อ | จุดยืนที่ Microsoft วางไว้ | คำกล่าวอ้างเรื่อง Arena |
|---|---|---|---|
| MAI-Image-2 | 19 มีนาคม 2026 | ความสมจริง ข้อความในภาพ การสร้างฉากที่มีรายละเอียด "สร้างร่วมกับครีเอเตอร์" | อันดับ 3 ในกลุ่มตระกูลโมเดล |
| MAI-Image-2.5 | หน้าโมเดล | แก้ไขได้แม่นยำ ความถูกต้องของวัสดุ ผลงานที่พร้อมใช้งานออกแบบ Pro / มาตรฐาน / Flash | อันดับ 3 ด้านสร้างภาพจากข้อความ ณ 2 มิถุนายน 2026 |
| MAI-Image-2.6 | 10 สิงหาคม 2026 | การเรนเดอร์ข้อความ ภาพบุคคลและงาน 3D ความเนี้ยบเชิงพาณิชย์และซินีมาติก | อันดับ 2 ด้านสร้างภาพจากข้อความ +79 Elo จาก 2.5 |
MAI-Image-2.5 ยังแตกออกเป็นตระกูลย่อยด้วย คือ 2.5-Pro สำหรับความสม่ำเสมอของวัตถุและการให้เหตุผลเชิงภาพ 2.5 สำหรับการสร้างและการแก้ไขที่ควบคุมได้ และ 2.5-Flash ที่ Microsoft อธิบายว่าพร้อมใช้งานจริงในราคาไม่ถึงครึ่งของรุ่นเรือธง หน้าโมเดลของ 2.5 มีแผนภูมิ "Image Arena Elo เทียบราคา API ต่อ 1,000 ภาพ" ซึ่งบอกว่าทีมกำลังปรับให้ดีที่สุดในเรื่องอะไร ไม่ใช่คุณภาพสูงสุดอย่างเดียว แต่เป็นคุณภาพต่อเงินที่จ่าย
สำหรับ 2.6 Microsoft บอกว่ายังมีอีกหลายอย่างที่ยังไม่ลงรายละเอียด ตั้งแต่ "การทำงานข้ามภาพอ้างอิงหลายภาพและการอิงบริบทที่หนาแน่นขึ้น ไปจนถึงการควบคุมการให้เหตุผล รูปแบบ และความละเอียดที่มากขึ้น" ก่อนที่สิ่งเหล่านี้จะเปิดให้ใช้จริง มันคือคำแถลงแผนงาน ไม่ใช่สเปก
บทเรียนที่ 1 : พรอมต์ยาวแบบมีโครงสร้างวางข้อเท็จจริงไว้คนละช่อง
พรอมต์เบื้องหลังตัวอย่างความสมจริงในหน้า MAI-Image-2.5 ยาวราว 90 คำ และโครงสร้างของมันน่าสนใจกว่าความยาว
A young woman in profile on a rooftop, blowing soap bubbles against an overcast sky. She has long straight black hair, windswept slightly, and wears a dark navy double-breasted school uniform jacket with gold buttons and a white collar. She holds a hot pink bubble solution bottle in one hand and a neon lime-green wand to her lips in the other. Five iridescent bubbles of varying sizes float around her.
Behind her: low-rise apartment buildings under a flat gray sky, a black metal railing, and weathered concrete underfoot. Film photography aesthetic.

ลองอ่านใหม่โดยมองว่าเป็นฟอร์ม ไม่ใช่ประโยค ประโยคแรกคือตัวแบบ ท่าทาง การกระทำ และท้องฟ้า ประโยคที่สองคือทรงผมและเสื้อผ้า ประโยคที่สามคืออุปกรณ์ประกอบฉาก มือละหนึ่งชิ้น ประโยคที่สี่คือองค์ประกอบที่นับได้ จากนั้นบล็อกที่มีป้ายกำกับ Behind her: รับเอาทุกอย่างที่เป็นสภาพแวดล้อมไป แล้วปิดท้ายด้วยคำสั่งสไตล์สองคำ
มีสามสิ่งในโครงสร้างนี้ที่ทำงานจริง
- ใช้ชื่อสี ไม่ใช่คำคุณศัพท์ ทั้ง "hot pink" "neon lime-green" "dark navy" "gold" และ "flat gray" ไม่ใช่ "สว่าง" ไม่ใช่ "สีสันสดใส" ชื่อสีคือข้อจำกัดที่โมเดลทำได้สำเร็จหรือพลาดให้เห็นชัด ส่วน "vibrant" ไม่ใช่
- ใช้ตัวเลข ไม่ใช่คำบอกปริมาณกว้าง ๆ วลี "Five iridescent bubbles of varying sizes" ตรวจสอบได้ แต่ "some bubbles" ไม่ได้ ในผลลัพธ์ที่เผยแพร่ จำนวนนี้อยู่ครบจริง คุณยืนหน้าภาพแล้วนับได้ทีละฟอง และนั่นคือประเด็น
- พื้นหลังมีภาชนะของตัวเอง
Behind her:ล้อมสภาพแวดล้อมไว้ รายละเอียดของมันจึงไม่ไหลเข้าไปปนกับคำบรรยายตัวแบบ พรอมต์ยาวมักพังตรงที่โมเดลต้องเดาว่าคำขยายคำหนึ่งเป็นของคำนามตัวไหน
คำบอกสไตล์อยู่ท้ายสุด หลังเนื้อหา จึงไปขยายฉากที่ถูกระบุครบแล้ว แทนที่จะไปชี้นำองค์ประกอบภาพเสียเอง
เคล็ดลับ
เขียนพรอมต์ยาวเป็นช่อง ๆ ไม่ใช่เป็นความเรียง คือตัวแบบและการกระทำ แล้วรูปลักษณ์ แล้วอุปกรณ์ประกอบฉาก แล้วรายละเอียดที่นับได้ แล้วบล็อกสภาพแวดล้อมที่มีป้ายกำกับ แล้วจึงเป็นสไตล์ ถ้าคุณเองยังชี้ไม่ได้ว่าคำหนึ่งอยู่ช่องไหน โมเดลก็ชี้ไม่ได้เหมือนกัน
บทเรียนที่ 2 : พรอมต์สั้นซื้อองค์ประกอบภาพด้วยการเปรียบเทียบ
ประกาศเปิดตัว MAI-Image-2 เผยแพร่พรอมต์ที่ต่างออกไปมาก ราว 30 คำ ไม่มีรูปประโยค มีแต่วลีเรียงตามลำดับความสำคัญ
A glacier wall towering like a cathedral interior, deep blue ice with light refracting through layers, tiny human figure at base for scale, cinematic, cold mist in air, hyper-real detail

วลีแรกคือกลเม็ดทั้งหมด "like a cathedral interior" ไม่ใช่การประดับประดา แต่เป็นคำสั่งเรื่ององค์ประกอบภาพที่ปลอมตัวมาเป็นคำเปรียบ มหาวิหารพาเพดานโค้ง โถงกลางที่ถอยลึกเข้าไป ซุ้มโค้ง ความสมมาตร และแสงที่เข้ามาจากปลายทางมาด้วยทั้งชุด ผลลัพธ์มีครบทั้งห้าอย่าง เพียงแต่ทำจากน้ำแข็ง ถ้าบรรยายเลย์เอาต์นั้นตรง ๆ จะกินสามสิบคำและน่าจะออกมาแข็งทื่อกว่า
หมัดที่สองที่ได้ผลคือ tiny human figure at base for scale มาตราส่วนคือสิ่งที่โมเดลสร้างภาพทำหายบ่อยที่สุด เพราะพื้นผิวไม่ได้บอกว่ามันใหญ่แค่ไหน การอ้างอิงร่างมนุษย์ที่ระบุตำแหน่งไว้ตรึงมันไว้ด้วยสี่คำ และแจ็กเก็ตสีแดงในผลลัพธ์ทำงานเรื่ององค์ประกอบภาพมากกว่าการถม "epic, massive, enormous" เท่าไรก็ตาม
คำท้าย ๆ อย่าง cinematic cold mist in air และ hyper-real detail คือบรรยากาศและคำสั่งการเรนเดอร์ และอยู่ท้ายสุดด้วยเหตุผลเดียวกับคำบอกสไตล์ในบทเรียนที่ 1
พรอมต์สองแบบนี้จึงไม่ใช่เวอร์ชันที่ดีกว่าและแย่กว่าของสิ่งเดียวกัน แต่เป็นเครื่องมือคนละชิ้น
| ใช้พรอมต์ยาวแบบมีโครงสร้างเมื่อ | ใช้พรอมต์สั้นแบบเรียงซ้อนเมื่อ |
|---|---|
| เสื้อผ้า อุปกรณ์ประกอบฉาก หรือรายละเอียดแบรนด์สำคัญ | คุณอยากได้ภาพแรงหนึ่งภาพแล้วค่อยไล่ปรับ |
| จะมีคนเอาผลลัพธ์ไปเทียบกับโจทย์ | อารมณ์ภาพสำคัญกว่ารายการของ |
| คุณต้องทำซ้ำให้ได้ในภายหลัง | คุณกำลังสำรวจลุคอยู่ |
| จำนวนและสีต่อรองไม่ได้ | คำเปรียบดี ๆ แบกองค์ประกอบภาพไหว |
บทเรียนที่ 3 : ในการแก้ไข พรอมต์หนึ่งอันควรเปลี่ยนหนึ่งอย่าง
หน้า MAI-Image-2.5 สาธิตการแก้ไขด้วยพรอมต์สามอัน และสิ่งที่สะดุดตาคือแต่ละอันเล็กมาก
Change the tote color to orange
Add peonies peeking out the tote
Edit this image to have the woman walking through the streets of New York City
นี่คืออันแรก ก่อนและหลัง


พรอมต์นี้มีหกคำ คือกริยาหนึ่งคำ วัตถุที่ถูกเรียกชื่อหนึ่งชิ้น และค่าเป้าหมายหนึ่งค่า ไม่ได้พ่วงขอเปลี่ยนพื้นหลัง เปลี่ยนมุม หรือปรับแสงให้ดีขึ้น ความยับยั้งชั่งใจนี่แหละคือเทคนิค เพราะในการแก้ไข งานที่ยากที่สุดของโมเดลคือการรักษาไว้ ไม่ใช่การเปลี่ยน ทุกอย่างที่คุณเติมเข้าไปในคำสั่งคือโอกาสอีกหนึ่งครั้งที่มันจะตัดสินใจทำใหม่
สังเกตด้วยว่าวัตถุถูกเรียกชื่อ คำว่า "the tote" ให้สิ่งอ้างอิงที่ไม่กำกวมแก่โมเดล ถ้าบอกว่า "ทำให้มันเป็นสีส้ม" โมเดลจะต้องเลือกเองระหว่างกระเป๋า โต๊ะ และกำแพง
พรอมต์ที่สามที่ย้ายตัวแบบไปนิวยอร์กดูเหมือนเป็นงานใหญ่กว่ามาก และก็ใหญ่กว่าจริง แต่ยังเป็นงานหนึ่งอย่าง และยังเรียกชื่อสิ่งที่ต้องคงอยู่ไว้ด้วย คือ "the woman" พรอมต์ที่เปลี่ยนเมือง แต่งตัวใหม่ และเปลี่ยนช่วงเวลาไปพร้อมกัน จะทำให้คุณไม่มีทางรู้ว่าคำสั่งไหนทำให้ผลออกมาไม่ดี
คำเตือน
ลูกโซ่ของการแก้ไขเล็ก ๆ ก็คือลูกโซ่ของการเคลื่อนออกทีละนิดด้วย ตรวจรายละเอียดที่คุณให้ความสำคัญหลังทุกขั้น ไม่ใช่เฉพาะตอนจบ สีผิว รูปทรงของโลโก้ และตัวอักษร คือสามอย่างแรกที่ค่อย ๆ แย่ลงอย่างเงียบ ๆ เมื่อผ่านหลายรอบ
บทเรียนที่ 4 : การอ้างอิงวัฒนธรรมนั้นถูก แต่ซื้อได้แค่ฉาก
พรอมต์ที่สั้นที่สุดในบรรดาที่เผยแพร่มีแปดคำ
Chihuahua in Abbey Road album cover with moptop wig


แปดคำประกอบฉากที่เฉพาะเจาะจงมากขึ้นมาใหม่ ทั้งทางม้าลาย ถนนที่มีต้นไม้เรียงหดลึกเข้าไป รถโฟล์คเต่าสีขาวจอดอยู่ทางซ้าย รถยุคนั้น คนเดินถนนในเสื้อโค้ตยุคหกศูนย์ และการจัดเฟรมแบนตรงหน้า ถ้าเขียนออกมาให้ครบต้องใช้ทั้งย่อหน้า และก็ยังน่าจะพลาดรถเต่าอยู่ดี Microsoft จัดสิ่งนี้ไว้ใต้หัวข้อ "ความรู้เกี่ยวกับโลกและการให้เหตุผล" ซึ่งเป็นกรอบที่ถูกต้อง การอ้างอิงที่คนรู้จักกันดีคือพรอมต์ที่บีบอัดที่สุดเท่าที่มีให้ใช้
และมันยังควบคุมได้ยากที่สุดด้วย ตัวอย่างนี้แสดงให้เห็นชัดว่าขีดจำกัดอยู่ตรงไหน ลองเทียบสองภาพ ต้นฉบับคือชิวาวาขนสั้นสีครีมหูตั้งบนพื้นหลังสีดำ ผลลัพธ์คือสุนัขสีขาวสลับน้ำตาล ขนคนละแบบ สัดส่วนคนละอย่าง หูก็ไม่เหมือนกัน การอ้างอิงซื้อฉากมาได้ แต่ไม่ได้รักษาตัวแบบไว้
ความต่างตรงนี้คือบทเรียนที่ใช้งานได้จริง การอ้างอิงแบบย่อความเหมาะมากกับการตั้งโลกขึ้นมาหนึ่งใบ ทั้งแนวทาง ยุคสมัย ธรรมเนียมการจัดแสง และการวางเลย์เอาต์ แต่เชื่อถือไม่ได้ในเรื่องอัตลักษณ์ ถ้าใบหน้าใดใบหน้าหนึ่ง สัตว์เลี้ยงตัวหนึ่ง สินค้าชิ้นหนึ่ง หรือแพ็กเกจแบบหนึ่งต้องอยู่รอด ข้อกำหนดนั้นควรอยู่ในคำบรรยายที่ชัดเจนหรือในกระบวนการใช้ภาพอ้างอิง ไม่ใช่ในคำพาดพิงทางวัฒนธรรม
มีอีกสองข้อที่ควรจำไว้ การอ้างอิงทำงานเฉพาะเมื่อโมเดลรู้จักมัน การอ้างอิงที่คนรู้จักน้อยหรือจำกัดอยู่บางพื้นที่จึงค่อย ๆ กลายเป็นผลลัพธ์กลาง ๆ อย่างเงียบ ๆ และภาพที่โด่งดังมักมีประเด็นเรื่องสิทธิติดมาด้วย ซึ่งพรอมต์ไม่ได้จัดการให้คุณ
ทำไมการเรนเดอร์ข้อความจึงกลายเป็นตัวเลขพาดหัว
จากทุกอย่างในประกาศของ 2.6 ตัวเลขที่ Microsoft เลือกแยกออกมาต่างหากคือเรื่องข้อความ +91 Elo ซึ่งสูงกว่าค่าเฉลี่ยรวมที่ +79 Elo นั่นคือการเน้นที่ตั้งใจ และงานตัวอย่างอธิบายว่าทำไม

การสะกดพาดหัวให้ถูกเป็นครึ่งที่ง่าย โปสเตอร์ข้างบนยังคงชื่อสถานที่ภาษาฝรั่งเศสที่มีเครื่องหมายเสริม เครื่องหมายดอกจันในระดับการแข่งขัน ชุดวันที่คั่นด้วยจุลภาค และที่สำคัญที่สุดคือลำดับความสำคัญ บรรทัดวันที่เป็นรอง พาดหัวเป็นหลัก ภาพประกอบได้พื้นที่สองในสามด้านบน โมเดลที่สะกดถูกหมดแต่ให้น้ำหนักสายตาเท่ากันกับข้อความทุกก้อน ก็ยังผลิตหน้างานที่ใช้ไม่ได้อยู่ดี
นี่คือส่วนของการสร้างภาพที่ใกล้กับงานที่มีคนจ่ายเงินมากที่สุด และเป็นเหตุผลที่คำพูดของพาร์ตเนอร์ในหน้า 2.5 กระจุกอยู่ตรงนี้ Rob Reilly ประธานเจ้าหน้าที่ฝ่ายสร้างสรรค์ระดับโลกของ WPP ยกความแม่นยำของข้อความให้เป็น "ความก้าวกระโดดที่แท้จริง" ควบคู่กับการแก้ไขด้วยภาษาธรรมชาติ ส่วน Vanessa Salvo จาก Shutterstock วางตัวชี้วัดไว้ที่ว่าโมเดล "แปลงเจตนาให้เป็นผลงานที่สม่ำเสมอและพร้อมใช้งานจริง" ได้หรือไม่ ทั้งแพ็กเกจสินค้า โปสเตอร์ เมนู และชิ้นงานแคมเปญ ล้วนพังที่งานตัวอักษรก่อนจะพังที่ความสมจริง
"อันดับ 2 บน Arena" บอกอะไร และไม่ได้บอกอะไร
ผลของ Arena คือการเปรียบเทียบความชอบของคนแบบปิดชื่อ การขยับ Elo ก้อนใหญ่จึงเป็นสัญญาณจริงว่าคนชอบผลงานของมันมากกว่าในชุดพรอมต์ที่คละกัน นี่เป็นผลลัพธ์ของจริง และ +79 Elo ในราวสองเดือนก็ถือว่าไต่ขึ้นเร็ว
ขณะเดียวกันมันก็เป็นตัวเลขรวมเพียงตัวเดียว ประกาศของ Microsoft ไม่ได้เผยแพร่ค่า Elo รายหมวด ช่วงความเชื่อมั่น ขนาดของชุดพรอมต์ หรือชื่อโมเดลที่อยู่เหนือขึ้นไป ณ วันที่ 14 สิงหาคม 2026 หลายอย่างที่ทีมงานต้องใช้ก่อนตัดสินใจวางระบบยังไม่ถูกเปิดเผย
- ราคา API ต่อภาพของระดับ 2.6
- ความละเอียดดั้งเดิมและความละเอียดสูงสุด
- ตัวเลขความหน่วงของการสร้างและการแก้ไข
- ความสามารถด้านภาพอ้างอิงหลายภาพและการอิงบริบทที่บอกว่า "เร็ว ๆ นี้"
- รายงานทางเทคนิคที่รองรับส่วนต่าง Elo
หมายเหตุ
อันดับรวมบน Arena บอกไม่ได้ว่าโมเดลนั้นเหมาะกับงานเฉพาะของคุณหรือไม่ แพ็กเกจสินค้าที่มีข้อความหนาแน่นในอักษรที่ไม่ใช่ละติน ใบหน้าที่ต้องซ้ำให้เหมือนกันในสิบสองช็อต และไฟล์พื้นหลังโปร่งใสสำหรับ UI เกม คือการทดสอบสามแบบที่ต่างกัน โมเดลหนึ่งนำในภาพรวมได้ แต่ก็แพ้ในข้อใดข้อหนึ่งได้เหมือนกัน
การอ่าน 2.6 อย่างซื่อตรงนั้นแคบแต่ยังมีประโยชน์ คือ Microsoft ไล่ปรับตระกูลนี้อย่างรวดเร็ว และเล็งส่วนที่ดีขึ้นไปที่ผลงานเชิงพาณิชย์ ทั้งข้อความ ภาพบุคคล สินค้า และแบรนด์ มากกว่าจะเล็งไปที่ความตระการตา
ใช้สี่รูปแบบนี้บน OmniArt
ตอนนี้ MAI-Image ยังไม่มีในพื้นที่ทำงานสร้างภาพของ OmniArt แต่รูปแบบพรอมต์มีอยู่ และไม่ผูกกับโมเดลใด เลือกจากว่างานของคุณเป็นงานแบบไหนในสี่แบบนี้
| รูปแบบ | ใช้ทำอะไร | จุดเริ่มต้นบน OmniArt |
|---|---|---|
| พรอมต์ยาวแบบมีโครงสร้าง | โจทย์ที่ต้องตรวจเสื้อผ้า อุปกรณ์ สี และจำนวน | GPT Image 2 |
| พรอมต์สั้นแบบเรียงซ้อนพร้อมคำเปรียบ | ภาพเดี่ยวแนวซินีมาติกและการสำรวจอารมณ์ภาพ | Seedream 5.0 Pro |
| แก้ไขทีละหนึ่งอย่างต่อหนึ่งรอบ | เปลี่ยนสีสินค้า เพิ่มองค์ประกอบ ย้ายฉากแบบคุมได้ | Nano Banana 2 |
| การอ้างอิงย่อความบวกคำบรรยายอัตลักษณ์ | การสร้างฉากที่ตัวแบบต้องคงเดิม | Seedream 5.0 Pro กับภาพอ้างอิง |
| การไล่ปรับต้นทุนต่ำก่อนตัดสินใจ | ทดสอบโครงสร้างพรอมต์แบบราคาถูก | Qwen Image |
แบบฝึกหัดที่ได้ผลคือ รันพรอมต์ดาดฟ้าข้างบนตามเดิมหนึ่งครั้ง แล้วรันอีกครั้งโดยเปลี่ยนชื่อสีเป็นคำคุณศัพท์ ("a pink bottle" "a green wand") และเปลี่ยนจำนวนเป็น "some bubbles" ช่องว่างระหว่างผลลัพธ์สองอันคือมูลค่าของโครงสร้าง วัดจากโมเดลของคุณเอง ไม่ใช่จากแกลเลอรีในหน้าเปิดตัว
หากอยากดูการเทียบกันตรง ๆ เรื่องเลย์เอาต์และความสมจริง อ่านGPT Image 2 เทียบกับ Nano Banana 2 สำหรับความสม่ำเสมอที่ขับด้วยภาพอ้างอิง คู่มือการเปิดตัว Seedream 5.0 Pro อธิบายอินพุตและการควบคุมของมัน ส่วนคู่มือ Qwen Image คือเส้นทางต้นทุนต่ำสำหรับงานร่างช่วงแรก และถ้าอยากอ่านบทวิเคราะห์การเปิดตัวแบบใกล้เคียงกัน Grok Imagine Image 2.0 ให้คำกล่าวอ้างเรื่อง Arena คล้ายกันในสัปดาห์เดียวกัน
คำถามที่พบบ่อย
MAI-Image-2.6 คืออะไร
MAI-Image-2.6 คือโมเดลสร้างภาพจากข้อความของ Microsoft AI ที่ประกาศเมื่อวันที่ 10 สิงหาคม 2026 Microsoft ระบุว่าอยู่อันดับสองบนกระดานจัดอันดับสร้างภาพจากข้อความของ Arena ดีขึ้น +79 Elo จาก MAI-Image-2.5 และการเรนเดอร์ข้อความดีขึ้น +91 Elo
MAI-Image-2.6 ต่างจาก MAI-Image-2.5 อย่างไร
Microsoft ระบุว่าดีขึ้นในทุกหมวดของ Arena ที่วัด โดยเน้นเป็นพิเศษที่การเรนเดอร์ข้อความ ภาพบุคคลและงาน 3D และผลงานเชิงพาณิชย์กับงานสมจริงที่เนี้ยบขึ้นทั้งด้านสินค้า แบรนด์ และซินีมาติก ส่วนอินพุตภาพอ้างอิงหลายภาพ การอิงบริบทที่หนาแน่นขึ้น และการควบคุมการให้เหตุผล รูปแบบ กับความละเอียด ถูกอธิบายว่ากำลังจะมา โดยยังไม่มีรายละเอียดเผยแพร่
ใช้ MAI-Image-2.6 ได้ที่ไหน
ประกาศของ Microsoft ระบุว่าใช้สร้างภาพจากข้อความได้บน Arena จะมาที่ MAI Playground ในช่วงปลายสัปดาห์เดียวกัน แล้วทยอยเปิดใช้บน Microsoft Foundry และผลิตภัณฑ์อื่น
OmniArt มี MAI-Image ให้ใช้ไหม
ไม่มี รายการโมเดลสร้างภาพของ OmniArt ไม่มี MAI-Image รูปแบบพรอมต์ในบทความนี้ไม่ผูกกับโมเดลใด จึงใช้กับโมเดลสร้างภาพที่ OmniArt มีให้ได้
ตระกูล MAI-Image-2.5 มีอะไรบ้าง
มีสามตัว คือ MAI-Image-2.5-Pro สำหรับความสม่ำเสมอของวัตถุและการให้เหตุผลเชิงภาพ MAI-Image-2.5 สำหรับการสร้างคุณภาพสูงพร้อมการแก้ไขที่ควบคุมได้ และ MAI-Image-2.5-Flash ที่อธิบายว่าพร้อมใช้งานจริงในราคาไม่ถึงครึ่งของรุ่นเรือธง
รูปแบบพรอมต์เหล่านี้ใช้กับโมเดลอื่นได้ไหม
ได้ ทั้งชื่อสี จำนวนที่ระบุชัด บล็อกพื้นหลังที่ล้อมแยกไว้ จุดอ้างอิงมาตราส่วน การแก้ไขทีละหนึ่งอย่าง และคำเปรียบที่แบกองค์ประกอบภาพ ล้วนเป็นเทคนิคพรอมต์ทั่วไป สิ่งที่ต่างกันระหว่างโมเดลคือแต่ละข้อถูกทำตามอย่างสม่ำเสมอแค่ไหน ซึ่งควรลองกับโมเดลที่คุณใช้จริง
เริ่มต้นบน OmniArt
เปิดพื้นที่ทำงานสร้างภาพของ OmniArt แล้วรันโจทย์เดียวผ่านสองในสี่รูปแบบข้างบน คือเวอร์ชันยาวแบบมีโครงสร้างและเวอร์ชันสั้นแบบเรียงซ้อนของไอเดียเดียวกัน คงตัวแบบไว้เหมือนเดิมแล้วเปลี่ยนเฉพาะรูปแบบของพรอมต์ การเทียบเพียงครั้งเดียวนี้จะบอกเรื่องโมเดลของคุณได้มากกว่าอันดับบนกระดานใด ๆ
จากนั้นให้ถือว่าการแก้ไขเป็นงานอีกส่วนหนึ่ง คือเลือกภาพหนึ่งภาพให้ผ่านก่อน แล้วเปลี่ยนหนึ่งอย่างต่อหนึ่งพรอมต์ และตรวจรายละเอียดที่คุณให้ความสำคัญหลังทุกรอบ OmniArt รวมโมเดลภาพ วิดีโอ เสียง และเพลงไว้ในพื้นที่ทำงานเดียว ภาพนิ่งที่ผ่านแล้วจึงไปต่อเป็นภาพเคลื่อนไหวได้โดยไม่ต้องเปลี่ยนเครื่องมือ และเมื่อโมเดลใหม่พิสูจน์ตัวเองจนได้เข้ามาอยู่ในรายการ วิธีเขียนพรอมต์ที่คุณฝึกไว้แล้วก็ตามไปด้วย
พร้อมสร้างหรือยัง?
เริ่มสร้างคอนเทนต์ที่ยอดเยี่ยมด้วย AI