IndustryMô hình và insight14 phút đọc

Rò rỉ Gemini Omni: mô hình video của Google có thể mang lại gì

Trước thềm Google I/O 2026, các rò rỉ chỉ về một mô hình video mang tên Gemini Omni. Đâu là điều đã xác nhận, đâu vẫn là tin đồn, và người sáng tạo trên OmniArt nên làm gì trong tuần này.

Đội ngũ OmniArt
Rò rỉ Gemini Omni: mô hình video của Google có thể mang lại gì

Ghi chú

Cập nhật (13/07/2026): Gemini Omni Flash hiện đã có trên OmniArt cho việc tạo video tiêu chuẩn từ văn bản và ảnh tham chiếu. Các điều khiển chỉnh sửa hội thoại có trạng thái của Google chưa được mở trong giao diện OmniArt; những mô tả khả dụng cũ bên dưới phản ánh thời điểm bài viết được xuất bản.

Google I/O 2026 diễn ra vào ngày 19–20 tháng 5, và góc video AI của internet đã sống trước bài keynote từ nhiều tuần nay. Lý do nằm ở đúng một chuỗi UI được phát hiện trong tab video của Gemini: "Start with an idea or try a template. Powered by Omni." Từ một dòng đó, ba đợt rò rỉ đã dựng nên bức tranh khá đầy đủ về một mô hình video chưa công bố của Google — tạm gọi là Gemini Omni — thứ có thể thay thế Veo 3.1, đứng song song với nó, hoặc âm thầm nâng cấp toàn bộ hạ tầng sinh nội dung của Google.

Bài viết này dành cho người sáng tạo trên OmniArt đang cân nhắc nên làm gì — nếu có — trước ngày thứ Ba. Chúng tôi tách các tín hiệu đã xác nhận khỏi suy đoán, đi qua ba khả năng hợp lý về danh tính của Omni, và khép lại bằng bước đi thực tế cho những ai phải giao video ngay trong tuần này.

Chúng ta thực sự biết gì (và chưa biết gì)

Tín hiệuTrạng tháiÝ nghĩa
Chuỗi UI "Powered by Omni" trong tab video của GeminiĐã xác nhận qua ảnh chụp màn hìnhMột sản phẩm tên Omni đã được dựng sẵn để phát hành sau feature flag
ID mô hình bard_eac_video_generation_omniBáo cáo qua việc kiểm tra ứng dụngMột định danh nội bộ đã được nối vào pipeline video của Gemini
Giới hạn clip 10 giâyNgười thử nghiệm sớm báo cáoGợi ý ràng buộc ở giai đoạn đầu hoặc ở bậc phổ thông, không phải bậc API
"Remix your videos, edit directly in chat, try a template"Nội dung tính năng được báo cáoQuy trình chỉnh sửa và remix, không chỉ tạo mới
Độ mạch lạc của chữ (ví dụ phương trình toán)Báo cáo trong các bài đưa tin demoBước tiến kỹ thuật đáng chú ý cho typography bên trong video
Âm thanh gốcChưa xác nhậnVeo 3.1 có âm thanh gốc; trạng thái của Omni chưa rõ
Quyền truy cập APIChưa xác nhậnLập trình viên không nên lên kế hoạch dựa trên mức khả dụng chưa xác nhận
Thay thế, bổ sung hay đổi tên Veo 3.1Câu hỏi còn bỏ ngỏCâu hỏi quan trọng nhất với các đội sản xuất

Tóm tắt thành thật: một sản phẩm video của Google tên Omni đủ thật để đã có nội dung UI viết sẵn cho nó, nhưng mọi khẳng định về kiến trúc vẫn chỉ là suy luận từ chuỗi trong ứng dụng và báo cáo của người thử nghiệm.

Ba kịch bản danh tính

Phần lớn sự bất định gói lại thành ba kịch bản về việc Omni thực sự là gì. Mỗi kịch bản kéo theo hệ quả khác nhau cho dàn công cụ video AI mà người sáng tạo đang dựa vào.

Kịch bản 1 — Đổi thương hiệu Veo cho người dùng phổ thông

Cách đọc đơn giản nhất: Omni là tên gọi hướng người dùng phổ thông thay cho thương hiệu "Veo" bên trong Gemini, tương tự cách Google gom toàn bộ mảng tạo ảnh về dưới cái tên "Nano Banana." Veo vẫn là cỗ máy bên dưới; Omni chỉ là bề mặt mà đa số người dùng nhìn thấy.

Nếu đúng, hãy chờ đợi: thay đổi khả năng không đáng kể so với Veo 3.1, vẫn là giới hạn 8–10 giây ở bậc phổ thông, và Veo tiếp tục đi theo hướng doanh nghiệp/API.

Kịch bản 2 — Mô hình video gốc Gemini

Cách đọc thứ hai: Omni là một phiên bản kiến trúc Gemini được tinh chỉnh riêng cho video, chạy song song với nhánh Veo. Veo vẫn là mô hình video chuyên dụng cho API và doanh nghiệp; Omni là mô hình phổ thông hưởng lợi từ năng lực ngôn ngữ và suy luận của Gemini.

Nếu đúng, hãy chờ đợi: bám prompt tốt hơn, typography trong video sạch hơn (các báo cáo về phương trình toán ủng hộ điều này), và tích hợp chặt hơn với việc chỉnh sửa qua hội thoại của Gemini.

Kịch bản 3 — Mô hình omni-modal thực thụ

Cách đọc tham vọng nhất: Omni là một hệ thống hợp nhất duy nhất, sinh văn bản, ảnh, video và âm thanh một cách gốc từ cùng một mô hình. Chính cái tên "Omni" cho thấy đây là hướng Google đang định vị, kể cả khi bản ra mắt chưa đạt tới mức đầy đủ.

Nếu đúng, hãy chờ đợi: quy trình dịch chuyển đáng kể sang chỉnh sửa bằng hội thoại, chuyển giao đa phương thức ngay trong khung chat, và về dài hạn là thách thức với kiểu xếp chồng mỗi phương thức một mô hình mà phần còn lại của ngành đang dùng.

Kết quả nhiều khả năng nhất tại I/O là pha trộn giữa kịch bản 2 và 3 — một mô hình video gốc Gemini với tham vọng omni-modal nhưng bị giới hạn ở bậc phổ thông khi ra mắt.

Vì sao các tính năng được báo cáo lại quan trọng

Ba trong số các tính năng được báo cáo đáng chú ý hơn cả câu hỏi về danh tính mô hình, bởi chúng cho thấy cả nhóm sản phẩm video AI đang đi về đâu, bất kể ai ra mắt trước.

Chỉnh sửa bằng hội thoại thành mặc định

"Remix your videos, edit directly in chat" là phần rò rỉ làm thay đổi câu chuyện về quy trình. Đa số công cụ video AI hôm nay vẫn là tạo rồi tải về — bạn viết prompt, chờ, lưu clip, rồi viết lại prompt để sửa. Chỉnh sửa qua hội thoại định nghĩa lại mô hình như một cộng sự liên tục: "make the second shot warmer," "swap the background," "extend by three seconds." Nếu Omni làm tốt việc này, mọi mô hình khác đều chịu sức ép phải theo.

Template là lối vào

Template hạ thấp rào cản viết prompt cho người mới — đó là lợi ích thật. Nhưng chúng cũng làm phẳng độ đa dạng của kết quả khi ai cũng bắt đầu từ cùng một prompt dùng chung. Câu hỏi đáng quan tâm không phải template có ra mắt hay không, mà là chúng có thực sự vượt được một bản brief viết tử tế từ đầu hay không.

Chữ bên trong video

Việc phương trình toán hiển thị sạch bên trong video được tạo ra là điều đáng chú ý về mặt kỹ thuật. Typography trong video vốn là điểm yếu lộ rõ của mọi mô hình lớn. Nếu Omni xử lý được typography phức tạp một cách ổn định, điều đó mở ra các quy trình video giải thích, giáo dục và motion graphics vốn trước đây phải qua một lượt ghép hậu kỳ.

Omni sẽ nằm ở đâu trong dàn mô hình

Với người sáng tạo vốn đã làm việc trên nhiều mô hình video AI, câu hỏi đúng là Omni nằm ở đâu, chứ không phải nó có thắng hay không. Dựa trên các tính năng được báo cáo, hình dung sẽ như sau:

Khả năngGemini Omni (báo cáo)Veo 3.1 (đã xác nhận)V6 / R1Sora 2
Thời lượng10 giây (báo cáo)Tới 8 giây1–15 giâyTới 20 giây
Độ phân giảiChưa rõTới 1080pTới 1080p1080p, có 4K
Âm thanh gốcChưa xác nhậnĐã xác nhậnCó sẵnCó sẵn
Chỉnh sửa / remixBáo cáo: remix, chat, templateHạn chếModify, Extend, nhiều clipHạn chế
Quyền truy cập APIChưa xác nhậnĐã cóĐã cóĐã có
Mạnh nhất ởChỉnh sửa hội thoại (báo cáo)4K gốc, âm thanh không gianĐiều khiển điện ảnh, thời gian thựcMột take dài liền mạch

Nếu bộ tính năng bị rò rỉ là đúng, làn đường của Omni là "video phổ thông theo hội thoại" — điểm rơi tốt cho nội dung mạng xã hội làm nhanh và cho việc lặp lại ngay trong khung chat. Các làn điện ảnh, phát sóng và multi-shot vẫn thuộc về những cái tên dẫn đầu hiện tại cho tới khi có bằng chứng ngược lại.

Điều này có nghĩa gì với người sáng tạo trong tuần này

Cám dỗ khi gặp một rò rỉ trước công bố là ngồi chờ. Chúng tôi khuyên ngược lại với bất kỳ ai có sản phẩm phải giao trong mười ngày tới.

Cảnh báo

Hãy coi mọi tính năng Omni xuất hiện trên báo chí là tín hiệu trước công bố, không phải khả năng đã xác nhận. Kế hoạch dựng trên thông số được báo cáo chỉ sống sót qua buổi keynote khoảng một nửa số lần.

Bước đi thực tế phụ thuộc vào việc bạn đang giao thứ gì.

Nếu bạn có video phải giao trong tuần này

Hãy dùng những gì đang chạy và đã được chứng minh. V6 cho cảnh quay điện ảnh, Veo 3.1 cho bản dựng phát sóng 4K gốc, Kling 3.0 cho các biến thể mạng xã hội đa ngôn ngữ, HappyHorse 1.0 cho vòng lặp nhanh. Bên trong OmniArt, tất cả chỉ cách nhau một cú nhấp, nên bạn không cần cam kết với một công cụ duy nhất trước buổi keynote.

Nếu bạn đang lên kế hoạch sản xuất quý 3

Hãy xây brief quanh khả năng, không quanh thương hiệu. Ghi lại đúng thứ bạn cần — thời lượng, độ phân giải, âm thanh, cách chỉnh sửa, khóa nhân vật — rồi để dàn mô hình sau I/O đấu thầu lại công việc trong hai tuần nữa. Nếu Omni ra mắt và làm được, bản brief cắm thẳng vào nó mà không phải viết lại phần còn lại của pipeline.

Nếu bạn đang tìm hiểu và học

Hãy xem keynote. Lưu lại các bài thử, đừng lưu ý kiến. Thứ giá trị nhất bạn có thể cầm trong tay sau ngày ra mắt là một lượt so sánh ngang hàng — cùng brief, cùng ảnh tham chiếu, cùng thang chấm — giữa bất cứ thứ gì được công bố, Veo 3.1 và dàn mô hình đã quen thuộc.

Dịch chuyển lớn hơn mà Omni báo hiệu

Dù Omni cuối cùng là gì, các rò rỉ kể một câu chuyện rõ ràng về cả nhóm sản phẩm hơn là về riêng Google.

Mặt trận cạnh tranh đang dịch chuyển. Chất lượng hình ảnh ở lượt tạo đầu tiên đang hội tụ giữa những cái tên dẫn đầu. Khác biệt thật sự đang chuyển sang khả năng điều khiển, tính nhất quán multi-shot, đồng bộ hình và tiếng, chỉnh sửa qua hội thoại, cùng mức độ khớp của một mô hình với quy trình làm việc thật — chứ không phải mô hình nào thắng một bài đo chuẩn.

Chi phí vẫn là chuyện có thật. Việc các báo cáo liên tục nhắc tới giới hạn sử dụng và tab tiêu thụ trong giao diện Omni xác nhận rằng tạo video độ trung thực cao vẫn rất tốn tính toán khi chạy ở quy mô lớn. Template và trần thời lượng clip ngắn một phần là trải nghiệm, một phần là bài toán kinh tế.

Bản quyền và remix khó hơn. Quy trình remix chồng lên video đã sinh ra kéo theo các câu hỏi về sở hữu trí tuệ, sự đồng ý và mục đích thương mại mà luồng văn bản sang video chưa bộc lộ hết. Đội nào định đưa kết quả dạng remix vào quảng cáo trả tiền nên chuẩn bị sẵn danh sách kiểm tra quyền trước khi tính năng ra mắt.

OmniArt đã xử lý đợt ra mắt thế nào

Bài viết này ghi lại đợt rò rỉ trước I/O đúng như nó trông vào ngày 13/5/2026. Sau đó Google ra mắt Gemini Omni Flash, mở quyền truy cập cho nhà phát triển, và mô hình này đã có mặt trong không gian video của OmniArt cho các lượt tạo tiêu chuẩn từ văn bản và ảnh dẫn hướng.

Giờ nó đứng cạnh Veo 3.1, Sora 2, V6, Kling 3.0, Happy Horse 1.0, Seedance 2.0, Runway Gen-4.5, Hailuo và Grok Imagine — một ngữ pháp prompt, một số dư, một nơi để so sánh nó với phần còn lại. Các điều khiển chỉnh sửa bằng hội thoại có trạng thái của Google hiện chưa được mở trong OmniArt.

Về bối cảnh dàn mô hình video hiện tại, xem tour mô hình video của OmniArt. Về cách viết brief chuyển sạch sang bất kỳ mô hình nào cuối cùng chạy nó, xem hướng dẫn viết prompt.

FAQ

Gemini Omni đã được công bố chính thức chưa?

Rồi. Bài viết này được viết trước khi công bố; sau đó Google ra mắt Gemini Omni Flash tại I/O 2026 và mở quyền truy cập cho nhà phát triển vào ngày 30/6. Gemini Omni Flash hiện đã có trên OmniArt cho các lượt tạo tiêu chuẩn.

Gemini Omni có thay thế Veo 3.1 không?

Chưa rõ. Ba kịch bản hợp lý là: Omni đổi tên Veo cho các bề mặt phổ thông, Omni chạy song song với Veo như một mô hình phổ thông gốc Gemini, hoặc Omni là một hệ thống omni-modal hợp nhất thực thụ. Pha trộn giữa kịch bản thứ hai và thứ ba là khả năng cao nhất khi ra mắt.

Những tính năng nào được báo cáo cho Gemini Omni?

Các tính năng được báo cáo gồm chỉnh sửa bằng hội thoại ngay trong khung chat Gemini, quy trình remix, template prompt, độ mạch lạc cao của chữ bên trong video (phương trình toán hiển thị sạch) và giới hạn clip 10 giây. Chưa tính năng nào được xác nhận chính thức.

Có nên chờ Omni trước khi sản xuất video trong tuần này?

Không. Hãy dùng các mô hình đang chạy và ổn định hôm nay. Dàn hiện tại đã phủ cảnh quay điện ảnh, phát sóng 4K gốc, mạng xã hội đa ngôn ngữ, vòng lặp nhanh, tính liên tục multi-shot và VFX ở mức khung hình, và Gemini Omni Flash giờ cũng là một trong những lựa chọn sẵn có đó.

Omni so với Veo 3.1 thì thế nào?

Lợi thế của Omni là chỉnh sửa bằng hội thoại và đầu vào linh hoạt; điểm mạnh của Veo 3.1 là âm thanh gốc và đầu ra 4K. Cả hai giờ đều dùng được cho lượt tạo tiêu chuẩn trong OmniArt, nên bạn có thể so sánh chúng trên cùng một brief; hãy dùng chính các API của Google khi phép thử bắt buộc phải có chỉnh sửa hội thoại có trạng thái.

Sẵn sàng sáng tạo?

Bắt đầu tạo nội dung tuyệt vời bằng AI

Bắt đầu miễn phí