Industry模型與觀察閱讀時間 10 分鐘

DeepSeek V4 多模態:創作者該知道的事

DeepSeek V4 多模態——100 萬 token 上下文、V4-Flash 與 V4-Pro 的價格、CSA + HCA 架構,以及它在 OmniArt 這套工具鏈裡對創作者的意義。

OmniArt 團隊
DeepSeek V4 多模態:創作者該知道的事

DeepSeek V4 在 2026 年 4 月 24 日上線,兩個級距、100 萬 token 上下文、38.4 萬 token 的最大輸出長度。它不是影片模型,也沒打算取代任何一個。V4 真正改變的是視覺工具鏈上面那一層——brief、分鏡、品牌手冊,以及那種把「做一檔行銷」變成「做一檔尊重我們今年每一場拍攝的行銷」的長上下文檢索。這篇談 DeepSeek V4 是什麼、對用 OmniArt 的創作者有什麼用,以及它在整份模型名單裡站在哪個位置。

DeepSeek V4 是什麼

DeepSeek V4 是一個長上下文的推理與工具呼叫模型,有兩個正式級距——V4-Flash 和 V4-Pro——都透過 api.deepseek.com 上相容 OpenAI 的 API 提供。100 萬 token 上下文加上結構化工具呼叫是招牌;底下的架構用的是壓縮稀疏注意力(CSA)加上重壓縮注意力(HCA),這正是讓成本不隨上下文長度線性成長的關鍵。

級距總參數量活躍參數量預訓練 token輸出價格輸入價格(快取未命中)
V4-Flash2840 億130 億32 兆每 100 萬 token 2 元人民幣(約 0.28 美元)每 100 萬 token 1 元人民幣
V4-Pro1.6 兆490 億33 兆每 100 萬 token 24 元人民幣(約 3.48 美元)每 100 萬 token 12 元人民幣

兩個級距的輸出上限都是 38.4 萬 token。兩個級距也都用同一個模型提供「思考」和「非思考」兩種模式——V4 把 V3 和 R1 以前分開處理的事情合而為一。

一段話講完架構

有意思的地方在 CSA + HCA。壓縮稀疏注意力在每一層把注意力收窄到少數幾個資訊量高的 token,重壓縮注意力再在這之上疊一層密集壓縮。這個組合讓 100 萬上下文變得付得起,而不只是一座跑分獎盃。DeepSeek 訓練和部署 V4 用的是華為昇騰等級的基礎設施,而不是只跑 CUDA 的那一套,推論最佳化則由寒武紀的 vLLM 適配版負責。

值得引用的跑分

跑分項目結果
Arena.ai 開源程式碼競技場V4-Pro 第 3 名
Arena.ai 總榜V4-Pro 第 14 名
Vals AI Vibe Code Benchmark開放權重模型中 V4 第 1 名
Vibe Code 對比 V3.2效能約 10 倍提升
與閉源模型的對照組在部分情境下勝過 Gemini 3.1 Pro

DeepSeek 自己的說法對差距很誠實:V4「在複雜知識與推理能力上,仍然落後最頂尖的閉源系統大約三到六個月」。對多數創作者的流程來說,這個差距構不成限制——但知道它存在還是有價值。

V3、R1 和 V4 之間變了什麼

V3 是一個很強的文字與程式碼模型。R1 是一個思維鏈推理模型。V4 把兩種模式收進同一個模型,思考和非思考的推論路徑可以自己選。上下文從 128K(V3)擴到 100 萬(V4)。工具呼叫和長上下文檢索現在是一等公民,而不是後來補上去的。

能力V3R1V4
上下文128K128K100 萬
推理模式沒有有(預設)可切換
工具呼叫有限有限一等公民
多模態沒有沒有在路線圖上(進行中)

這裡的「多模態」是什麼意思——以及目前還不是什麼

DeepSeek 這次發表刻意把多模態的部分講得很保守。發布說明把多模態的功能矩陣描述為「持續演進中」——今天在 API 層面上,還沒有公開的圖片、影片或音訊入口。這不是批評,這是路線圖訊號。V4 現階段對創作者的價值,在於包在視覺工具鏈外面的長上下文文字與工具驅動流程,而不是在工具鏈裡面。

等多模態入口真的上線,它們會像 GPT Image 2 和其他模型一樣,收進 OmniArt 的模型選單。在那之前,把 V4 當成那顆負責寫 brief 的腦。

創作者今天實際拿 V4 做什麼

現在在 OmniArt 上,有三種用法確實划得來。

1. 用 100 萬 token 上下文裝下整本品牌手冊

100 萬上下文可以輕鬆裝下一整本品牌手冊、每一檔發布過的行銷、語氣指引、角色設定表、禁用語清單,以及過去十二個月的貼文文案。把這些全部釘成系統上下文,再請 V4 起草一份上市 brief。輸出會照顧到整套文件,而不需要繞一趟向量檢索。

2. 長篇的結構化生成

輸出上限是 38.4 萬 token。這足夠一次寫完一整本敘事聖經、一份六集的分鏡加鏡頭表,或一份 50 頁的在地化規格書。做比較短的東西時,V4-Flash 每 100 萬輸出 token 約 0.28 美元,是目前起草長篇結構化內容最便宜又靠得住的方式。

3. 以工具呼叫為核心、驅動視覺工具鏈的 agent

把 V4 接到圖片和影片生成器上時,真正關鍵的是它工具呼叫的紀律。把 OmniArt 的 API 介面交給它,給它一份 brief,它會一顆鏡頭一顆鏡頭地提出模型、提示詞和參考素材。OmniArt 正在圍繞這個模式做整合。

V4-Flash 和 V4-Pro 怎麼選

價格比大約是 12 倍——Flash 給大量發想,Pro 給那些深度比 token 成本更重要的場合。

工作選這個
腦力激盪、起草、標題迭代V4-Flash
品牌手冊層級的推理、敘事建構V4-Pro
針對歷年行銷資料的長上下文檢索V4-Pro
驅動圖片/影片的工具型 agent 迴圈規劃用 V4-Pro,執行用 V4-Flash

V4 在 OmniArt 這套工具鏈裡的位置

V4 不是用來取代 OmniArt 裡的圖片和影片模型的,它是它們上面那層規劃。逐漸成形的模式是這樣:

層級工作模型
規劃brief、分鏡、鏡頭表、品牌推理DeepSeek V4-Pro
圖片靜態圖、參考影格、版面Nano Banana Pro、GPT Image 2、Seedream 5.0 Lite
影片動態鏡頭、多鏡頭序列V6/BACH、Sora 2、Veo 3、Seedance 2.0、HappyHorse 1.0
迭代換風格、延長、修改Grok Imagine、Runway Gen-4.5

說明

V4 的多模態入口在 DeepSeek 公開的路線圖上,但還沒進 OmniArt 的模型選單。它們上線那天我們就會發一篇後續——點數、建議提示詞,以及它們在工具鏈裡的位置。

接下來要盯什麼

未來兩個月有三個訊號值得追。

  • 多模態 API 入口。 DeepSeek 一公布,模型選單的討論就會重開。
  • 蒸餾出來的 V4 變體。 先前的報導提過 V4 Lite 和一個更小的 V4 版本。兩者都可能改變大量工具呼叫 agent 的成本結構。
  • 硬體這條線。 華為昇騰等級的推論路徑,對那些難以部署純 CUDA 模型的地區很重要。

在 OmniArt 上開始

DeepSeek V4 還不是 OmniArt 選單裡點一下就能用的模型——它目前的家在 API。如果你今天就想拿它當 OmniArt 上面的規劃層,就透過 api.deepseek.com 這個相容 OpenAI 的端點驅動它,再把它的工具呼叫介面指向 OmniArt 的 API 來生成圖片和影片。

想補視覺這一側的背景知識,GPT Image 2 對比 Nano Banana 2談的是旗艦圖片模型怎麼選,圖片生成影片精選清單則涵蓋了 V4 未來會去驅動的那些影片端選項。

準備好開始創作了嗎?

用 AI 生成精彩內容

免費開始