DeepSeek V4 多模態:創作者該知道的事
DeepSeek V4 多模態——100 萬 token 上下文、V4-Flash 與 V4-Pro 的價格、CSA + HCA 架構,以及它在 OmniArt 這套工具鏈裡對創作者的意義。

DeepSeek V4 在 2026 年 4 月 24 日上線,兩個級距、100 萬 token 上下文、38.4 萬 token 的最大輸出長度。它不是影片模型,也沒打算取代任何一個。V4 真正改變的是視覺工具鏈上面那一層——brief、分鏡、品牌手冊,以及那種把「做一檔行銷」變成「做一檔尊重我們今年每一場拍攝的行銷」的長上下文檢索。這篇談 DeepSeek V4 是什麼、對用 OmniArt 的創作者有什麼用,以及它在整份模型名單裡站在哪個位置。
DeepSeek V4 是什麼
DeepSeek V4 是一個長上下文的推理與工具呼叫模型,有兩個正式級距——V4-Flash 和 V4-Pro——都透過 api.deepseek.com 上相容 OpenAI 的 API 提供。100 萬 token 上下文加上結構化工具呼叫是招牌;底下的架構用的是壓縮稀疏注意力(CSA)加上重壓縮注意力(HCA),這正是讓成本不隨上下文長度線性成長的關鍵。
| 級距 | 總參數量 | 活躍參數量 | 預訓練 token | 輸出價格 | 輸入價格(快取未命中) |
|---|---|---|---|---|---|
| V4-Flash | 2840 億 | 130 億 | 32 兆 | 每 100 萬 token 2 元人民幣(約 0.28 美元) | 每 100 萬 token 1 元人民幣 |
| V4-Pro | 1.6 兆 | 490 億 | 33 兆 | 每 100 萬 token 24 元人民幣(約 3.48 美元) | 每 100 萬 token 12 元人民幣 |
兩個級距的輸出上限都是 38.4 萬 token。兩個級距也都用同一個模型提供「思考」和「非思考」兩種模式——V4 把 V3 和 R1 以前分開處理的事情合而為一。
一段話講完架構
有意思的地方在 CSA + HCA。壓縮稀疏注意力在每一層把注意力收窄到少數幾個資訊量高的 token,重壓縮注意力再在這之上疊一層密集壓縮。這個組合讓 100 萬上下文變得付得起,而不只是一座跑分獎盃。DeepSeek 訓練和部署 V4 用的是華為昇騰等級的基礎設施,而不是只跑 CUDA 的那一套,推論最佳化則由寒武紀的 vLLM 適配版負責。
值得引用的跑分
| 跑分項目 | 結果 |
|---|---|
| Arena.ai 開源程式碼競技場 | V4-Pro 第 3 名 |
| Arena.ai 總榜 | V4-Pro 第 14 名 |
| Vals AI Vibe Code Benchmark | 開放權重模型中 V4 第 1 名 |
| Vibe Code 對比 V3.2 | 效能約 10 倍提升 |
| 與閉源模型的對照組 | 在部分情境下勝過 Gemini 3.1 Pro |
DeepSeek 自己的說法對差距很誠實:V4「在複雜知識與推理能力上,仍然落後最頂尖的閉源系統大約三到六個月」。對多數創作者的流程來說,這個差距構不成限制——但知道它存在還是有價值。
V3、R1 和 V4 之間變了什麼
V3 是一個很強的文字與程式碼模型。R1 是一個思維鏈推理模型。V4 把兩種模式收進同一個模型,思考和非思考的推論路徑可以自己選。上下文從 128K(V3)擴到 100 萬(V4)。工具呼叫和長上下文檢索現在是一等公民,而不是後來補上去的。
| 能力 | V3 | R1 | V4 |
|---|---|---|---|
| 上下文 | 128K | 128K | 100 萬 |
| 推理模式 | 沒有 | 有(預設) | 可切換 |
| 工具呼叫 | 有限 | 有限 | 一等公民 |
| 多模態 | 沒有 | 沒有 | 在路線圖上(進行中) |
這裡的「多模態」是什麼意思——以及目前還不是什麼
DeepSeek 這次發表刻意把多模態的部分講得很保守。發布說明把多模態的功能矩陣描述為「持續演進中」——今天在 API 層面上,還沒有公開的圖片、影片或音訊入口。這不是批評,這是路線圖訊號。V4 現階段對創作者的價值,在於包在視覺工具鏈外面的長上下文文字與工具驅動流程,而不是在工具鏈裡面。
等多模態入口真的上線,它們會像 GPT Image 2 和其他模型一樣,收進 OmniArt 的模型選單。在那之前,把 V4 當成那顆負責寫 brief 的腦。
創作者今天實際拿 V4 做什麼
現在在 OmniArt 上,有三種用法確實划得來。
1. 用 100 萬 token 上下文裝下整本品牌手冊
100 萬上下文可以輕鬆裝下一整本品牌手冊、每一檔發布過的行銷、語氣指引、角色設定表、禁用語清單,以及過去十二個月的貼文文案。把這些全部釘成系統上下文,再請 V4 起草一份上市 brief。輸出會照顧到整套文件,而不需要繞一趟向量檢索。
2. 長篇的結構化生成
輸出上限是 38.4 萬 token。這足夠一次寫完一整本敘事聖經、一份六集的分鏡加鏡頭表,或一份 50 頁的在地化規格書。做比較短的東西時,V4-Flash 每 100 萬輸出 token 約 0.28 美元,是目前起草長篇結構化內容最便宜又靠得住的方式。
3. 以工具呼叫為核心、驅動視覺工具鏈的 agent
把 V4 接到圖片和影片生成器上時,真正關鍵的是它工具呼叫的紀律。把 OmniArt 的 API 介面交給它,給它一份 brief,它會一顆鏡頭一顆鏡頭地提出模型、提示詞和參考素材。OmniArt 正在圍繞這個模式做整合。
V4-Flash 和 V4-Pro 怎麼選
價格比大約是 12 倍——Flash 給大量發想,Pro 給那些深度比 token 成本更重要的場合。
| 工作 | 選這個 |
|---|---|
| 腦力激盪、起草、標題迭代 | V4-Flash |
| 品牌手冊層級的推理、敘事建構 | V4-Pro |
| 針對歷年行銷資料的長上下文檢索 | V4-Pro |
| 驅動圖片/影片的工具型 agent 迴圈 | 規劃用 V4-Pro,執行用 V4-Flash |
V4 在 OmniArt 這套工具鏈裡的位置
V4 不是用來取代 OmniArt 裡的圖片和影片模型的,它是它們上面那層規劃。逐漸成形的模式是這樣:
| 層級 | 工作 | 模型 |
|---|---|---|
| 規劃 | brief、分鏡、鏡頭表、品牌推理 | DeepSeek V4-Pro |
| 圖片 | 靜態圖、參考影格、版面 | Nano Banana Pro、GPT Image 2、Seedream 5.0 Lite |
| 影片 | 動態鏡頭、多鏡頭序列 | V6/BACH、Sora 2、Veo 3、Seedance 2.0、HappyHorse 1.0 |
| 迭代 | 換風格、延長、修改 | Grok Imagine、Runway Gen-4.5 |
說明
V4 的多模態入口在 DeepSeek 公開的路線圖上,但還沒進 OmniArt 的模型選單。它們上線那天我們就會發一篇後續——點數、建議提示詞,以及它們在工具鏈裡的位置。
接下來要盯什麼
未來兩個月有三個訊號值得追。
- 多模態 API 入口。 DeepSeek 一公布,模型選單的討論就會重開。
- 蒸餾出來的 V4 變體。 先前的報導提過 V4 Lite 和一個更小的 V4 版本。兩者都可能改變大量工具呼叫 agent 的成本結構。
- 硬體這條線。 華為昇騰等級的推論路徑,對那些難以部署純 CUDA 模型的地區很重要。
在 OmniArt 上開始
DeepSeek V4 還不是 OmniArt 選單裡點一下就能用的模型——它目前的家在 API。如果你今天就想拿它當 OmniArt 上面的規劃層,就透過 api.deepseek.com 這個相容 OpenAI 的端點驅動它,再把它的工具呼叫介面指向 OmniArt 的 API 來生成圖片和影片。
想補視覺這一側的背景知識,GPT Image 2 對比 Nano Banana 2談的是旗艦圖片模型怎麼選,圖片生成影片精選清單則涵蓋了 V4 未來會去驅動的那些影片端選項。
準備好開始創作了嗎?
用 AI 生成精彩內容