中國人工智慧新創公司DeepSeek在8月21日透過官方社群平台宣布,推出新款實驗性視覺理解模型V4-Flash-Vision-Exp,正式為其旗艦純文本模型V4-Flash補上「視覺」這塊拼圖。這家公司宣稱,這款新工具的性能已經逼近美國競爭對手Anthropic的高階模型Claude Opus 4.8。
說起來,DeepSeek這波操作其實不算太令人意外。他們先前就已經推出過DeepSeek-VL系列的多模態與視覺模型,但這次不一樣的是,他們直接把多模態能力塞進最先進的V4-Flash系列裡頭,等於是在自家最強的文本模型基礎上,長出能夠理解圖像和螢幕截圖的眼睛。根據DeepSeek官方說法,V4-Flash-Vision-Exp在純文本能力——包含Agent任務、推理、世界知識等方面——與V4-Flash正式版維持相同水準,而在需要視覺理解的Agent Benchmark上,則實現了「大幅躍升」。
不只「看」圖,還要「執行」任務
跟過去單純認圖、辨識物件的視覺模型不同,這款新模型的關鍵賣點在於「執行任務」。也就是說,它不只能分析圖像內容,還能根據視覺提示採取行動。比方說,你丟一張複雜的儀表板截圖給它,它不只能讀出數字,還能理解脈絡、做出判斷或後續操作。這種「視覺+行動」的能力,正是目前AI業界最熱門的多模態Agent方向。
從技術規格來看,這款模型已經在DeepSeek的API平台上線,開發者可以透過Chat Completions、Messages、Responses三種格式進行調用。圖片傳入方式也給足彈性,支援base64內聯、外部URL,以及Files API三種途徑,而且支援圖文混合輸入。簡單說,開發者要把它串進各種Agent工具裡頭,技術門檻並不算高。
中國AI追趕速度,比想像中還快
這則新聞最值得關注的,其實不是DeepSeek又出了一個新模型,而是他們把「逼近Anthropic Opus 4.8」這句話直接寫了出來。Anthropic的Claude Opus系列向來被視為全球頂尖的AI模型之一,尤其在複雜推理和程式碼生成領域表現突出。如果DeepSeek的宣稱屬實,那就代表中國AI新創在視覺理解與多模態Agent這條賽道上,與美國一線團隊的差距已經縮短到「肉眼可見」的程度。
不過話說回來,這裡頭有幾個細節值得推敲。首先,DeepSeek使用的是「逼近」這個詞,而非「超越」或「持平」;其次,他們特別強調這款模型是「實驗性」版本,這意味著它可能還沒經過大規模的壓力測試,實際表現能否穩定輸出,還需要更多第三方評測來驗證。但無論如何,這種宣示本身就傳遞了一個清楚的訊號:中國AI廠商不再只是跟在後面追,他們開始相信自己有能力與最頂尖的對手同台較勁。
編輯觀點:從產業面來看,DeepSeek這次動作最值得注意的不是單一模型的性能,而是「多模態Agent」這個方向正在成為中國AI廠商的戰略主攻點。過去大家比的是誰的文本模型更強、誰的推理更準,但接下來真正的戰場是「能看懂世界、還能動手的AI」。DeepSeek選擇在V4-Flash的基礎上疊加視覺能力,而不是另起爐灶,這個策略非常聰明——它既保住了既有文本能力的優勢,又用最低的成本補上視覺這塊缺口。對開發者來說,這款API的性價比可能會成為一個關鍵變數,畢竟DeepSeek向來以價格優勢著稱,如果性能真的能逼近Opus 4.8,價格卻只有幾分之一,那市場格局很可能會出現鬆動。不過,這一切的前提是:實驗版本進到正式環境之後,能不能經得起真實世界的考驗。
API生態圈的卡位戰
另一個值得留意的角度是「開發者生態」的布局。DeepSeek這次一口氣支援三種API調用格式,還提供三種圖片傳入方式,看得出來他們不是只想賣模型,而是想把自己變成開發者的預設選項之一。這種思維跟OpenAI、Anthropic的做法如出一轍——誰能讓開發者用起來順手、串接成本低,誰就能在生態圈競爭中占據有利位置。
有趣的是,DeepSeek選擇在8月下旬這個時間點發布,剛好卡在許多歐美企業準備編列明年AI預算的前夕。對企業IT決策者來說,如果DeepSeek這款視覺模型的API價格確實有競爭力,他們至少多了一個「中國方案」可以放進採購評估清單裡頭。這不是說他們會立刻換掉原有的供應商,但至少,競爭的天平開始出現了一些傾斜。
後續觀察
目前這款模型僅以實驗版本形式提供,DeepSeek尚未公布正式版本的發布時程,也未揭露具體的定價策略。第三方評測機構是否會針對V4-Flash-Vision-Exp進行獨立測試,將是驗證其性能宣稱的關鍵指標。此外,Anthropic方面目前尚未對此做出任何公開回應,但可以預期的是,美國AI廠商對於中國競爭對手的動向會保持高度警覺。對於開發者和企業用戶來說,現階段的合理策略是:先透過API進行小規模測試,親身驗證這款模型在實際場景中的表現,而不是只看benchmark分數就做出決策。
如果你正在評估多模態AI模型的導入方案,不妨先從DeepSeek的API免費額度開始測試,實際跑過一輪自己的業務場景之後,再來判斷「逼近Opus 4.8」這句話對你來說到底是行銷話術,還是真正有感的技術突破。
本文改寫整理自公開新聞來源,原始報導由科技新報發布。
常見問題 FAQ
DeepSeek V4-Flash-Vision-Exp跟原本的V4-Flash有什麼不同?
最大的差異在於多模態能力。V4-Flash原本是純文本模型,而V4-Flash-Vision-Exp新增了圖像理解和螢幕截圖分析功能,並且能根據視覺提示執行任務,但純文本能力維持與原版相同水準。
這款模型真的能比肩Anthropic的Claude Opus 4.8嗎?
根據DeepSeek官方說法,在多模態Agent評測上已「接近」Opus 4.8,但這是實驗版本的內部測試結果,實際表現還需要第三方獨立評測來驗證,建議開發者先透過API自行測試。
開發者要怎麼開始使用這款模型?
可以透過DeepSeek的API平台進行調用,支援Chat Completions、Messages、Responses三種格式,圖片可透過base64內聯、外部URL或Files API三種方式傳入,支援圖文混合輸入。
這款模型有哪些實際應用場景?
適合需要「看懂圖像再行動」的自動化流程,例如分析儀表板截圖後自動產生報告、理解UI畫面後操作應用程式、或是結合視覺資訊進行複雜決策的Agent應用。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。



