我們正在把愈來愈多的決策權交給 AI,從讓它描述一張照片,到讓它決定一輛車該不該煞車。但你知道嗎?你信任的這個「眼睛」,其實可能正在產生幻覺。
根據知名學術期刊《Communications of the ACM》近期報導,包括 OpenAI 的 ChatGPT 與 Anthropic 的 Claude 在內的大型語言模型,雖然已經進化到能處理圖像的多模態 AI,卻普遍存在一個名為「視覺幻覺」(Visual Hallucinations)的結構性缺陷。說白話就是:AI 會根據統計機率「編造」出一個看似合理、但實際上是錯誤的圖像判斷。
圖像辨識的真相:AI 不是在「看」,而是在「猜」
英國諾丁漢大學(University of Nottingham)電腦視覺副教授 Michael Pound 點出關鍵:LLMs 缺乏對「真理」的明確規範,它們的輸出本質上只具備統計學上的合理性。換句話說,AI 不是真的「看懂」了一張圖,而是根據過往訓練資料,預測出「最有可能」的描述。
聽起來很聰明對吧?但在關鍵時刻,這種「預測」會出大問題。加州柏克萊人工智慧研究實驗室(BAIR)博士後研究員 David Chan 也坦言:儘管人類也會犯錯,但大眾對 AI 的期望標準遠高於人類。當 AI 的表現不如預期時,信任崩壞的速度會比你想像的快很多。
研究人員發現,當背景資訊與圖像內容相互矛盾時,幻覺出現的頻率會顯著增加。這意味著,AI 面對複雜、多變的真實世界場景時,遠比在實驗室裡來得不穩定。
自動駕駛與醫療影像,最危險的應用場景
「視覺幻覺」這四個字在實驗室裡是學術問題,但在某些領域會直接變成安全問題。
自動駕駛車是第一道防線。當 AI 把路邊的陰影誤判為障礙物、或把障礙物誤判為陰影,後果不是急煞就是失靈。安全監控影像分析也面臨相同挑戰——當 AI 看錯關鍵畫面,整個決策鏈都會被帶偏。
但真正讓學者捏把冷汗的,其實是醫學影像分析。Michael Pound 舉例警告:如果 AI 在訓練過程中被其他病患的資料干擾,它可能忽略圖像中實際存在的疾病跡象。對於盲人輔助科技這種使用者無法自行驗證 AI 輸出的情境,任何錯誤都不是「小事」,而是直接影響人身安全的風險。
修正幻覺有多難?現有方法都卡在一個痛點
那麼,這個問題有解嗎?學界正在試,但過程比想像中艱難。
目前最常見的做法是針對特定任務進行模型微調(fine-tuning),或在自動駕駛車中導入光達(LiDAR)等多餘感測器來交叉驗證。這些方法能「部分」緩解問題,但無法根除。
另一條路是後驗證(post-hoc verification),也就是用另一個 AI 來檢查原本 AI 的輸出。但這種方法效率低落,過程緩慢,而且只能「拒絕」錯誤回應,無法直接修正內容——就像一個只會說「你錯了」、卻不會告訴你「哪裡錯、怎麼改」的同事,對吧?
REVERSE 框架帶來轉機,但真正的戰場在「源頭」
好消息是,新的「REVERSE 框架」被提出作為替代方案。它能讓驗證在 AI 生成回應的過程中「同步進行」,不必等到輸出結束後才檢查。其原理是訓練模型將詞語分類為「自信」或「不自信」,並在生成影像描述時即時給予每個詞彙信心評分,從而實現即時修正。
David Chan 形容這是一種「推論技巧」,能讓部署中的系統根據預期的錯誤率來進行應對。換句話說,與其追求 100% 正確,不如讓 AI 知道自己什麼時候可能出錯,以及錯的機率有多高。
不過,研究人員的最終目標還是從源頭防止幻覺產生。目前學界正積極探索「視覺推理」(visual reasoning)而非純文本推理——讓 AI 真正去分析圖像的幾何與外觀,而非僅依靠文字脈絡去「猜」圖像內容。這條路如果走得通,AI 的可解釋性與精準度將有機會跳躍式提升。
編輯觀點:從產業面來看,視覺幻覺問題不是「修正 bug」那麼單純,它挑戰的是整個生成式 AI 的底層邏輯。如果 AI 的輸出本質上是機率遊戲,那我們在自駕車、醫療診斷這些高風險場景中,就不該把它當成「絕對正確」的決策者,而是「輔助參考」的協作者。對企業決策者來說,2026 年的當務之急不是追求 AI 多功能,而是先釐清「哪些場景容錯率高、哪些場景容錯率趨近於零」,再決定部署的深度與速度。說穿了,我們要擔心的不是 AI 不夠聰明,而是我們對它的信任來得太理所當然。
當 AI 不再需要人類驗證,我們該如何自處?
對一般使用者來說,這則新聞的真正意義是:當 AI 被用來輔助視障者辨識環境、或協助醫生判讀 X 光片時,如果最終沒有人類去複核結果,風險將完全由使用者承擔。而這正是 Michael Pound 強調的核心矛盾——盲人輔助科技的使用者無法自行驗證 AI 輸出,因此模型的精確度必須高到幾乎零失誤,但現實是,目前的技術離這個標準還有不小的距離。
如果你正在使用或規畫導入 AI 影像分析工具,請至少為系統保留一層「人類驗證」的防線,尤其是在涉及安全與健康的場景。不要因為 AI 給出一個自信滿滿的答案,就放棄你身為人類的判斷力。
AI 的「眼睛」正在進化,但它還沒有準備好獨自看這個世界。而你,還不該閉上眼睛。
本文改寫整理自公開新聞來源,原始報導由Yahoo奇摩新聞發布。
常見問題 FAQ
什麼是大型語言模型的「視覺幻覺」?
視覺幻覺是指 AI 在分析圖像時,產生看似合理但實際錯誤或荒謬的輸出,原因是 LLM 本質上依賴統計機率而非真實理解。
視覺幻覺會影響自動駕駛車的安全性嗎?
會。當 AI 對路況影像產生錯誤判斷時,可能導致車輛誤判障礙物或忽略危險,直接影響行車安全。
目前學界如何解決 AI 視覺幻覺問題?
現有方法包括模型微調、導入光達(LiDAR)等額外感測器、後驗證機制,以及同步檢查幻覺的新框架 REVERSE,長期則朝向從源頭防止幻覺產生。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。



