Google 研究院近期於官方部落格正式發表名為「TurboQuant」的全新量化壓縮演算法,由研究科學家 Amir Zandieh 與副總裁暨 Google 研究員 Vahab Mirrokni 共同撰文介紹。這項技術針對大型語言模型(LLM)的 KV 快取記憶體瓶頸提出根本性解方,實驗數據顯示可將 KV 記憶體占用降低至少 6 倍,並在 H100 GPU 上實現最高 8 倍的運算加速,同時不犧牲模型準確度。美系外資摩根士丹利(大摩)對此高度關注,直言此舉可能「改變 AI 部署的成本曲線」,並以「另一個 DeepSeek 時刻」加以形容。
KV 快取為何成為 AI 擴展的核心瓶頸
KV 快取可視為大型語言模型運算過程中的高速數位速查表,以簡單的鍵值對形式儲存常用資訊,使模型能即時存取,而無需反覆搜尋龐大的底層資料庫。隨著模型規模與推論需求持續擴張,KV 快取所消耗的記憶體資源也急遽攀升,成為制約 AI 服務規模化的關鍵障礙。
Google 研究員指出,AI 模型處理資訊的基本單位是向量,其中高維向量雖能捕捉複雜的語意與影像特徵,但同時也帶來龐大的記憶體負擔。傳統的「向量量化」技術雖可縮減向量大小,卻因每個壓縮區塊需額外儲存量化參數,導致每個數值反而增加 1 至 2 個位元的額外負擔,實際壓縮效益因此大打折扣。TurboQuant 正是為了解決這項根本性矛盾而生。
TurboQuant 運作原理:兩階段壓縮架構
TurboQuant 的壓縮流程分為兩個核心階段,分別對應其兩項關鍵子技術:PolarQuant 與 QJL(Quantized Johnson-Lindenstrauss)。這套架構預計於 ICLR 2026 正式發表,而 PolarQuant 則將於 AISTATS 2026 發表。
第一階段採用 PolarQuant 方法進行高品質壓縮。系統首先對資料向量施以隨機旋轉,以簡化其幾何結構,再將標準量化器分別套用至向量的各個組成部分。PolarQuant 的核心創新在於將向量從傳統的直角座標系(X、Y、Z)轉換為極座標表示,以半徑(代表資料強度)與角度(代表資料方向)取代原有的多軸座標描述。這種表示方式的邊界固定且可預測,如同將資料映射至圓形網格,從而消除傳統方形網格所必然承擔的記憶體額外負擔,也省去昂貴的資料標準化(normalization)步驟。
第二階段採用 QJL 演算法消除隱藏誤差。QJL 基於 Johnson-Lindenstrauss Transform 數學方法,能在保留資料點間距離與關係的前提下,將每個向量數值壓縮為單一符號位元(+1 或 -1),建立一種不需額外記憶體負擔的高速資料速記形式。此外,QJL 使用特殊估算器在高精度查詢與低精度資料之間取得平衡,確保模型仍能精確計算注意力分數(即判斷哪些輸入資訊重要、哪些可忽略的核心機制),有效修正第一階段壓縮後殘留的微小偏差。
實驗驗證:多項基準測試均達最佳表現
Google 以開源大型語言模型 Gemma 與 Mistral 為基礎,在 LongBench、Needle In A Haystack、ZeroSCROLLS、RULER 及 L-Eval 等多個標準長上下文基準測試上,對 TurboQuant、PolarQuant 及基準方法 KIVI 進行嚴謹評估。
實驗結果顯示,TurboQuant 在「點積失真」與「召回率」兩項關鍵指標上均達到最佳表現。在長上下文的「大海撈針」任務(測試模型能否在大量文本中精確定位極小且特定的資訊)中,TurboQuant 在所有基準測試中均達到完美的下游任務表現,同時將 KV 記憶體大小降低至少 6 倍以上,且無需對模型進行任何訓練或微調,即可將 KV 快取量化至僅 3 位元。在 H100 GPU 上,4 位元 TurboQuant 相較於 32 位元未量化鍵值,效能提升最高可達 8 倍。此外,與目前最先進的向量搜尋方法 PQ 及 RabbiQ 相比,TurboQuant 在高維向量搜尋任務中仍持續展現更優異的召回率。
- KV 記憶體降低幅度:至少 6 倍以上
- 運算加速效果:在 H100 GPU 上最高達 8 倍
- 量化位元數:可壓縮至僅 3 位元,無需訓練或微調
- 評估模型:Gemma 與 Mistral 開源大型語言模型
- 適用場景:KV 快取壓縮、向量搜尋、語意搜尋加速
摩根士丹利指出,TurboQuant 能讓相同硬體支援 4 至 8 倍更長的上下文,或在不耗盡記憶體的情況下處理更大的批次規模(batch size),這並非單純的記憶體需求降低,而是「效率提升」,增加每顆 GPU 的吞吐量,長期將引發「傑文斯悖論」(Jevons Paradox)效應,效率提升反而推動總需求增加。
展望與影響:重塑 AI 部署成本曲線
目前 Google 與 NVIDIA 均積極投入 KV 快取壓縮技術的研發——NVIDIA 已於論文中公開 KVTC 技術,而 Google 此次發表的 TurboQuant 則進一步將這場技術競賽推向新的高度。摩根士丹利認為,AI 服務擴展最大瓶頸正在於 KV 快取,若模型能在顯著降低記憶體需求的情況下維持效能,每次查詢的服務成本將可大幅下降,進而提升 AI 部署的整體獲利能力。
就短期影響而言,TurboQuant 主要針對推論階段的 KV 快取進行壓縮,對模型權重及訓練工作負載並無直接影響,但其提升單一 GPU 吞吐效率、降低單次查詢成本的特性,對於正在規模化部署 AI 服務的企業而言具有立即的實用價值。就長期影響而言,隨著更多企業跟進投入類似技術,AI 推論成本的結構性下降趨勢將可能加速,進一步擴大 AI 應用的普及範圍。Google 亦預期 TurboQuant 未來將廣泛應用於語意搜尋加速,在極低記憶體使用量與幾乎為零的前處理時間條件下,建立並查詢大規模向量索引,使 Google 搜尋服務更快速且更具效率。
常見問題解答
TurboQuant 是什麼技術?
TurboQuant 是 Google 研究院開發的一種先進量化壓縮演算法,結合 PolarQuant 與 QJL 兩項子技術,能在不損失模型準確度的前提下,大幅縮減大型語言模型 KV 快取的記憶體占用,預計於 ICLR 2026 正式發表。
TurboQuant 能達到多少壓縮效果?
根據 Google 的實驗數據,TurboQuant 可將 KV 記憶體大小降低至少 6 倍以上,並在 H100 GPU 上實現最高 8 倍的運算加速,同時將 KV 快取量化至僅 3 位元,且無需對模型進行訓練或微調。
為何摩根士丹利稱 TurboQuant 為「另一個 DeepSeek 時刻」?
摩根士丹利認為,TurboQuant 並非漸進式優化,而是從根本上「改變 AI 部署的成本曲線」,能讓相同硬體支援更長的上下文或更大的批次規模,大幅提升每顆 GPU 的吞吐效率,長期將引發傑文斯悖論效應,推動 AI 總需求進一步增加,其影響力足以與 DeepSeek 帶來的行業衝擊相提並論。




