根據 Google 研究團隊最新發表的報告指出,一項名為「TurboQuant」的全新免訓練(training-free)壓縮演算法,成功將大型語言模型(LLM)的鍵值快取(KV caches)大幅壓縮至僅剩 3 位元,且過程中完全不影響模型準確度。這項技術的問世,無疑為當前 AI 運算領域中記憶體資源消耗龐大的難題,提供了極具潛力的硬體最佳化解方,預期將顯著降低 AI 運算門檻。
TurboQuant 演算法的關鍵效能躍升
在輝達(Nvidia)H100 GPU 上進行的嚴謹基準測試結果顯示,採用 4 位元版本的 TurboQuant 演算法,在處理注意力對數(attention logits)時,其效能相較於未經量化的 32 位元金鑰,實現了高達 8 倍的顯著提升。同時,這項技術也將 KV 快取記憶體的需求量降低了至少 6 倍。此數據明確揭示了 TurboQuant 在優化 AI 模型運算效率及記憶體使用上的巨大潛力。
Google 研究團隊指出:「隨著大型語言模型的應用日益廣泛,模型需要處理的上下文長度不斷擴張,記憶體瓶頸已成為產業界亟待解決的難題。TurboQuant 的設計正是為了直接應對此挑戰,提供一個高效且無損精準度的解決方案。」
在 AI 模型生成文字的過程中,鍵值快取(KV 快取)扮演著不可或缺的角色,它儲存了先前已計算過的注意力數據,確保模型在每個 token 生成步驟中無需重複繁複計算。然而,隨著上下文長度不斷增加,KV 快取佔用的記憶體空間呈爆炸性成長,成為系統主要的記憶體瓶頸,嚴重限制了大型語言模型的擴展性。
傳統量化技術的局限與挑戰
過去,業界為解決 KV 快取記憶體佔用過高的問題,多半採用傳統的向量量化(vector quantization)方法來縮減快取體積。儘管這類方法能減少整體大小,但系統必須額外儲存量化常數(quantization constants)。這導致每個數值都會產生數個位元的記憶體消耗,當面對超大型上下文長度時,這些看似微小的額外開銷會不斷複合累加,最終嚴重侵蝕掉量化所帶來的記憶體節省效益。
根據相關研究顯示,在處理極長上下文時,傳統量化方法雖然能初步降低記憶體需求,但其伴隨的額外儲存成本,使得在追求極致效率的 AI 運算場景中,效益大打折扣。這也促使 Google 團隊必須尋求更根本的解決方案,以徹底消除這些不必要的開銷。
兩階段創新架構:PolarQuant 與 QJL 演算法
為徹底消除傳統量化帶來的額外開銷,Google 團隊透過創新的「兩階段處理流程」打造出 TurboQuant 演算法。第一階段導入了名為 PolarQuant 的技術。PolarQuant 的核心原理是將數據向量從傳統的 Cartesian 座標轉換為 Polar 座標,巧妙地將每個向量分離成代表大小的 radius 和代表方向的 angles。由於在極座標下,angles 的分布具有高度可預測性且非常集中,PolarQuant 因此能夠直接省略傳統量化器必須執行的、極度消耗運算資源的每區塊正規化(per-block normalization)步驟。這項設計使得模型在達成高品質壓縮的同時,實現了零量化常數儲存消耗的驚人成果。
第二階段則是一層 1 位元(1-bit)的錯誤修正層,採用了名為 Quantized Johnson-Lindenstrauss (QJL) 的演算法。QJL 演算法會將殘餘的量化誤差投影到一個較低維度的空間之中,接著將每個數值進一步縮減至僅剩一個單一符號位元。此數學轉換幾乎沒有增加任何額外的運算成本,同時還能有效消除在計算注意力分數時所產生的系統性偏差,確保模型的高精準度。
實戰效能驗證:超越業界基準
為了驗證實際效能,Google 團隊使用了 Gemma 與 Mistral 等開源模型,在多個業界標準的長文本基準測試中進行了全面評估,涵蓋了 LongBench、Needle In A Haystack、ZeroSCROLLS、RULER 以及 L-Eval 等項目。在 LongBench 的資訊檢索任務中,即使在將 KV 記憶體壓縮至少 6 倍的嚴苛條件下,TurboQuant 依然取得了完美的下游分數。而在包含問答、程式碼生成以及文章摘要等多元任務的 LongBench 測試中,TurboQuant 的表現不僅追平,甚至在所有任務上都超越了 KIVI 基準線。
Google 官方特別強調:「TurboQuant 最具商業價值的優勢在於它完全不需要任何訓練或微調(no training or fine-tuning),且在執行時期的資源消耗微乎其微。這些優異特性使得 TurboQuant 能夠非常輕易且無縫地部署於現有的生產級推論系統以及大規模的向量搜尋系統之中。」
此外,TurboQuant 在向量搜尋領域也展現了強大的實力。在 GloVe 資料集的評測中,即使面對如 Product Quantization 和 RabbiQ 等依賴龐大碼本與特定資料集微調的現有基準技術,TurboQuant 依舊取得了最高的 1@k 召回率(recall ratios),證明其廣泛的應用潛力與卓越的效能。
數據背後的啟示:AI 運算門檻的降低
Google 研究科學家 Amir Zandieh 與副總裁 Vahab Mirrokni 共同撰寫的詳細研究論文,預計將於下個月舉辦的 2026 年國際學習表徵會議(ICLR 2026)上正式發表。這項免訓練、資源消耗極低的 TurboQuant 演算法,不僅有效解決了大型語言模型面臨的記憶體瓶頸,更重要的是,它大幅降低了高效能 AI 運算的技術門檻與成本。這意味著未來更多企業與開發者將能以更經濟、更便捷的方式部署先進的 AI 模型,加速 AI 技術的普及與創新應用,為整個 AI 生態系注入強勁的成長動能。




