關鍵數字:NVIDIA於7月21日釋出Vera CPU白皮書,這款專為代理式AI設計的CPU,預計2026年下半年推出,其單執行緒效能提升達300%。
NVIDIA Vera CPU:為代理式AI量身打造
NVIDIA在7月21日釋出了Vera CPU的白皮書,詳細闡述了這款基於Arm指令集的自主架構CPU的設計理念與獨特之處。Vera CPU專門為代理式AI(Agent-based AI)設計,旨在解決現有通用資料中心CPU無法滿足的特定需求。
代理式AI系統需要頻繁在多個代理之間執行,這意味著更多的關鍵執行路徑需要轉移到CPU負載。因此,適合代理式AI的CPU必須具備四項特質:在插槽全負載的情況下保有強大的單執行緒效能;每個核心具有滿足多個活躍執行上下文所需的充裕記憶體頻寬;可預期的併行情況延遲;高效處理不規則控制流、常依賴鍊與指標密集型資料結構。
Olympus架構:最大化IPC的關鍵
Vera CPU基於NVIDIA的Olympus架構,從底層開始設計,以最大化IPC(Instructions Per Cycle)為目標。Olympus架構由四大模組構成,包括前端、中核、執行引擎和快取子系統。
前端設計確保核心在大型、分支密集型軟體堆疊中獲得所需的指令。Olympus的分支預測子系統包含一個神經分支預測器,提高對複雜、統計偏差較大的分支模式的預測精準度,藉此降低錯誤路徑執行並維持控制流程吞吐量。
中核(Mid Core)專門挖掘和加速代理式AI流程中的隱藏並行性,利用強大的重新命名與分配引擎,確保更多指令可持續執行,進而實現更深層的亂序執行。這有助於減少因指標密集性程式碼、串行記憶體操作與長依賴鍊造成的停頓。
創新的空間多執行緒技術
Vera CPU的最大特色之一是其創新的空間多執行緒技術。傳統的多執行緒技術會使兩個硬體執行緒共享同一個核心,這會引發資源爭奪的問題。Vera CPU則採用了不同的多執行緒方式,Olympus核心可以根據實際需求在單執行緒和多執行緒之間切換。
這種靈活的多執行緒設計使得Vera CPU在需要最大單執行緒效能時,可以作為高吞吐量的單執行緒核心執行任務;而在需要高執行緒密度時,則可以作為兩個獨立的執行緒。這對於代理式AI應用尤其重要,因為它們通常需要高單執行緒效能。
NVIDIA SCF:高效的通信骨幹
NVIDIA SCF(Scalable Coherency Fabric)作為Vera CPU的通訊骨幹,提供了高達3.4TB/s的雙向頻寬,並在所有核心整合了一個164MB的統一L3快取。SCF通過高頻寬晶片統一架構連接內部包括Olympus核心、共享快取、記憶體控制器、I/O與NVLink-C2C介面,避免了碎片化晶片設計常見的晶片跳轉延遲與效能波動。
Vera CPU還支援先進的新一代I/O,包括PCIe 6.4、CXL 3.1,並具備基於Arm CCA/RME的安全技術,確保數據傳輸的安全性和一致性。這些技術共同建構了一個統一的信任域,使Vera Rubin NVL72成為具備機密運算的可擴展AI基礎設施。
從產業面來看,NVIDIA Vera CPU的推出不僅填補了市場空白,更為代理式AI應用提供了前所未有的效能支持。隨著AI技術的不斷進步,未來的資料中心將更加依賴這樣的高度定制化CPU,以滿足複雜多變的計算需求。
行動呼籲
隨著NVIDIA Vera CPU的推出,代理式AI應用的效能將迎來質的飛躍。如果你是AI開發者或企業決策者,不妨深入研究這款CPU的設計理念和技術特點,思考如何將其應用到你的項目中,以提升整體效能和競爭力。
本文改寫整理自公開新聞來源,原始報導由癮科技發布。
常見問題 FAQ
Vera CPU的主要應用場景有哪些?
Vera CPU主要應用於代理式AI、強化學習、圖分析和資料處理等場景,特別適合需要高單執行緒效能和並行處理能力的應用。
Vera CPU的性能提升主要體現在哪些方面?
Vera CPU的性能提升主要體現在單執行緒效能、記憶體頻寬、快取系統和多執行緒靈活性等方面,這些都為代理式AI應用提供了更好的支持。
NVIDIA SCF的作用是什么?
NVIDIA SCF(Scalable Coherency Fabric)作為Vera CPU的通訊骨幹,提供了高達3.4TB/s的雙向頻寬,並在所有核心整合了一個164MB的統一L3快取,確保高效能和低延遲的數據傳輸。


