NVIDIA Gorq 3 LPX 量產實測!4倍Token爆發力聯手Spectrum-X擴展架構,AI資料中心迎來新拐點

事件總覽:從GTC 2026的預告到Hot Chips 2026的正式量產,NVIDIA用了不到半年時間,將G…

17 分鐘

Read Time

事件總覽:從GTC 2026的預告到Hot Chips 2026的正式量產,NVIDIA用了不到半年時間,將Groq 3 LPX機櫃從技術展示推向全面生產,並以4倍於現有API服務的Token輸出效能,聯手Spectrum-X多層網路架構,試圖重新定義AI資料中心的效能天花板與擴展規則。

八月底的史丹佛大學校園,Hot Chips 2026的議程上飄著一股不尋常的氣氛。不是因為入場券早在會前就銷售一空,也不是因為線上虛擬參加還要收費五塊美金起跳——而是NVIDIA端出來的Gorq 3 LPX機櫃,確實讓在場的硬體玩家倒抽了一口氣。

這傢伙不是來跟你討論理論值的。256顆Groq 3 LPU塞進一個全水冷機櫃,晶片內部SRAM總容量128GB,傳輸頻寬高達640 TB/s。什麼概念?就是你把一個巨型叢集視為單一運算單元來鞭策,而且它還真的跑給你看。根據NVIDIA提供的實測數據,在執行上下文長度100K組Token的Gemma 4 31B模型推理時,Gorq 3 LPX的Token輸出速度達到每秒3,431組——對比目前公開API服務效能參考指標的870組,直接拉出接近四倍的差距。這已經不是「改善」的程度,是直接把對手的臉按在儀表板上摩擦。

📅 2026年3月:GTC 2026的伏筆與鋪陳

時間拉回今年三月的GTC 2026,黃仁勳在開幕演說上親自發表Groq 3 LPU,當時談的是「10倍收益能力」與資料中心轉型。說真的,那時候業界的反應大概分成兩派:一派覺得這是NVIDIA補齊AI推論最後一塊拼圖的關鍵動作,另一派則認為這只是Vera Rubin世代的配角,畢竟Rubin GPU才是主角。但現在回頭看,Groq 3 LPX從來就不是來當配角的——它是來跟Rubin GPU打配合戰的。

NVIDIA在Hot Chips 2026的簡報中明確指出,Groq 3 LPX能夠與Vera Rubin系統相互搭配,讓Rubin GPU與Groq LPU協同進行AI模型各層運算。這表示你在跑大規模推論工作負載時,Groq LPU可以負責縮短生成Token的延遲,Rubin GPU則專注在訓練與其他運算任務。說白一點,這是一套混合兵種作戰的思維,不是叫你選邊站。

📅 2026年8月:Hot Chips 2026的全面量產宣言

到了8月23日至25日的Hot Chips 2026大會,NVIDIA正式宣布Gorq 3 LPX機櫃進入「全面生產」狀態。這個時間點的意義在於:它不是紙上談兵的參考設計,而是可以實際下單部署的產品。搭配先前COMPUTEX 2026就已經確立的Vera Rubin平台量產節奏,NVIDIA等於在2026年下半年完成了從訓練到推論、從單一機櫃到超大規模叢集的完整產品拼圖。

有趣的是,NVIDIA在這次大會上花了相當大的篇幅在講網路架構。你以為他們只會堆運算單元?錯了。真正的戰場在Scale-Out

📅 2026年8月:Spectrum-X多層網路架構的擴展革命

NVIDIA將單一機櫃內透過NVLink互連GPU的方式歸類為Scale-Up,透過網路通訊將多組機櫃互連稱為Scale-Out,甚至還拋出將多個不同地點資料中心透過廣域網路合成單一運算節點的Scale-Across概念。但真正讓我眼睛一亮的,是Spectrum-X乙太網路交換器達成的Multi-Rail多層網路架構。

這套架構能在單一系統中最高同時連接512,000組GPU。對,你沒看錯,是51萬2千組。先前2層交換器拓樸只能連接2,048組GPU的擴展限制,在這裡直接被炸開一個次元級的差距。這代表什麼?代表你想要訓練參數量更大、更變態的AI模型,或是將AI推論運算的部署規模往上推好幾個數量級,Spectrum-X給了你一條不必妥協的路。

而且它不只是「能接得多」,還「撐得住」。進階最佳化路由功能可以依運作狀況自動調度網路頻寬資源,並在單一節點失效時維持整體網路90%的頻寬。換句話說,你的叢集不會因為一顆節點掛掉就整組軟腳——這對於追求服務可靠度的商用資料中心來說,比單純堆效能還重要。

另外,NVIDIA也提到了BlueField-4網路平台與DOCA API符合Scale-In概念,將虛擬私有雲網路、儲存裝置網路連接、資安防護、管理、監控等功能全部塞進單一張智慧型網路卡。這套「整合代替堆疊」的思維,對於想控制成本、節省空間、降低耗電量的資料中心營運商來說,算是務實的解法。

編輯觀點:從產業面來看,NVIDIA這次在Hot Chips 2026的操作其實很有策略縱深。Groq 3 LPX的4倍效能是一個漂亮的數字,但真正影響深遠的是Spectrum-X開創的擴展架構。過去AI資料中心的瓶頸往往不在運算單元本身,而在於網路連接與擴展彈性——你把再強的GPU塞進機櫃,如果機櫃之間的通訊跟不上,整體效能還是被卡死。NVIDIA這次等於同時解決了「單點效能」與「叢集規模」兩個維度的問題,而且讓Groq LPU與Rubin GPU可以協同作戰,這套混合架構如果順利被市場接受,其他競爭者要追上的難度會非常高。對一般人來說,這代表未來你使用AI服務時的回應速度會明顯變快,而且服務供應商能承載的同時使用人數也會大幅增加。

至今影響與未來展望

從GTC 2026的發表到Hot Chips 2026的量產,NVIDIA在短短五個月內把Groq 3 LPX從技術樣品變成可出貨的產品,這個節奏本身就說明了他們對AI推論市場的飢渴程度。Vera Rubin世代已經在COMPUTEX 2026確立了AI盈利模式的產業新局,現在加上Groq 3 LPX的推論加速與Spectrum-X的擴展骨架,NVIDIA等於在AI資料中心的每一個關鍵節點上都插上了旗子

往前看,接下來的戰場會落在實際的部署案例與成本效益分析。每秒3,431組Token的輸出速度在實驗室環境跑得出來,但在真實的混合工作負載下能維持多少?512,000組GPU的連接能力是理論上限還是實用規模?這些問題需要時間來驗證。但可以確定的是,2026年下半年開始,AI資料中心的建置規格將會被重新書寫——而且這次的筆,握在NVIDIA手上。

你的下一座AI工廠,準備好迎接這波規格升級了嗎?或者換個角度問:當Gorq 3 LPX搭配Spectrum-X的叢集效能變成新常態,你現有的基礎建設還撐得住幾年不被淘汰?這個問題,值得每一位資料中心決策者現在就開始盤算。

本文改寫整理自公開新聞來源,原始報導由T客邦發布。

常見問題 FAQ

Gorq 3 LPX的4倍效能是指在什麼條件下測出來的?

4倍效能是指在執行上下文長度為100K組Token的Gemma 4 31B模型推理運算時,Gorq 3 LPX的Token輸出速度達到每秒3,431組,對比目前公開API服務效能參考指標的每秒870組,得出的倍數差異。

Groq 3 LPX機櫃現在可以買到了嗎?

可以。NVIDIA已於Hot Chips 2026大會宣布Gorq 3 LPX機櫃進入全面生產狀態,代表已經可以正式下單部署,不再是開發階段的樣品或參考設計。

Spectrum-X架構跟現有的網路方案有什麼不同?

Spectrum-X最大的差異在於Multi-Rail多層網路架構,能讓單一系統最高連接512,000組GPU,大幅超越先前2層交換器拓樸僅2,048組GPU的限制,同時提供節點失效時維持90%頻寬的可靠度。

Groq 3 LPX一定要搭配Vera Rubin系統才能用嗎?

不一定。NVIDIA的設計是讓Gorq 3 LPX能夠與Vera Rubin系統相互搭配協同運算,但它也可以大規模部署構成巨型叢集並視為單一運算單元獨立運作,使用上具備相當的彈性。

※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。

About the Author

AF themes

Easy WordPress Websites Builder: Versatile Demos for Blogs, News, eCommerce and More – One-Click Import, No Coding! 1000+ Ready-made Templates for Stunning Newspaper, Magazine, Blog, and Publishing Websites.

BlockSpare — News, Magazine and Blog Addons for (Gutenberg) Block Editor

Search the Archives

Access over the years of investigative journalism and breaking reports