輝達Groq 3 LPX在美國量產 AI推論進入低延遲競賽 鴻海供應鏈受關注

中華超傳媒 (文/ 記者 郭紋雅)

Aug 26, 2026 - 20:40
0 0
source 輝達Groq 3 LPX在美國量產 AI推論進入低延遲競賽 鴻海供應鏈受關注


(圖/ 中華超傳媒 AI圖片)

輝達在美國加州帕羅奧多舉行的Hot Chips 2026期間宣布,Groq 3 LPX AI推論加速器正式進入全面量產,並與Vera Rubin NVL72搭配使用,AI代理的低延遲推論與Token生成速度成為下一階段算力競爭焦點。

Groq 3 LPX全面量產 輝達AI版圖從GPU延伸到推論


輝達Groq 3 LPX量產成為Hot Chips 2026的重要訊息。輝達8月24日宣布,Groq 3 LPX已進入全面量產,這項產品不是要取代Vera Rubin平台中的GPU,而是針對AI代理與即時互動需求,強化Token生成與低延遲推論能力。

這項布局的產業意義,在於AI運算需求正在出現新的變化。過去AI基礎建設的核心競爭,多集中在模型訓練、大型GPU叢集與整體算力;隨著生成式AI逐漸進入AI代理、程式設計、自動化工作流程等應用,系統不只需要「算得多」,還必須「回得快」。

一個AI代理可能需要連續進行推理、呼叫工具、讀取資料、撰寫程式、執行測試,再根據結果進行下一輪推理。當這些步驟大量串接後,單次Token生成的延遲,就可能直接影響使用者感受到的反應速度。輝達因此選擇將Groq技術整合進Vera Rubin平台,形成GPU負責廣泛運算、專用推論加速器強化生成速度的架構。

256顆LP30組成機櫃 Groq 3 LPX不是另一套GPU


從硬體定位來看,Groq 3 LPX與傳統GPU的角色並不完全相同。輝達公布的架構資料顯示,一個Groq 3 LPX機櫃可配置256顆LP30加速器,並透過晶片間高速連接形成大規模推論系統。它被設計為Vera Rubin NVL72的延伸,主要處理需要極低延遲Token生成的工作負載。

這代表輝達的AI工廠架構正在進一步細分。Vera Rubin NVL72可以處理較廣泛的訓練、推論與長上下文運算;Groq 3 LPX則把重點放在「生成」這個階段,尤其針對需要快速回應的AI代理。

這種分工與傳統「一種晶片處理所有工作」的思維有所不同,也反映AI應用開始從模型訓練走向大規模實際運作後,運算架構需要更加專門化。

3400 Token/秒成亮點 低延遲成AI代理新戰場


輝達此次特別公布Groq 3 LPX的推論效能數據。根據輝達公布的Artificial Analysis測試,在Gemma 4 31B模型、100,000 Token上下文條件下,Groq 3 LPX達到每秒3,400個輸出Token,輝達稱這是該模型目前測得的最高速度;在AI代理程式設計等低延遲工作負載上,輝達則表示其回應速度可達最近競爭平台的4倍。

不過,這些數字屬於輝達引用的特定測試條件與基準結果,不能直接解讀為所有AI工作負載都能達到同樣效能。但從產品定位來看,輝達真正想強調的並不是單一跑分,而是「Token生成速度」在AI代理時代的重要性。

AI代理與傳統聊天機器人的差異,在於它可能需要持續產生大量Token並反覆執行任務。只要每一步都存在延遲,整體任務完成時間就會被放大。因此,低延遲推論正在成為AI基礎建設新的效能指標。

AI代理崛起 算力競爭從「訓練」轉向「推論效率」


輝達這次推出Groq 3 LPX,也可視為AI產業競爭重心變化的一個縮影。大型語言模型完成訓練後,真正面向企業與消費者服務時,仍需要大量推論資源。當AI代理開始自行規劃工作、操作工具、撰寫與測試程式,推論需求將不只是單純回答問題,而是變成長時間、連續、多步驟的運算流程。

這使得AI基礎建設必須同時處理兩個問題:一方面要消化越來越長的上下文,另一方面又要讓每一個Token快速產生。輝達的Vera Rubin與Groq 3 LPX正是針對這兩個方向進行分工。輝達官方將Groq 3 LPX定位為強化Vera Rubin NVL72互動性的加速器,而不是獨立取代GPU的產品。這項設計背後透露的訊號是,未來AI資料中心可能不再單純追求GPU數量,而會更重視不同類型運算單元如何共同工作。

Nebius成為首個採用者 AI雲端成為新硬體落地場景


Groq 3 LPX量產後,首個宣布採用的AI雲端業者是Nebius。輝達表示,Nebius計畫把Groq 3 LPX導入Nebius Token Factory生產環境,讓開發者使用高速Token生成能力來打造AI代理、程式設計系統與其他即時互動AI應用。

這個布局也值得從AI雲端服務角度觀察。過去AI晶片發布後,市場往往關注大型雲端業者是否採用;現在AI代理快速發展,雲端業者不只需要提供GPU算力,也開始尋找能夠降低推論延遲、提高每台機器實際利用效率的專用運算架構。Nebius率先採用Groq 3 LPX,代表專用推論硬體已開始從技術展示走向實際雲端服務。

輝達與Groq技術整合速度加快 推論布局正式進入產品階段


Groq 3 LPX的量產,也具有輝達整合Groq技術後的重要象徵意義。輝達在2025年底取得Groq相關技術授權並延攬核心團隊,之後將Groq的低延遲推論技術納入自身AI平台。如今Groq 3 LPX正式進入量產,代表這項技術已經從合作與研發階段進一步走向實際產品部署。

這也讓輝達的AI運算版圖出現新的層次。

從GPU、CPU、網路、儲存,到現在的專用推論加速器,輝達正在嘗試把AI資料中心各個運算環節整合成一套完整架構。這與過去單純銷售GPU的商業模式相比,明顯更加接近「AI工廠」概念。

鴻海供應鏈受關注 但最大組裝廠說法仍須區分


在台灣市場,Groq 3 LPX量產另一個受到關注的焦點,是鴻海。市場報導指出,鴻海被法人視為相關AI機櫃的重要組裝業者,Groq 3 LPX進入量產後,市場因此關注鴻海AI伺服器與機櫃業務是否受惠。

不過,目前輝達官方公告主要公布的是Groq 3 LPX的產品、量產、架構與Nebius採用資訊,並未在該公告中確認鴻海為Groq 3 LPX機櫃的最大組裝廠。因此,相關說法應視為市場與法人對供應鏈的評估,而非輝達官方已確認的訂單資訊。

另一方面,鴻海近期持續擴大美國AI製造布局,也讓市場對其AI伺服器供應鏈角色保持高度關注。鴻海8月26日公告,子公司Q-Edge以5,525萬美元在美國加州聖克拉拉取得土地及廠房,並表示是基於營運需求;市場則關注其與AI製造布局的關聯。因此,Groq 3 LPX量產對鴻海的實際營收貢獻,仍應等待公司或供應鏈進一步揭露。

Groq 3 LPX不是取代GPU 而是讓Vera Rubin更完整


市場容易把專用LPU與GPU理解成競爭關係,但Groq 3 LPX的設計方向並非如此。輝達官方明確將Groq 3 LPX定位為Vera Rubin NVL72的延伸,讓GPU與LPU共同處理AI代理工作。換言之,GPU仍負責廣泛的AI運算,而Groq 3 LPX則專注於低延遲Token生成。

這種架構更接近「異質運算」。不同晶片各自負責最擅長的工作,再透過高速互連共同完成AI推論。對資料中心業者而言,如果能藉此縮短回應時間、提高整體吞吐量並改善能源使用效率,就可能比單純增加GPU數量更具經濟效益。

因此,Groq 3 LPX真正值得注意的地方,並不是「又多了一顆AI晶片」,而是輝達正在重新定義AI資料中心中不同運算單元的角色。

AI晶片下一場競賽 從算力轉向Token成本與回應速度


隨著AI模型逐漸進入代理化,未來AI晶片的競爭指標可能會發生變化。過去市場習慣比較TOPS、FLOPS、HBM頻寬或模型訓練速度,但對AI代理而言,使用者更在意的是任務完成時間、每秒Token數、每Token成本,以及整個AI系統能否持續處理大量並行工作。

輝達近期也持續從整個AI工廠角度強調吞吐量、能源效率與Token成本,而Groq 3 LPX則把「Token生成延遲」拉到更核心的位置。因此,未來AI晶片市場可能形成新的競爭格局:GPU負責大規模運算,專用推論晶片負責特定工作負載,而網路、CPU、記憶體與儲存系統則共同決定整座AI資料中心的最終效率。

結語|輝達把AI推論戰推進下一階段


Groq 3 LPX正式量產,表面上是一款新AI推論機櫃進入商業部署,實際上則反映AI基礎建設正在發生結構性變化。當AI從聊天機器人走向能夠自行規劃、呼叫工具、執行程式與完成複雜任務的Agentic AI,運算需求也開始從「模型能不能跑」轉向「模型能不能即時完成工作」。

輝達因此沒有選擇讓Groq 3 LPX直接取代GPU,而是把它放進Vera Rubin架構中,讓專用推論加速器補上低延遲Token生成這一塊。首個AI雲端採用者Nebius也已確定,讓Groq 3 LPX正式從產品展示走向實際部署。

對台灣供應鏈而言,鴻海等AI伺服器與機櫃業者是否能從這波新平台量產中取得更多訂單,將是後續市場關注焦點;但目前公開資訊仍不足以確認鴻海在Groq 3 LPX機櫃中的具體訂單規模。

可以確定的是,AI硬體競爭正在從「誰的GPU最快」進一步變成「誰能以最低延遲、最高效率與合理成本產生更多Token」。這場推論革命,可能才剛剛開始。

MGBOX NEWS

中華超傳媒

(文/ 記者 郭紋雅)

What's Your Reaction?

Like Like 0
Dislike Dislike 0
Love Love 0
Funny Funny 0
Wow Wow 0
Sad Sad 0
Angry Angry 0

Comments (0)

User