新聞中心

NVIDIA Blackwell 在 MLPerf Training v4.1 的 LLM 訓練表現 NEWS DETAIL

當前位置:首頁 > 新聞中心
資訊分類 · 新聞中心 作者 · 中科新遠內容團隊 審核人 · 中科新遠技術內容組 發佈時間 · 2025-01-22 更新時間 · 2026-07-22 來源 · 原頁面資料;原廠資訊待核驗
NVIDIA Blackwell 在 MLPerf Training v4.1 的 LLM 訓練表現

對於評估大規模 LLM 訓練與微調平台的團隊而言,NVIDIA Blackwell 在 MLPerf Training v4.1 的提交結果顯示,相較於來源所列的 Hopper 提交,GPT-3 預訓練可達每 GPU 2 倍效能,Llama 2 70B LoRA 微調可達每 GPU 2.2 倍效能。這些是特定基準、軟硬體組合與提交條件下的結果,適合用於建立技術評估方向,不應直接視為所有模型、資料集或生產環境的實際加速比例。

Blackwell 要解決什麼訓練問題

模型參數與訓練資料增加時,訓練作業需要更高的資料中心級運算與擴展能力。來源將 Blackwell 平台定位為支援更大 AI 叢集與下一代 LLM 開發的平台,並指出其涵蓋 GPU、CPU、DPU、NVLink Switch、InfiniBand Switch 與 Ethernet Switch 等元件。

對基礎模型團隊而言,評估重點不僅是單一 GPU 的算力,也包括高頻寬記憶體容量與頻寬、多 GPU 通訊、運算與通訊重疊效率,以及模型平行策略。若現有訓練經常受限於記憶體配置、跨節點通訊或擴展效率,Blackwell 的基準結果可作為進一步測試的起點。

MLPerf Training v4.1 結果與提交條件

來源指出,NVIDIA 首次以 Blackwell 在 MLPerf Training 的預覽類別提交結果,並在該輪各項 MLPerf Training 基準中提交 Blackwell 成績。相對於 Hopper 的每 GPU 標準化比較,來源列出以下提升:

基準工作負載相對 Hopper 的每 GPU 提升
LLM LoRA 微調2.2 倍
LLM 預訓練2.0 倍
圖神經網路2.0 倍
文字轉圖像1.7 倍
推薦系統1.6 倍
物件偵測1.6 倍
自然語言處理1.4 倍

各提交系統配置 8 個 Blackwell GPU,執行時熱設計功耗為 1,000W,並採用第五代 NVLink 與 NVLink Switch 互連;節點間使用 NVIDIA ConnectX-7 SuperNIC 與 NVIDIA Quantum-2 InfiniBand 交換器。這些條件代表基準系統的組成,不等同於所有 Blackwell 伺服器、網路配置或部署規模。

LLM 預訓練與微調的適用情境

GPT-3 175B 預訓練基準可用於觀察大模型訓練時的加速器效率。來源表示,HGX B200 較大的 HBM3e 記憶體容量與較高頻寬,讓 GPT-3 基準可在 64 個 GPU 上執行且不影響每 GPU 效能;來源同時指出,為取得 HGX H100 的最佳每 GPU 效能,提交規模為 256 個 GPU。此比較有助於規劃模型平行與叢集規模,但實際所需 GPU 數仍取決於模型架構、序列長度、批次大小、精度、資料管線與可接受的訓練時間。

對企業客製化既有模型的場景,Llama 2 70B LoRA 基準聚焦參數高效率微調。來源指出,單一 HGX B200 伺服器相較於 HGX H100 伺服器的微調效能提升為 2.2 倍。此結果較適合用於初步評估微調迭代速度;上線時延、推論吞吐、模型品質與治理要求則需要個別驗證。

評估與導入路徑

  1. 先界定目標工作負載:區分全量預訓練、LoRA 等 PEFT 微調,以及圖神經網路、推薦或多模態訓練需求。
  2. 以完整 SKU/BOM 核對 GPU 數量、伺服器型號、NVLink 組態、網路介面、InfiniBand 交換器、供電與散熱條件。
  3. 使用自身模型、資料規模與訓練框架進行概念驗證,量測訓練時間、每 GPU 效率、擴展效率、記憶體餘裕及網路瓶頸。
  4. 確認軟體相依性。來源提及 cuBLAS、cuDNN、NVIDIA Transformer Engine,以及針對 GEMM、卷積、多頭注意力、記憶體頻寬利用和通訊重疊的最佳化;實際可用功能與版本相容性應以具日期的 NVIDIA 官方文件確認。
  5. 將基準數據與整體成本、機房功率、散熱能力、網路架構及維運流程一併評估,而非只比較單 GPU 成績。

結果解讀的限制

MLPerf 是標準化訓練基準,能協助比較特定提交條件下的表現,但無法取代專案測試。來源中的倍數主要是與 Hopper 提交進行每 GPU 標準化比較;它們不保證在自訂模型、不同 GPU 數量、不同互連、不同軟體版本或不同資料處理流程下重現。來源亦提到 GB200 NVL72、ConnectX-8 SuperNIC 與 Quantum-X800 的預期能力;由於該段內容使用預期描述,任何採購或架構決策都應以具日期的官方產品文件、完整 BOM 與實測結果為準。

常見問題

MLPerf Training v4.1 的 2 倍與 2.2 倍,能否直接換算為訓練時間減半?

不能直接換算。來源中的數值是特定 MLPerf 工作負載與提交系統下的每 GPU 效能比較。實際訓練時間還會受模型實作、資料讀取、檢查點、通訊拓撲、有效批次大小與軟體設定影響,應以目標工作負載進行測試。

評估 Blackwell 時,是否只需比較 GPU 數量與峰值效能?

不夠。來源所述提交同時依賴 NVLink、NVLink Switch、ConnectX-7 SuperNIC 與 Quantum-2 InfiniBand。大規模訓練需連同記憶體、節點內互連、節點間網路、功率與散熱,以及軟體堆疊共同評估。

結論

依據來源於 2025 年 1 月所述的 MLPerf Training v4.1 提交,NVIDIA Blackwell 在 LLM 預訓練與 LoRA 微調呈現相對 Hopper 的顯著每 GPU 提升。對規劃大型訓練叢集或縮短模型客製化週期的團隊,這些結果具參考價值;最終平台選型仍應以官方文件、完整系統配置與專案實測驗證。

圍繞「NVIDIA Blackwell 在 MLPerf Training v4.1 的 LLM 訓練表現」繼續瞭解 NVIDIA 產品與網路方案