
NVIDIA DOCA 2.9是用於運用 NVIDIA 網路硬體加速能力的軟體框架版本,面向 AI 計算叢集、雲端網路與資料中心資料路徑。依來源資料,其更新重點涵蓋東西向 AI 網路的壅塞控制與高頻遙測,以及南北向連線、虛擬化、租戶隔離和裝置管理。對規劃 BlueField DPU、SuperNIC 或相關網路平台的團隊而言,DOCA 2.9 可作為評估可程式化卸載、可觀測性與集中管理能力的起點;實際可用功能仍須依完整 SKU/BOM、正式版本文件與專案測試確認。
DOCA 2.9 要解決的基礎設施問題
AI 與高效能運算環境通常同時面臨大量東西向流量、壅塞診斷不足、資料路徑 CPU 負擔,以及多租戶隔離與裝置管理複雜度。來源指出,DOCA 透過 API、函式庫與工具,支援將部分工作負載卸載、加速或隔離至 NVIDIA 網路平台,以協助開發資料中心基礎設施。
這不代表任何既有環境都能直接獲得固定效能提升。網路拓樸、NIC/DPU 型號、交換器、主機作業系統、驅動程式、應用程式資料路徑與流量型態,都會影響實際結果。採購或升級決策應先界定要改善的是 AI 訓練通訊、雲端虛擬網路、媒體資料流、儲存虛擬化,或安全監控。
AI 網路:壅塞控制與高頻遙測
來源將 Spectrum-X 1.2 參考架構列為 DOCA 2.9 的支援重點,並描述其採用 NVIDIA BlueField-3 SuperNIC、NVIDIA Spectrum-4 交換器,以及 NVIDIA DGX H100 與 NVIDIA HGX H100 平台的組合。該來源宣稱此參考架構可在單一網路中容納最多 128,000 個 GPU;此規模應視為特定參考架構的描述,而非所有部署的保證。
DOCA 2.9 亦涵蓋 NVIDIA 網路壅塞控制 NVNCC Gen2 與 InfiniBand 壅塞控制 IBCC。來源表示,IBCC針對 InfiniBand 上的 AI 工作負載最佳化;NVNCC則改善 Spectrum-X 的拓樸偵測,並支援長距離 RoCE。對跨機櫃或跨站點的 RoCE 設計,應以端到端延遲、封包遺失、壅塞通知、路由策略與故障情境測試確認效果。
新增的 DOCA 遙測函式庫支援指定計數器、時間間隔及頻率的 API,並可觀察 RX/TX 位元組、連接埠、壅塞通知與 PCIe 延遲等計數器。來源稱其計數器讀取間隔可低於 100 微秒。高頻遙測可提升異常分析粒度,但也必須評估資料蒐集、儲存、告警規則與分析平台的成本。
雲端連線、安全與虛擬化能力
在南北向流量與雲端網路方面,DOCA Flow 加入名為 tune 的效能分析工具;來源明確標示該工具處於 alpha 階段。它用於呈現已配置的流量管線,協助檢視與調整流量配置,因此不宜在未完成版本成熟度、支援範圍與回退方案驗證前,作為關鍵生產流程的唯一依據。
來源亦稱 OVS-DOCA 已正式推出,支援本機鏡像,並可搭配 DPDK 或核心資料路徑。文中對連線追蹤 CPS 與 PPS 的提升使用「有望」表述,沒有提供測試條件;評估時應要求官方測試方法、封包大小、規則規模、CPU 配置與版本資訊,再在目標工作負載下進行基準測試。
對多租戶環境,DOCA 2.9 包含以 OVN 為基礎的裸機租戶隔離編排服務,來源描述其可透過 API 與 Ansible 手冊在 BlueField DPU 上部署。DOCA App Shield 則擴充 Linux 容器監控與程序網路連線資訊。這些能力可支援隔離與監控設計,但不應被解讀為完整安全控制的替代品;身分存取、日誌保留、事件回應與網段政策仍須整體規劃。
裝置管理、資料路徑與部署評估
DOCA 管理服務 DMS 在來源中被描述為通用狀態,提供以單一 API 端點管理多台 BlueField DPU 與 SuperNIC 的能力,並支援節點重啟時的設定持久性,以及設定批次匯入與匯出。對大規模部署而言,應先驗證 API 權限模型、組態版本控管、失敗回復與既有維運工具的整合方式。
資料來源也提到 DOCA DPA 工具組與 Nsight 工具整合,DOCA-DPA-Comms 函式庫則處於測試階段。另有 DOCA SNAP virtio-fs 測試版、BlueField-3 的 PLDM 韌體更新測試版,以及由 MLNX_OFED 轉向 DOCA-OFED 的路徑。MLNX_OFED 是歷史上的 Mellanox 網路軟體品牌脈絡;實際遷移前應查閱具日期的 NVIDIA 相容性矩陣、DOCA-OFED 文件、作業系統支援清單與完整 BOM,並建立回退計畫。
導入前的建議驗證路徑
- 盤點 GPU、NIC、DPU、交換器、主機作業系統、虛擬化平台與現有驅動程式版本。
- 依目標情境選擇驗證範圍,例如 RoCE 壅塞控制、高頻遙測、OVS-DOCA、OVN 租戶隔離或 DMS 管理。
- 在隔離測試環境量測延遲、吞吐量、CPU 使用率、故障切換、組態持久性與可觀測性資料量。
- 確認 alpha、測試版與通用版本功能的支援等級,並以官方文件界定生產環境使用條件。
常見問題
DOCA 2.9 是否適合所有 AI 叢集?
不一定。來源重點放在 NVIDIA 網路平台與特定架構能力。是否適合取決於現有硬體、互連技術、軟體堆疊、流量模式與營運需求。尤其是 RoCE、InfiniBand、DPU 卸載或大規模遙測,均應在實際拓樸中驗證。
可以直接以來源中的效能數字作為採購承諾嗎?
不可以。來源中的 128,000 GPU 規模、低於 100 微秒讀取間隔,以及 OVS-DOCA 的預期提升,分別受參考架構、功能設定與測試條件影響。採購前應取得具日期的官方產品文件與測試條件,並完成專案 PoC 或驗收測試。
結論
NVIDIA DOCA 2.9 將 AI 網路壅塞控制、高頻遙測、雲端網路、DPU 管理與隔離能力納入同一軟體框架。它較適合需要評估硬體卸載與可程式化資料路徑的 AI 或雲端基礎設施團隊;最終設計與採購決策應以相容性文件、完整組態及目標環境測試為準。
圍繞「NVIDIA DOCA 2.9:強化 AI 與雲端基礎設施的軟體框架」繼續瞭解 NVIDIA 產品與網路方案。
WeChat
Profile