新聞中心

NVIDIA Run:ai 與 NIM:把 GPU 利用率提升約 2 倍的推理調度方法 NEWS DETAIL

當前位置:首頁 > 新聞中心
資訊分類 · 新聞中心 發佈時間 · 2026-07-17

企業在部署大模型推理服務時,常常面臨一個被低估但成本極高的問題:不同模型對 GPU 資源的需求差異很大,小型嵌入模型可能只佔用少量顯存,而 70B 以上的大模型則可能需要多張 GPU。結果就是,許多集群長期處於低平均利用率狀態,不是為了安全預留太多資源,就是因為缺乏精細調度能力而被迫過度配置。

NVIDIA 在這篇文章中指出,問題的關鍵不只是「把更多工作塞進 GPU」,而是根據推理工作負載的行為模式進行更智能的調度。文章以 NVIDIA NIM 與 NVIDIA Run:ai 的組合為例,說明如何通過容器化推理微服務和面向推理場景的調度策略,在不顯著犧牲吞吐的前提下,提升 GPU 利用率並降低整體算力成本。

NIM 的作用是把模型部署標準化,通過預打包推理引擎、行業通用 API、自動化優化和生產級容器,幫助團隊更穩定地交付推理服務。而真正讓 GPU 利用率顯著提高的,是 Run:ai 在資源調度層面的能力。文章總結了多項關鍵機制,包括針對推理業務的默認高優先級、帶顯存隔離的 GPU fractions、面向併發波動的動態 GPU fractions,以及適合低頻模型的 GPU memory swap 方案。

從測試結果看,這些調度策略帶來的提升相當明顯。文章給出的基準顯示,在將多個 NIM 微服務通過 fractions 與 bin packing 部署到約 1.5 張 H100 GPU 的等效資源後,整體 GPU 利用率可提升約 2 倍,同時仍保留 91% 到 100% 的單卡基線吞吐。在高併發場景下,動態 fractions 可帶來最高約 1.4 倍吞吐提升和更低延遲;對於低頻訪問模型,GPU memory swap 相比 scale-from-zero 可實現 44 到 61 倍更快的首請求時延表現。

這些結果說明,推理調度已經不再只是簡單的 Kubernetes 資源分配問題,而是影響推理成本、吞吐和用戶體驗的核心控制層。尤其是在混合運行多種模型、流量波動明顯、且對首響應時間敏感的企業環境中,顯存隔離、動態彈性和冷熱模型管理能力,正在成為大模型推理平台的關鍵基礎設施能力。

對正在建設 AI 推理集群的企業來說,Run:ai 與 NIM 的組合價值,在於讓模型部署和 GPU 調度分別走向標準化與智能化。前者降低服務交付複雜度,後者提高底層資源使用效率。隨著推理服務規模不斷擴大,這類圍繞「更高利用率、更低時延、更少浪費」展開的調度能力,很可能會成為企業控制 AI 基礎設施成本的決定性因素。