在生產推理部署中,需求隨時間波動,推理副本需要彈性伸縮。然而在 Kubernetes 上冷啓動推理工作負載可能需要數分鐘,期間 GPU 已分配但處於空閒狀態。NVIDIA Dynamo Snapshot 通過檢查點/恢復機制解決了這一問題。
Dynamo Snapshot 結合了 CUDA 驅動級的檢查點能力和 CRIU 工具,可對推理工作進程的完整狀態(GPU 設備狀態和 CPU 主機狀態)進行序列化和恢復。當需要新副本時,直接從檢查點恢復,而非從零初始化,使啓動時間接近物理極限。
在 Kubernetes 環境中,Dynamo Snapshot 支援跨節點的檢查點分發和恢復。該技術使推理集群能夠在流量高峰時快速擴展,避免 SLA 違規風險。
NVIDIA Dynamo Snapshot 發佈:Kubernetes 上推理工作負載秒級啓動的核對路徑
針對NVIDIA Dynamo Snapshot 發佈:Kubernetes 上推理工作負載秒級啓動,現有文字只能作為初步背景。應再確認完整主題或型號、目前有效的來源文件、軟體或服務相依條件、安裝環境,以及驗收所需的證據。
將NVIDIA Dynamo Snapshot 發佈:Kubernetes 上推理工作負載秒級啓動用於引用、提交詢問或業務判斷前,需記錄假設、排除項、相容性核對、代表性測試、結果與未決問題。本頁不據此確認價格、庫存、交付、授權、認證或保固。
NVIDIA Dynamo Snapshot 發佈:Kubernetes 上推理工作負載秒級啓動的來源與變更記錄
後續核對NVIDIA Dynamo Snapshot 發佈:Kubernetes 上推理工作負載秒級啓動時,應保存來源網址、發布與更新日期、責任實體、適用地區、文件版本和引用段落;若資料來自轉述,還要回到可追溯的原始來源,區分已證實內容、編輯摘要與尚待確認的推論。
當NVIDIA Dynamo Snapshot 發佈:Kubernetes 上推理工作負載秒級啓動的型號、軟體、服務範圍或聯絡資訊出現變更,需重新檢查頁面結論、相關連結和驗收條件,並保留變更日期與覆核人,避免沿用已失效的資訊。
WeChat
Profile