在物理 AI 訓練中,資料品質往往決定了機器人和自主系統能否真正適應複雜真實環境。但只依賴真實世界採集,不僅成本高、速度慢,還會受到安全性和場景覆蓋範圍的限制。NVIDIA 這篇文章展示了一條更自動化的路徑:通過 NeMo Agent Toolkit 連接多智能體工作流,把 3D 場景改造、路徑規劃、視訊生成和真實感增強整合成可由自然語言驅動的合成資料流水線。
文章描述的核心並不是單一生成模型,而是一套協同分工的 agent 系統。用戶只需要給出高層目標,例如在倉儲場景中添加障礙物、重新規劃機器人路徑、錄制導航視訊,再把結果增強成真實電商倉庫畫面;隨後,規劃 agent、場景理解與修改 agent、視訊錄制工具以及 Cosmos 相關模型會依次接力執行,把原本需要 3D 專家、仿真工程師和資料團隊共同完成的流程,收斂成更自動化的多步驟工作流。
在技術棧上,這套方案融合了 NeMo Agent Toolkit、Omniverse、OpenUSD、USD Search NIM、USD Code NIM 以及 Cosmos Transfer / Cosmos Reason 等組件。其價值在於:不僅能通過自然語言控制 OpenUSD 場景中的對象搜索、障礙物放置和路徑更新,還能對生成的視訊進行真實感增強,並進一步由 reasoning agent 判斷輸出是否適合用於訓練導航策略。也就是說,它不只是「多生成點資料」,而是在嘗試把資料生成、品質控制和訓練適配串成閉環。
文章還強調了 headless 運行與批量化潛力。借助 Omniverse 的無界面自動化擴展,這套多智能體 SDG 流程可以在非圖形界面環境中通過 API 大規模運行,適合雲端部署和批處理場景。對於需要快速擴展不同倉儲佈局、障礙物組合、光照條件和運動路徑的機器人團隊來說,這意味著仿真資料生產不再局限於少量人工調參,而是可以演變為大規模、系統化的場景工廠。
從更長遠的角度看,這篇文章傳遞出的重點,是合成資料正在從「輔助工具」升級為物理 AI 開發的核心環節。而多智能體系統的加入,則讓資料生成不再只是一次性渲染流程,而變成可理解目標、可分解任務、可自動修改場景、可驗證結果的智能管線。對於需要持續迭代機器人策略的團隊而言,這種能力會顯著影響訓練效率與場景覆蓋能力。
如果說生成式 AI 正在改變文本和圖像生產方式,那麼在機器人與物理 AI 領域,NeMo Agent Toolkit 與 Omniverse、Cosmos 的組合,則正在把合成資料生成推向更高自動化程度。它為開發者提供的不只是更快造資料的方法,而是讓物理 AI 訓練環境開始具備「自己構造訓練世界」的能力。
WeChat
Profile