隨著 AI 應用從一次性問答轉向長時運行的智能體系統,模型面對的挑戰已經不只是「答得對」,而是要在多輪推理、工具調用、子代理協作和長上下文處理中持續保持效率與穩定性。NVIDIA 最新發佈的 Nemotron 3 Ultra,正是圍繞這類場景打造的一款開放模型,目標是在複雜智能體工作流中兼顧高精度、更高吞吐與更低任務成本。
根據 NVIDIA 介紹,Nemotron 3 Ultra 採用 550B 參數的 Mixture-of-Experts 架構,但每次推理僅激活其中約 55B 參數,因而在維持前沿級推理能力的同時,盡量降低實際執行開銷。它面向的不是簡單的單輪聊天,而是要支撐長期任務中那些「關鍵但不頻繁」的高難度決策,例如跨多次編碼會話維持架構一致性、在大量研究資料中綜合矛盾證據,或在複雜約束下執行工程級驗證。
文章強調,Nemotron 3 Ultra 在效率上同樣是核心賣點。NVIDIA 表示,該模型相較同等級開放模型可實現最高約 5 倍吞吐提升,並在部分智能體基準任務中用更少的總 token 完成目標,從而把任務完成成本降低最高約 30%。這意味著對於需要持續運行、頻繁調用模型的智能體系統而言,性能提升不只是響應更快,也直接關係到部署成本與可持續運營能力。
支撐這些表現的關鍵,在於模型和訓練方法的多項協同設計。Nemotron 3 Ultra 結合了 Hybrid Mamba Transformer、NVFP4 精度支援、LatentMoE 路由以及 Multi-Token Prediction 等技術,使其在長上下文效率、跨架構部署和生成吞吐上獲得更優平衡。訓練階段則引入 Multi-Teacher On-Policy Distillation,讓多個專長不同的教師模型對學生模型在不同領域進行異步評分和迭代優化,從而持續增強跨領域推理能力。
在資料層面,NVIDIA 也延續了 Nemotron 系列強調開放與可追溯的策略。官方披露,該版本建立在 10T token 預訓練基礎上,並額外補充了法律、通用知識與 GitHub 代碼等高價值領域資料,同時發佈新的監督微調樣本、強化學習任務和環境。對企業與主權 AI 場景來說,這種更透明的資料與訓練路徑,有助於在評估模型能力的同時,更清楚其來源、偏向與可定制空間。
從實際落地角度看,Nemotron 3 Ultra 並不是孤立發佈的模型,而是被放入更完整的智能體參考棧中。NVIDIA 同時強調了它與 Hermes Agent、NemoClaw、OpenShell 等組件的配合方式:由高能力模型承擔複雜編排與推理,再借助安全運行時和開放式 harness 承接長期執行。對正在構建生產級智能體平台的團隊來說,這釋放出一個清晰信號——未來的競爭重點,不僅是誰的模型更大,而是誰能在真實多代理工作流中,以更低成本穩定完成複雜任務。
WeChat
Profile