隨著 AI 應用逐步從單輪問答走向多智能體協同和低延遲交互,大模型推理系統正面臨一個越來越突出的瓶頸:token 逐個生成的自回歸過程,會讓 GPU 難以充分釋放並行能力,也讓高交互場景下的吞吐和時延難以兼顧。NVIDIA 這篇文章介紹的 DFlash,正是針對這一問題提出的一種新型 speculative decoding 路徑,並在 Blackwell 平台上展示了顯著的推理加速效果。
與傳統 speculative decoding 依賴小模型逐 token 起草不同,DFlash 使用輕量級 block diffusion drafter,一次前向計算就能並行生成一整塊候選 token,再由目標大模型並行驗證。這意味著原本仍帶有串行特徵的「起草」階段,被改造成更適合 GPU 並行執行的 block 級工作流。在保持目標模型輸出品質不變的前提下,系統得以顯著提升吞吐,並改善高交互場景下的資源利用率。
根據 NVIDIA 披露的測試結果,在使用八張 NVIDIA DGX B300 GPU 運行 gpt-oss-120b 時,DFlash 在每用戶 500 到 600 tokens/s 的高交互區間內,可把吞吐提升到傳統自回歸解碼的 15 倍以上,同時也比 EAGLE-3 speculative decoding 高出約 1.5 倍。在更低併發下,它還能把單用戶交互速度提升到原來的兩倍以上。對面向編碼、推理和 agent 工作流的在線服務來說,這種改進直接對應更高併發承載能力和更低單位服務成本。
文章同時指出,DFlash 的價值不只在研究層面,更在於它正快速進入開發者現有的推理棧。研究團隊已經公開發佈 20 個 DFlash checkpoint,並提供 Blackwell 與 Hopper 的使用 recipe;在 vLLM、SGLang 以及 TensorRT-LLM 中,開發者也可以較低改動成本接入該方案。比如在單張 Blackwell Ultra GPU 上運行 Gemma 4 31B 時,vLLM 路徑下 DFlash 對不同任務可實現最高約 5.8 倍吞吐提升;在 Qwen3 8B + SGLang 路徑下,也能獲得最高約 5.1 倍提升。
從原理上看,DFlash 的關鍵在於把 speculative decoding 的 draft 階段從自回歸式 token-by-token 預測,轉換為 block-diffusion 並行預測,再結合目標模型 hidden states 條件化與 KV 注入機制,提高候選 token 的接受率。這樣一來,目標模型依舊負責最終驗證,輸出分布不被破壞,但整個生成鏈結獲得了更強並行性。這種設計尤其適合 Blackwell 這樣具備超高 NVFP4 計算能力和強大互連頻寬的平台。
對部署大模型推理服務的團隊而言,DFlash 傳遞出的信號很明確:推理優化的競爭,正在從單純拼模型大小,轉向更深入的系統級生成路徑重構。誰能更好地把 GPU 的並行潛力轉化為真實交互性能,誰就更有機會在代碼生成、檢索增強、推理型助手和多智能體平台中拿到更好的成本效率比。DFlash 在 NVIDIA 生態中的快速落地,也讓這種優化不再停留在論文層面,而開始進入可以直接試用的工程實踐。
WeChat
Profile