新聞中心

NVIDIA CUDA 13.3 發佈:Tile C++、編譯器自動調優與 Python 生態同步升級 NEWS DETAIL

當前位置:首頁 > 新聞中心
資訊分類 · 新聞中心 發佈時間 · 2026-07-21

NVIDIA 發佈 CUDA 13.3,為 GPU 開發生態帶來一組面向性能與開發體驗的集中升級。此次更新覆蓋 CUDA Tile C++、CUDA Python 1.0、CompileIQ 編譯器自動調優框架、CCCL 3.3、NVCC 的 C++23 支援,以及多項數學庫與分析工具優化,整體目標是讓開發者在保持高性能的同時,更高效地構建現代 GPU 軟體。

其中最受關注的變化之一,是 CUDA Tile 編程模型正式擴展到 C++。這一能力允許開發者以更高層級的 tile 方式編寫 GPU kernel,同時把並行性、內存移動、異步執行等底層細節交由框架管理,從而在保留性能的前提下,提高代碼可移植性與開發效率。文章還指出,CUDA Tile C++ 現已支援 Hopper 等更多架構,為現有 C++ 開發者提供了更直接的切入路徑。

Python 生態方面,CUDA Python 1.0 的發佈意味著相關 API 正式進入更穩定的語義化版本階段。`cuda.core`、`cuda.bindings`、`cuda.compute` 等組件的能力被進一步整合,並新增了 green contexts、進程級 checkpoint/restore、跨進程顯存共享等關鍵特性。這些變化有助於 Python 開發者構建更穩定的推理服務、共享集群任務和零拷貝資料通道,也讓 CUDA 在 Python 側的系統級能力更成熟。

對追求極致性能的團隊而言,CompileIQ 的推出同樣值得關注。文章表示,這一新的編譯器自動調優框架可通過進化與遺傳算法,為特定 kernel 自動生成更有針對性的編譯配置。在 GEMM 和 attention 這類關鍵內核上,CompileIQ 對已高度優化的 Triton 與 CUTLASS kernel 仍可帶來最高約 15% 的額外加速,說明編譯層自動調優正開始成為 GPU 優化的新抓手。

同時,CUDA 13.3 還把更多底層能力系統化推進。CCCL 3.3 新增了 DLPack/mdspan 張量互操作、隨機分布庫、並行搜索與 segmented scan 等能力;NVCC 與 NVRTC 正式增強對 C++23 的支援;cuBLAS、cuSPARSE、cuSOLVER 以及 Nsight 工具鏈也獲得了不同程度的性能和功能改進。整體來看,這不是單一特性的升級,而是從編程模型、語言標準、運行時到分析工具的一次協同演進。

對 GPU 開發者而言,CUDA 13.3 的價值在於它不只追求「更快」,也在試圖降低高性能開發的門檻。無論是更現代的 C++ 抽象、更穩定的 Python 接口,還是自動化的編譯優化路徑,背後都在釋放一個信號:未來的 GPU 軟體開發,將越來越強調性能、可維護性與跨語言工作流的統一演進。