新聞中心

iGenius Colosseum 355B:以 NVIDIA DGX Cloud 支援受監管 LLM 訓練 NEWS DETAIL

當前位置:首頁 > 新聞中心
資訊分類 · 新聞中心 作者 · 中科新遠內容團隊 審核人 · 中科新遠技術內容組 發佈時間 · 2025-02-05 更新時間 · 2026-07-22 來源 · 原頁面資料;原廠資訊待核驗
iGenius Colosseum 355B:以 NVIDIA DGX Cloud 支援受監管 LLM 訓練

對需要在金融、公共管理等受監管環境建立專屬大型語言模型的團隊而言,iGenius Colosseum 355B 案例說明:持續預訓練、對齊流程與大規模 GPU 基礎設施必須一併規劃。依據 2025 年 2 月 5 日的來源資料,iGenius 使用 NVIDIA DGX Cloud、NVIDIA AI Enterprise 軟體與 NVIDIA NeMo Framework,完成 Colosseum 355B 的持續預訓練與對齊工作。此案例可作為評估大規模 LLM 訓練流程的參考,但不應直接視為其他組織的效能、成本、合規或部署成果保證。

要解決的問題:通用模型與受監管業務需求之間的落差

通用基礎模型雖可支援推理、程式碼生成、翻譯與摘要等任務,但來源指出,當任務涉及金融、醫療健康等專業知識,或需要掌握非英語語言及文化細節時,仍可能存在限制。對受監管產業而言,模型能力之外,資料控制、自訂方式、部署架構與驗證流程同樣會影響採用決策。

iGenius 將 Colosseum 355B 用於支援其商業智慧代理 Crystal,並描述了一套端對端架構,包括資料庫整合、AI 輔助設定、由 LLM 支援的工具使用與查詢執行、生成式編排,以及專用部署基礎設施。這種架構方向適合需要將模型、企業資料與專用工具納入可管理工作流程的團隊;實際資料隔離、存取控制與法規符合性,仍須由採購方依其司法管轄區、資料類型及完整方案設計另行驗證。

來源所述的訓練能力與基礎設施條件

來源指出,iGenius 在註冊 NVIDIA DGX Cloud 後一週內取得超過 3,000 張 NVIDIA H100 GPU 的私有環境存取權,環境包含 RDMA 型高頻寬專用網路、500 TB Lustre 高效能儲存,以及 NVIDIA NeMo Framework 容器。iGenius 在兩個月內完成 Colosseum 355B 的持續預訓練,工作內容包括擴大模型參數、將上下文長度由 4K 擴展至 16K、採用 FP8,以及加入特定領域能力調整。

這些數字反映的是該專案的特定配置與工作負載,而非所有 DGX Cloud 使用情境的固定規格或交付承諾。規劃類似專案時,應以採購當日的正式服務文件、雲端供應商區域條件、GPU 配額、網路拓撲、儲存效能與完整 SKU/BOM 為準。

資料、持續預訓練與模型對齊路徑

iGenius 的持續預訓練資料集保留與原始資料集可比較的程式碼與多語言 token 分布,以降低重大分布偏移及災難性遺忘風險。來源稱其資料涵蓋超過 50 種語言,重點包括多種歐洲語言,也納入日文、中文、阿拉伯文、越南文與韓文,並加入金融與推理領域的專業來源。資料集約含 2.5T token;若按基數計算,總計可產生 10T token。

模型訓練後,iGenius 以監督式微調(SFT)及 Direct Preference Optimization(DPO)進行對齊。SFT 使用約 100 萬個樣本,以任務需求、事實召回、分析推理與程式設計問題等目標挑選資料;DPO 則以偏好與拒絕回答配對,進一步調整回答偏好。對企業團隊而言,重點不在複製資料量,而在建立可追溯的資料授權、清理、抽樣、版本控管與評測標準。

效能調校與導入評估重點

來源描述 iGenius 先以較小規模測試訓練組態,再逐步擴展。初始的 4K 上下文 BF16 配置在 96 張 H100 GPU 上達到 25% MFU;調整平行化與 NVIDIA NeMo 通訊重疊設定後,在 64 張 GPU 上達到 40% MFU。當模型擴展至 355B 參數與 16K 上下文後,MFU 降至 33%;其後啟用 FP8,來源稱 MFU 提升至 37%,整體訓練步長提升 1.15 倍。

上述結果顯示,增加模型大小與序列長度可能改變最佳平行化策略,FP8 也需要針對數值穩定性進行測試。來源提到,iGenius 在發現不穩定跡象時降低學習率,並考慮透過張量直方圖分析,讓可能溢位或下溢的層維持 BF16。採購或技術評估應先以小型除錯模型驗證 checkpoint、資料管線、NCCL 通訊與 FP8 設定,再逐步提高資料並行規模。

驗證邊界與實施風險

iGenius 以 MMLU 與 IFEval 等基準協助評估模型知識、推理與指令遵循能力;來源稱 Colosseum 355B 在 5-shot MMLU 設定下達到 82.04% 準確率。該基準成績僅適用於來源描述的模型、資料、設定與評測方法,不能推論為特定金融、公共服務或企業內部任務的準確率。

大規模訓練的風險還包括 checkpoint 同步讀寫造成的儲存延遲、網路鏈路抖動、節點健康問題、訓練中斷及組態難以重現。來源建議縮短 checkpoint 間隔進行端到端測試、採用支援不同平行化布局復原的 checkpoint 格式、保存環境變數與訓練腳本,並針對可疑或新增節點執行預定測試。正式上線前,團隊還應以自己的資料集、模型輸出政策、資安要求與業務情境進行專案驗證。

常見問題

Colosseum 355B 是否代表所有受監管工作負載都適合自行訓練基礎模型?

不一定。來源展示的是 iGenius 針對其主權 AI 與高度受監管使用情境所採取的路徑。自行持續預訓練需要大量資料工程、GPU 資源、分散式訓練專業能力與評測機制。若需求主要是企業知識問答或有限任務自動化,應先比較 RAG、微調與持續預訓練的資料治理、延遲、成本及維運負擔。

評估 NVIDIA DGX Cloud 相關訓練環境時,應先確認哪些項目?

應確認實際可取得的 GPU 型號與數量、區域與容量條件、網路及儲存架構、軟體版本、資料移轉方式、身分與存取控制、監控機制、checkpoint 復原能力,以及支援範圍。來源中的 3,000 多張 H100 GPU、500 TB Lustre 儲存與特定訓練時程屬於 iGenius 專案描述,必須以日期明確的官方文件、合約條款與專案測試確認是否適用。

結論

iGenius Colosseum 355B 案例的核心價值,在於呈現受監管 LLM 專案如何將資料策略、持續預訓練、SFT、DPO、FP8 調校與大規模基礎設施整合。對決策者而言,應將其作為架構與驗證方法的參考,並透過完整 BOM、正式產品文件及自身工作負載測試,確認實際可行性與風險。

圍繞「iGenius Colosseum 355B:以 NVIDIA DGX Cloud 支援受監管 LLM 訓練」繼續瞭解 NVIDIA 產品與網路方案