大語言模型正在快速改變金融交易與投研分析方式。通過處理財報、新聞、社交媒體情緒和市場資料,這類系統可以幫助機構更快生成交易洞察並優化投資決策。為了衡量相關基礎設施在真實金融推理場景中的能力,STAC Research 推出了 STAC-AI 基準,其中 LANG6 聚焦於面向金融任務的大模型推理性能。
NVIDIA 在這篇文章中披露了多套平台在 STAC-AI LANG6 上的表現,重點展示了 Blackwell 架構在金融推理中的吞吐與交互優勢。測試覆蓋 Llama 3.1 8B Instruct 和 70B Instruct,並基於 EDGAR 10-K 年報相關資料集,模擬中等長度與長上下文的金融分析和摘要任務。基準既衡量離線批處理吞吐,也評估交互模式下的響應速度和單位用戶輸出速率。
從結果來看,基於 HGX B200 的 NVIDIA Blackwell 平台在多個測試組合中都實現了顯著領先。文章指出,在部分場景下,Blackwell 相比上一代平台可實現最高 2.8 倍的性能提升,並在更高吞吐下維持更好的交互體驗。對於需要同時兼顧請求密度和用戶響應速度的金融推理工作負載,這種吞吐與時延之間的平衡尤為關鍵。
硬體之外,軟體棧也是此次成績的重要組成部分。文中說明,模型量化採用了 NVIDIA TensorRT Model Optimizer,其中 Hopper 平台使用 FP8,而 Blackwell 平台進一步使用 NVFP4。推理執行則基於 TensorRT-LLM,以充分調用不同平台上最優的高性能內核,同時保持相對熟悉的 PyTorch 運行體驗。
文章還給出了一套面向企業自測的實踐路徑,包括使用 TensorRT-LLM 容器、下載並量化模型、生成符合自身業務 token 分布的測試集,以及運行吞吐基準。也就是說,這篇文章不僅展示了官方跑分結果,也試圖為金融機構或行業團隊提供一條可複製的性能評估路線,讓他們能圍繞自身資料特徵和時延目標進行更貼近生產的基準驗證。
對金融行業而言,Blackwell 在 STAC-AI 上刷新紀錄的意義,不只是單項跑分更高,而是說明大模型推理平台已經能夠在更複雜的長上下文分析任務中,兼顧速度、吞吐和部署靈活性。隨著金融機構持續把生成式 AI 引入投研、交易和風控流程,這類以真實行業資料分布為導向的推理基準,也會成為評估基礎設施投入回報的重要依據。
WeChat
Profile