NVIDIA 釋出開源表格資料基礎模型 Kumo Tabular
NVIDIA 推出 Kumo Tabular 系列開源表格基礎模型,完全採用合成資料訓練,無需手動調校即可提供即時預測能力。
NVIDIA 推出開源表格基礎模型 Kumo Tabular
NVIDIA 研究人員宣布推出 NVIDIA Kumo Tabular,這是一款專為表格資料分類與迴歸任務設計的開源基礎模型。作為 NVIDIA Kumo Structured 系列的一員,該模型能在單次前向傳播(forward pass)中直接預測新資料列的標籤,完全不需手動進行特徵工程、超參數搜尋或特定任務的微調訓練。
Kumo Tabular 提供三種尺寸規格,參數規模介於 2,800 萬至 2.15 億之間,並搭配基於 OpenMDW-1.1 授權條款的開源函式庫一同釋出,可供商業使用。模型權重已於 Hugging Face 開放下載,相關底層程式碼則託管於 GitHub 上的 NVIDIA 結構化資料儲存庫。
架構、合成預訓練與基準測試結果
Kumo Tabular 採用專為表格結構量身打造的 Transformer 架構,借鑑了 TabICL 與 TabPFN 的概念,整合了欄(column)、列(row)以及情境(in-context)注意力機制。處理流程始於儲存格嵌入(cell embedding),將儲存格群組轉換為權符(token);數值與類別值會經過具備可學習頻率的傅立葉特徵(Fourier features),且無需事前填補即可直接處理缺失值。列嵌入則在欄注意力與橫跨特徵的列注意力之間交替進行——欄注意力負責追蹤縱向欄位的特徵分布,運算成本隨列數呈線性增長;列注意力則利用旋轉位置嵌入(rotary position embeddings)與四個可學習的 [CLS] 權符來捕捉特徵間的交互關係。
最後階段則仰賴上下文學習(in-context learning):情境列之間彼此注意,而查詢列(query rows)則透過 Test-GQA 嚴格僅注意情境列,使得快取的鍵(keys)與值(values)能在後續的預測中重複利用。為了避免在大型表格上出現注意力衰退的問題,該模型引入了長度感知的注意力溫度(length-aware attention temperature),利用每個注意力頭獨立學習的係數,將查詢向量依據鍵的數量進行對數縮放。迴歸頭則輸出 999 個分位數,並同時提供點估計值與不確定性指標。
Kumo Tabular 完全基於結構因果模型(Structural Causal Models, SCM)程序化生成的合成表格進行訓練。為了反映真實世界的複雜與雜亂情況,程序化取樣器注入了缺失值模式、厚尾迴歸目標(heavy-tailed regression targets)、高基數類別(high-cardinality categories)以及粗化特徵。訓練分為三個階段:最初從 1,024 列且最多 100 欄開始,接著擴展至 400 到 10,240 列之間,最後延伸至最多 60,000 列。總計 Small、Medium 與 Large 三種版本分別學習了約 3,500 萬、7,100 萬和 1.37 億張人工合成表格。
在各項實證基準測試中:
- TabArena: Kumo Tabular 以 1950 的 ELO 評分奪得整體第一名,在以單張 NVIDIA RTX 6000 Pro 為基礎的評估環境中,運算速度比 LimiX-2 快上 17 倍。
- BeyondArena: 以 1418 的 ELO 評分與 7.78% 的可改進性分數(Improvability score)位居榜首。
- TALENT: 該模型取得整體最佳排名,在分類準確率上的平均排名為 6.67、分類對數損失(log-loss)為 3.98,迴歸 RMSE 則為 4.22。
- ScoringBench: 其 Large 與 Medium 檢查點版本在平均排名上分列第一與第二名。
該模型原生支援在單次前向傳播中處理最多 10 個類別的數值與類別輸入,並搭配 NVIDIA 的 GPU 原生函式庫(sdm),利用錯誤更正輸出碼(error-correcting output codes)將支援擴展至任意類別數量。NVIDIA 亦指出,若查詢資料的分布與情境列有顯著落差,或超出訓練資料的範圍,模型效能可能會有所下滑。
將企業表格工作流程轉向上下文學習
近二十年來,企業常見的表格預測任務——例如客戶流失預測、詐欺偵測、定價策略與違約風險評估——主要仰賴梯度提升決策樹(GBDT)以及像 AutoGluon 這類的 AutoML 框架。儘管這些工具十分有效,但傳統的決策樹工作流程在面對每一個獨立問題與特徵集時,都必須從頭開始重新訓練專屬模型。
Kumo Tabular 將大型語言模型所普及的上下文學習典範移植至結構化資料表上。透過在提示空間(prompt space)中直接讀入既有的已標記樣本做為上下文,表格基礎模型旨在以單次前向執行的提示推論,全面取代人工特徵預處理、超參數最佳化以及獨立部署等繁瑣的重複流程。



