AI RACE— 每日追蹤 AI 競爭賽局
New Models

NVIDIA 釋出開源表格資料基礎模型 Kumo Tabular

NVIDIA 推出 Kumo Tabular 系列開源表格基礎模型,完全採用合成資料訓練,無需手動調校即可提供即時預測能力。

2026/09/29 22:30
New Models

NVIDIA 推出開源表格基礎模型 Kumo Tabular

NVIDIA 研究人員宣布推出 NVIDIA Kumo Tabular,這是一款專為表格資料分類與迴歸任務設計的開源基礎模型。作為 NVIDIA Kumo Structured 系列的一員,該模型能在單次前向傳播(forward pass)中直接預測新資料列的標籤,完全不需手動進行特徵工程、超參數搜尋或特定任務的微調訓練。

Kumo Tabular 提供三種尺寸規格,參數規模介於 2,800 萬至 2.15 億之間,並搭配基於 OpenMDW-1.1 授權條款的開源函式庫一同釋出,可供商業使用。模型權重已於 Hugging Face 開放下載,相關底層程式碼則託管於 GitHub 上的 NVIDIA 結構化資料儲存庫。

架構、合成預訓練與基準測試結果

Kumo Tabular 採用專為表格結構量身打造的 Transformer 架構,借鑑了 TabICL 與 TabPFN 的概念,整合了欄(column)、列(row)以及情境(in-context)注意力機制。處理流程始於儲存格嵌入(cell embedding),將儲存格群組轉換為權符(token);數值與類別值會經過具備可學習頻率的傅立葉特徵(Fourier features),且無需事前填補即可直接處理缺失值。列嵌入則在欄注意力與橫跨特徵的列注意力之間交替進行——欄注意力負責追蹤縱向欄位的特徵分布,運算成本隨列數呈線性增長;列注意力則利用旋轉位置嵌入(rotary position embeddings)與四個可學習的 [CLS] 權符來捕捉特徵間的交互關係。

最後階段則仰賴上下文學習(in-context learning):情境列之間彼此注意,而查詢列(query rows)則透過 Test-GQA 嚴格僅注意情境列,使得快取的鍵(keys)與值(values)能在後續的預測中重複利用。為了避免在大型表格上出現注意力衰退的問題,該模型引入了長度感知的注意力溫度(length-aware attention temperature),利用每個注意力頭獨立學習的係數,將查詢向量依據鍵的數量進行對數縮放。迴歸頭則輸出 999 個分位數,並同時提供點估計值與不確定性指標。

Kumo Tabular 完全基於結構因果模型(Structural Causal Models, SCM)程序化生成的合成表格進行訓練。為了反映真實世界的複雜與雜亂情況,程序化取樣器注入了缺失值模式、厚尾迴歸目標(heavy-tailed regression targets)、高基數類別(high-cardinality categories)以及粗化特徵。訓練分為三個階段:最初從 1,024 列且最多 100 欄開始,接著擴展至 400 到 10,240 列之間,最後延伸至最多 60,000 列。總計 Small、Medium 與 Large 三種版本分別學習了約 3,500 萬、7,100 萬和 1.37 億張人工合成表格。

在各項實證基準測試中:

  • TabArena: Kumo Tabular 以 1950 的 ELO 評分奪得整體第一名,在以單張 NVIDIA RTX 6000 Pro 為基礎的評估環境中,運算速度比 LimiX-2 快上 17 倍。
  • BeyondArena: 以 1418 的 ELO 評分與 7.78% 的可改進性分數(Improvability score)位居榜首。
  • TALENT: 該模型取得整體最佳排名,在分類準確率上的平均排名為 6.67、分類對數損失(log-loss)為 3.98,迴歸 RMSE 則為 4.22。
  • ScoringBench: 其 Large 與 Medium 檢查點版本在平均排名上分列第一與第二名。

該模型原生支援在單次前向傳播中處理最多 10 個類別的數值與類別輸入,並搭配 NVIDIA 的 GPU 原生函式庫(sdm),利用錯誤更正輸出碼(error-correcting output codes)將支援擴展至任意類別數量。NVIDIA 亦指出,若查詢資料的分布與情境列有顯著落差,或超出訓練資料的範圍,模型效能可能會有所下滑。

將企業表格工作流程轉向上下文學習

近二十年來,企業常見的表格預測任務——例如客戶流失預測、詐欺偵測、定價策略與違約風險評估——主要仰賴梯度提升決策樹(GBDT)以及像 AutoGluon 這類的 AutoML 框架。儘管這些工具十分有效,但傳統的決策樹工作流程在面對每一個獨立問題與特徵集時,都必須從頭開始重新訓練專屬模型。

Kumo Tabular 將大型語言模型所普及的上下文學習典範移植至結構化資料表上。透過在提示空間(prompt space)中直接讀入既有的已標記樣本做為上下文,表格基礎模型旨在以單次前向執行的提示推論,全面取代人工特徵預處理、超參數最佳化以及獨立部署等繁瑣的重複流程。

◗ 參考來源

Hugging Face Blog09/29

相關文章