NVIDIA、表形式データ向けオープン基盤モデル「Kumo Tabular」を公開
NVIDIAは、合成データのみで事前学習され、手動のチューニングを行わずに即座に予測を実行できる表形式データ向けオープン基盤モデル群「Kumo Tabular」を発表した。
NVIDIA、表形式データ向けオープン基盤モデル「Kumo Tabular」を発表
NVIDIAの研究チームは、表形式データの分類および回帰タスク向けに設計されたオープン基盤モデル「NVIDIA Kumo Tabular」のリリースを発表した。「NVIDIA Kumo Structured」コレクションの一部であるこのモデルは、手動での特徴量エンジニアリングやハイパーパラメータ探索、タスク固有の追加学習を必要とせず、単一のフォワードパスで新たな行のラベルを予測する。
Kumo Tabularは2,800万から2億1,500万パラメータにおよぶ3つのサイズが用意されており、商用利用可能なOpenMDW-1.1ライセンスのもと、オープンソースライブラリとともに公開された。モデルの重みはHugging Faceで公開されており、基盤コードはGitHub上のNVIDIAの構造化データリポジトリでホストされている。
アーキテクチャ、合成データによる事前学習、ベンチマーク結果
表形式の構造に合わせて調整されたTransformerとして構築されたKumo Tabularは、TabICLやTabPFNの概念を取り入れたカラム(列)、行、およびインコンテキスト・アテンション機構を採用している。パイプラインはセルの埋め込みから始まり、セルのグループがトークン化される。数値およびカテゴリ値は学習された周波数を持つフーリエ特徴量を通過し、欠損値は事前の補完処理を必要とせずに直接処理される。行の埋め込みは、行数に対して線形にスケーリングするコストで列方向の特徴量分布を追跡するカラム・アテンションと、Rotary Position Embedding(RoPE)および4つの学習可能な[CLS]トークンを用いて特徴量間を処理する行アテンションを交互に繰り返す。
最終段階ではインコンテキスト学習が用いられ、コンテキスト行同士が互いにアテンションを向ける一方で、クエリ行はTest-GQAを介して厳密にコンテキスト行のみにアテンションを向ける。これにより、キャッシュされたKeyとValueを将来の予測全体で再利用できるようになる。大規模なテーブルにおけるアテンションの劣化を防ぐため、同モデルはヘッドごとに学習された係数を用いてKeyの数に応じてクエリを対数的にスケーリングする「length-aware attention temperature(長さを考慮したアテンション温度係数)」を導入している。回帰ヘッドは、点推定値および不確実性の指標とともに999個の分位点を出力する。
Kumo Tabularは、構造的因果モデル(SCM)から手続き的に生成された合成テーブルのみを用いて学習が行われた。現実世界の乱雑さを反映させるため、プロシージャルサンプラーによって欠損値のパターン、裾の重い回帰ターゲット、高カーディナリティのカテゴリ、粗視化された特徴量が注入される。学習は3段階で構成され、最初は1,024行・最大100列から始まり、400〜10,240行へと拡大され、最終的には最大60,000行まで拡張された。合計でSmall、Medium、Largeの各バリアントは、それぞれ約3,500万、7,100万、1億3,700万件の人工テーブルを処理した。
実証ベンチマークの結果は以下の通りだ。
- TabArena: Kumo Tabularはレーティング(ELO)1950で総合1位を獲得し、1基のNVIDIA RTX 6000 Proを使用した評価環境においてLimiX-2よりも17倍高速に動作した。
- BeyondArena: レーティング(ELO)1418、改善性スコア(Improvability score)7.78%で1位を獲得した。
- TALENT: 分類精度で平均順位6.67位、分類ログ損失で3.98位、回帰RMSEで4.22位を記録し、総合トップを獲得した。
- ScoringBench: LargeおよびMediumのチェックポイントが平均順位で1位と2位を占めた。
同モデルは単一のフォワードパスで最大10クラスまでの数値およびカテゴリ入力をネイティブに処理し、NVIDIAのGPUネイティブライブラリ(sdm)が誤り訂正出力コード(ECOC)を活用することで任意のクラス数への対応を拡張している。なおNVIDIAは、クエリの分布がコンテキスト行と大きく乖離している場合や、学習範囲から外れている場合には性能が低下する可能性があると指摘している。
エンタープライズの表形式ワークフローをインコンテキスト学習へ移行
約20年間にわたり、顧客の解約予測、不正検知、価格設定、デフォルトリスクといったエンタープライズの表形式予測タスクは、勾配ブースティング決定木やAutoGluonなどのAutoMLフレームワークに依存してきた。従来の決定木ワークフローは効果的であるものの、個別の課題や特徴量セットごとに専用モデルを一から学習させる必要があった。
Kumo Tabularは、大規模言語モデル(LLM)によって普及したインコンテキスト学習のパラダイムを構造化データテーブルへと適用する。既存のラベル付きサンプルをプロンプト空間内のコンテキストとして直接読み込むことで、表形式基盤モデルは、手動での特徴量前処理、ハイパーパラメータ最適化、個別のデプロイパイプラインという反復サイクルを、単一のフォワード実行によるプロンプトベースの推論へと置き換えることを目指している。



