Présentation

NVIDIA Kumo Tabular est un modèle de fondation ouvert dédié aux données tabulaires, publié sur Hugging Face. Il accepte une table d’entraînement contenant des lignes étiquetées et prédit les étiquettes de nouvelles lignes en un seul passage avant, sans phase d’ajustement, de réglage d’hyperparamètres ou d’ingénierie de caractéristiques. Le modèle est disponible en trois tailles – 28 M, 78 M et 215 M de paramètres – et est distribué sous licence OpenMDW‑1.1, autorisant un usage commercial.

Architecture et mécanismes

Le cœur de Kumo Tabular est un Transformer structuré autour de trois formes d’attention : colonne, ligne et in‑context, inspirées de TabICL et TabPFN. Chaque cellule devient un token ; les valeurs numériques et catégorielles sont encodées via des features de Fourier (sines et cosinus de fréquences apprises) avec des poids distincts selon le type. Les valeurs manquantes ne sont pas imputées mais traitées par un token dédié, ce qui évite toute perte d’information.

Les lignes sont ensuite agrégées grâce à une alternance d’attention colonne (coût linéaire en nombre de lignes, apprend la distribution d’une valeur dans sa colonne) et d’attention ligne (utilise des positions rotatives pour distinguer les colonnes). Quatre tokens [CLS] apprennent à résumer chaque ligne et servent de lecture finale. Un dernier Transformer opère sur les embeddings de lignes : les lignes de contexte s’attendent entre elles, tandis que les lignes de requête n’attendent que le contexte. Cette séparation permet de mettre en cache les clés/valeurs du contexte et de réutiliser le calcul pour de multiples prédictions, grâce à la technique Test‑GQA qui réduit la taille du cache.

Pour la sortie, un head produit des probabilités de classe (classification) ou 999 quantiles (régression). Le point de prédiction et l’estimation d’incertitude sont dérivés de ces quantiles. Un mécanisme de « temperature d’attention dépendante de la longueur » ajuste la température du softmax en fonction du logarithme du nombre de clés, maintenant une attention nette même pour des tables très larges.

Entraînement sur données artificielles

Kumo Tabular a été pré‑entraîné exclusivement sur des tables synthétiques générées par un modèle causal structurel (SCM). Le processus comprend : (1) le tirage aléatoire d’une configuration de table (taille, tâche, mécanismes, taux de valeurs manquantes) ; (2) la création d’un graphe causal aléatoire reliant des variables cachées, chaque nœud étant évalué par une fonction tirée parmi des cartes linéaires, de petits réseaux neuronaux, des arbres ou des processus gaussiens ; (3) la désignation de colonnes numériques ou catégorielles, d’une cible et de variables cachées. Un post‑traitement introduit des corrélations entre colonnes, clippe les valeurs extrêmes et injecte des valeurs manquantes. Un filtre rapide basé sur un ensemble d’arbres élimine les tables ne contenant aucun signal apprenable. Cette génération procédurale fournit un flux infini de tables variées, garantissant que le modèle ne dépend d’aucun jeu de données réel.

Performances et limites

Sur les quatre benchmarks standards – TabArena, BeyondArena, TALENT et ScoringBench – Kumo Tabular se classe premier, dépassant les modèles de gradient‑boosted trees traditionnels et les approches de fine‑tuning de grands modèles. La capacité à prédire sans entraînement supplémentaire réduit considérablement le cycle de vie du modèle, de la collecte de labels à la mise en production. Cependant, le modèle reste limité aux tables dont la distribution ressemble à celle des tables synthétiques générées ; des écarts majeurs de distribution ou des relations causales non modélisées pourraient réduire la précision. De plus, la dépendance à la taille du contexte implique que des tables extrêmement larges nécessitent un ajustement de la température d’attention, ce qui peut introduire une sensibilité aux hyperparamètres de température appris.