Contexte et méthodologie
L’auteur a comparé trois approches – TabPFN, TabICL et XGBoost réglé – sur quatorze jeux de données issus du benchmark Grinsztajn (suite inria-soda/tabular-benchmark). Chaque jeu a été tronqué à 3 000 lignes, séparé 70/30 avec stratification et identifié par son sha256. Tous les modèles ont été exécutés sur le même GPU RTX 4070 Ti, le chronométrage étant strictement identique pour chaque exécution.
Fonctionnement des modèles de fondation tabulaires
TabPFN et TabICL sont des modèles de fondation pré‑entraînés sur des millions de tables synthétiques. Au moment de la prédiction, le modèle ne réalise aucune descente de gradient ; il reçoit les lignes d’entraînement comme contexte et produit les sorties en un seul passage avant (forward pass). Cette forme d’in‑context learning reprend le principe des grands modèles de langage, mais appliqué aux colonnes. Le code expose toujours une méthode fit, mais aucune mise à jour de poids n’est effectuée, ce qui rend le « fit » quasi instantané et transfère le coût principal à l’étape de prédiction.
Résultats du benchmark
Sur les six jeux détaillés, les AUC obtenues sont : crédit (0.8528), campagne bancaire (0.8699), réadmission clinique (0.6484), récidive (0.7329), demande d’électricité (0.8873) et dépistage moléculaire (0.8667). Dans chaque cas, TabICL ou TabPFN dépasse XGBoost. Sur trois jeux de risque de crédit, les scores sont : credit : TabICL 0.7667, TabPFN 0.7578, XGBoost 0.7533 ; heloc : TabICL 0.7222, TabPFN 0.7300, XGBoost 0.7078 ; default‑of‑credit : TabICL 0.6956, TabPFN 0.6967, XGBoost 0.6944. Le seul tableau où TabPFN dépasse TabICL est bank‑marketing (0.7967 contre 0.7944), mais les deux surpassent XGBoost (0.7833). Les temps d’inférence varient : pour les petits jeux (≈100 lignes, ≤11 colonnes) la prédiction prend 0.6‑0.8 s, alors que le jeu Bioresponse (419 colonnes) atteint 6 s. TabPFN montre des temps similaires, par exemple 0.014 s pour TabICL et 0.022 s pour TabPFN sur heloc.
Analyse des limites et perspectives
Le principal avantage observé est la suppression du processus d’optimisation d’hyperparamètres, qui devient « optionnel ». Cependant, le coût d’inférence reste non négligeable pour des tables très larges (plusieurs centaines de colonnes) et le modèle dépend d’une pré‑formation massive sur des données synthétiques, dont la représentativité vis‑à‑vis de domaines spécifiques n’est pas garantie. De plus, l’accès au modèle le plus cité nécessite désormais un compte, limitant la reproductibilité. Malgré ces contraintes, le benchmark montre que, jusqu’à 32 000 lignes, les modèles de fondation tabulaires offrent une performance supérieure à XGBoost sans phase d’entraînement, ce qui pourrait modifier les pratiques de sélection de modèles en data‑science.