Par Arthur Dekeyser
En résumé
Google présente TabFM pour prédire sur des tables inédites sans entraînement manuel.
Le modèle apprend les relations entre lignes et colonnes grâce à une architecture d’attention hybride.
TabFM a été évalué sur 38 jeux de classification et 13 jeux de régression.
Le signal : TabFM évalue 38 jeux de classification et 13 jeux de régression dans TabArena, avec des tables de 700 à 150 000 échantillons.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Google Research présente TabFM. Le 30 juin 2026, Weihao Kong et Abhimanyu Das ont annoncé un modèle fondation dédié aux données tabulaires. TabFM vise les tâches de classification et de régression en mode zéro-shot. Le modèle produit des prédictions sur une nouvelle table en un seul passage. Cette approche évite, selon Google Research, l’entraînement manuel, l’optimisation des hyperparamètres et l’ingénierie complexe des variables. Les données tabulaires soutiennent notamment la prévision du désabonnement client et l’identification de fraudes financières. TabFM est disponible dans les dépôts Hugging Face et GitHub.
Les méthodes classiques dominent. Les algorithmes supervisés comme AdaBoost, XGBoost et les forêts aléatoires ont longtemps occupé une place centrale sur les données structurées. Leur déploiement demande toutefois plusieurs étapes pour chaque nouveau jeu de données. Les scientifiques des données doivent souvent rechercher des hyperparamètres et concevoir des variables adaptées au domaine. Google Research applique à TabFM le principe d’apprentissage en contexte utilisé par les grands modèles de langage. Le modèle reçoit des exemples historiques et des lignes cibles dans un même contexte. Il interprète alors les relations entre colonnes et lignes au moment de l’inférence, sans modifier ses paramètres pour chaque tâche.
Une architecture hybride traite les tables. Les tables sont bidimensionnelles et leur ordre n’altère pas leur signification. TabFM combine donc trois mécanismes inspirés de TabPFN et TabICL. Une attention alternée parcourt les colonnes et les lignes afin de représenter les interactions entre variables. Les informations contextualisées de chaque ligne sont ensuite compressées dans un vecteur dense unique. Un Transformer dédié applique enfin l’apprentissage en contexte sur ces vecteurs compressés. Cette dernière étape réduit le coût de calcul par rapport à une attention appliquée à la grille brute. Google Research indique que cette conception conserve une prédiction efficace sur des jeux de données plus volumineux.
L’entraînement repose sur des données synthétiques. Les tables industrielles ouvertes restent rares, car leurs schémas et leurs informations peuvent être propriétaires ou sensibles. Google Research a donc entraîné TabFM entièrement sur des centaines de millions de jeux de données synthétiques. Ces jeux sont générés dynamiquement avec des modèles causaux structurels et de nombreuses fonctions aléatoires. Cette génération cherche à représenter diverses distributions et relations complexes entre variables. L’article de recherche décrit cette stratégie comme une réponse à la rareté des tables ouvertes nécessaires au pré-entraînement. Google Research affirme que TabFM généralise ainsi à des tables réelles inédites dans ses évaluations.
Le benchmark couvre 51 jeux. Google Research a évalué TabFM sur TabArena, un système de référence vivant qui calcule des scores Elo selon les victoires en confrontations directes. L’évaluation comprend 38 jeux de classification et 13 jeux de régression. Leur taille varie de 700 à 150 000 échantillons. La configuration TabFM fonctionne directement, sans réglage ni validation croisée. Une variante nommée TabFM-Ensemble ajoute des variables croisées et des variables issues de la décomposition en valeurs singulières. Elle calcule les poids optimaux d’un ensemble de 32 modèles avec une méthode des moindres carrés non négatifs. La classification ajoute aussi une calibration de Platt. Pour aller plus loin, consultez notre guide sur l’analyse prédictive IA pour les ventes PME.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés