En résumé
Ai2 présente DiScoFormer pour estimer densité et score depuis un échantillon.
Le modèle utilise une architecture partagée avec deux têtes de sortie.
En 100 dimensions, DiScoFormer réduit fortement les erreurs face à KDE.
Le signal : DiScoFormer réduit en 100 dimensions l’erreur de score d’environ 6,5 fois face à KDE.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Ai2 présente DiScoFormer, un transformeur conçu pour estimer simultanément la densité et le score d’une distribution. Le modèle reçoit un ensemble de points et produit ces deux quantités en un seul passage. Il ne nécessite pas de réentraînement pour chaque nouvelle distribution. La densité indique les zones où les points se concentrent. Le score, gradient du logarithme de la densité, indique la direction vers laquelle la probabilité augmente rapidement. Ai2 décrit cette approche dans un article publié le 29 juin 2026. Le billet de présentation d’Ai2 détaille l’architecture et les résultats annoncés.
Deux usages liés La densité et le score interviennent dans plusieurs méthodes de calcul. Les modèles génératifs fondés sur la diffusion suivent le score pour transformer du bruit aléatoire en image réaliste. Le même objet mathématique intervient dans l’échantillonnage bayésien et les simulations de particules utilisées pour modéliser des systèmes comme les plasmas. Les méthodes existantes imposent toutefois un compromis. L’estimation par noyaux, ou KDE, ne demande aucun entraînement et s’applique à toute distribution. Son exactitude diminue fortement lorsque la dimension augmente. Les modèles neuronaux de score restent précis en grande dimension, mais doivent apprendre chaque distribution séparément.
Une architecture commune DiScoFormer utilise des couches empilées de blocs transformeurs et une attention croisée. Cette attention permet d’évaluer la densité et le score en n’importe quel point, même en dehors des emplacements observés. Le modèle possède une base partagée et deux têtes de sortie. L’une estime la densité, tandis que l’autre estime le score. Ai2 exploite leur relation mathématique pour imposer une cohérence entre les sorties. Le score doit correspondre au gradient du logarithme de la densité. À l’inférence, quelques pas de gradient sur cette cohérence permettent au modèle de s’adapter à une entrée hors distribution, sans densité ni score de référence.
KDE devient un cas Ai2 relie aussi DiScoFormer à l’estimation classique par noyaux. KDE applique une largeur de bande unique, qui fixe la portée de l’influence de chaque point. L’équipe montre analytiquement que les poids d’une tête d’attention ressemblent presque à un noyau gaussien appliqué aux données. Un bloc d’attention croisée peut donc déjà reproduire la densité et le score de KDE. DiScoFormer apprend ensuite plusieurs échelles et les adapte aux données. Pour entraîner le modèle, Ai2 génère un nouveau modèle de mélange gaussien pour chaque lot. Ces mélanges fournissent des densités et des scores exacts comme cibles d’apprentissage. Le rapport technique présente les détails mathématiques.
Les écarts augmentent Les évaluations rapportées par Ai2 placent DiScoFormer devant KDE pour l’estimation de la densité et du score. En 100 dimensions, le modèle réduit l’erreur de score d’environ 6,5 fois face au meilleur KDE réglé manuellement. Il réduit aussi l’erreur de densité de plus de 37 fois. DiScoFormer continue de progresser lorsque le nombre d’échantillons augmente, tandis que KDE atteint une limite de mémoire dans ces expériences. Le modèle reste précis sur des mélanges comportant davantage de modes que ceux vus pendant l’entraînement. Il fonctionne également sur des formes non gaussiennes, notamment les distributions de Laplace et de Student-t. KDE conserve un avantage de vitesse sur les petits jeux de données.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés