# DiScoFormer réduit jusqu’à 37 fois l’erreur de densité

> Ai2 présente DiScoFormer, un transformer qui estime densité et score en un seul passage, avec une erreur réduite jusqu’à 37 fois en 100 dimensions.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-09 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/discoformer-reduit-lerreur-de-densite-jusqua-37-fois
Tags : ia, transformers, modèles génératifs, inférence bayésienne, calcul scientifique, inference

---

## En résumé

- Ai2 présente DiScoFormer, un modèle qui estime simultanément la densité et le score.
- DiScoFormer réduit l’erreur de score d’environ 6,5 fois en 100 dimensions face au meilleur KDE réglé.
- Le modèle s’adapte à des distributions hors entraînement sans données de densité ou de score annotées.

**Le signal :** DiScoFormer réduit l’erreur de densité de plus de 37 fois face au meilleur KDE réglé en 100 dimensions.

**Ai2 présente** DiScoFormer, un transformer conçu pour estimer simultanément la densité et le score d’une distribution. L’annonce a été publiée le 29 juin 2026 par l’Allen Institute for AI. Le modèle reçoit un ensemble de points et produit les deux estimations lors d’un seul passage. La densité indique les zones où les observations se concentrent. Le score correspond au gradient du logarithme de cette densité. Il pointe donc vers les régions où la probabilité augmente le plus rapidement. Cette information intervient notamment dans les [modèles génératifs](/signal-ia/actu/discoformer-estime-densite-et-score-sans-reentrainement) par diffusion, l’échantillonnage bayésien et les simulations de particules utilisées pour étudier des systèmes comme les plasmas.

**Deux approches** Les méthodes actuelles opposent généralisation et précision selon le problème traité. L’estimation par noyaux, ou KDE, fonctionne sans entraînement et s’applique à toute distribution. Sa précision diminue toutefois fortement lorsque la dimension augmente. Les modèles neuronaux de score restent précis dans ces dimensions élevées, mais chaque modèle doit apprendre une distribution particulière. Ils doivent ensuite être réentraînés pour une nouvelle distribution. DiScoFormer vise une réutilisation plus large. Il estime la densité et le score à partir des données fournies, sans réentraînement entre deux distributions. Ai2 détaille l’approche dans [son article de présentation](https://allenai.org/blog/discoformer) et dans [son rapport technique](https://arxiv.org/pdf/2511.05924).

## Ai2 couple densité et score

**Une architecture partagée** DiScoFormer utilise des couches empilées de blocs transformer et un mécanisme d’attention croisée. Celui-ci permet d’évaluer la densité et le score en n’importe quel point, y compris hors des observations disponibles. Le modèle possède une base commune et deux têtes de sortie. La première prédit la densité. La seconde prédit le score. Leur relation mathématique impose que le score corresponde au gradient du logarithme de la densité. Ai2 exploite cette contrainte comme une perte de cohérence sans étiquette. Pendant l’[inférence](/signal-ia/actu/apple-compresse-ses-modeles-generatifs-avec-idea-prune), quelques étapes de gradient appliquées à cette perte permettent au modèle de s’adapter à une entrée hors distribution, sans vérité terrain supplémentaire.

**KDE comme fondation** Ai2 établit aussi un lien analytique entre l’attention et l’estimation par noyaux. Dans KDE, une largeur de bande fixe détermine la portée de l’influence de chaque observation. Selon l’analyse présentée, les poids d’une tête d’attention se comportent presque comme un noyau gaussien appliqué aux données. Un bloc d’attention croisée peut donc déjà reproduire la densité et le score de KDE. DiScoFormer apprend ensuite plusieurs échelles et les adapte aux données. L’architecture inclut ainsi KDE comme cas particulier, au lieu de remplacer directement cette méthode classique par une boîte noire. Cette propriété relie la nouvelle approche à une technique déjà utilisée sans entraînement.

## DiScoFormer dépasse KDE en 100 dimensions

**Des mélanges gaussiens** L’entraînement repose sur des modèles de mélanges gaussiens, ou GMM. Ai2 les utilise parce qu’ils peuvent approximer des distributions lisses avec suffisamment de composantes. Leurs densités et leurs scores disposent aussi d’expressions exactes. Chaque lot d’entraînement reçoit un nouveau GMM. DiScoFormer observe ainsi une grande variété de distributions cibles. Le modèle est supervisé avec la densité et le score exacts de chaque mélange. Cette procédure fournit les références nécessaires pour entraîner les deux sorties du [transformer](/signal-ia/actu/discoformer-reduit-lerreur-du-kde-de-plus-de-37-fois). Elle explique aussi comment l’équipe teste le comportement du modèle sur des distributions différentes de celles rencontrées pendant l’apprentissage.
