# Ai2 calcule densité et score en un seul passage

> Ai2 présente DiScoFormer, un modèle Transformer qui estime densité et score en un seul passage, sans réentraînement pour chaque distribution.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-10-02 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/ai2-devoile-discoformer-densite-et-score-en-un-passage
Tags : modèles, transformers, statistiques, génération, recherche, inference

---

## En résumé

- DiScoFormer estime la densité et le score d’une distribution en un seul passage.
- Le modèle utilise une architecture partagée avec deux têtes de sortie spécialisées.
- En 100 dimensions, DiScoFormer réduit fortement les erreurs par rapport à KDE.

**Le signal :** DiScoFormer réduit l’erreur de score d’environ 6,5 fois en 100 dimensions face au meilleur KDE réglé manuellement.

**Ai2 présente** DiScoFormer, un modèle Transformer qui estime simultanément la densité et le score d’une distribution. L’équipe décrit cette approche dans une publication datée du 29 juin 2026. Le modèle reçoit un ensemble de points de données. Il produit la densité et le score en un seul passage. Il ne nécessite pas de réentraînement pour chaque nouvelle distribution. La densité indique les zones où les observations se concentrent. Le score correspond au gradient du logarithme de la densité. Il indique la direction vers laquelle cette densité augmente le plus rapidement. Cette information intervient notamment dans les [modèles génératifs](/signal-ia/actu/discoformer-estime-densite-et-score-sans-reentrainement) fondés sur la diffusion, l’échantillonnage bayésien et certaines simulations scientifiques.

**Le compromis actuel** oppose deux familles de méthodes. L’estimation par noyau, ou KDE, calcule la densité à partir des points voisins. Elle ne demande aucun entraînement et s’applique à toute distribution. Sa précision diminue toutefois fortement lorsque la dimension augmente. Les modèles neuronaux d’estimation du score restent précis dans ces dimensions élevées. Ils doivent cependant apprendre chaque distribution séparément. Un nouveau problème impose donc généralement un nouvel entraînement. DiScoFormer vise à réunir ces deux propriétés. Il conserve une capacité d’adaptation aux distributions. Il évite aussi de repartir de zéro pour chaque cas. Ai2 présente cette architecture comme une solution commune pour la densité et le score.

## DiScoFormer partage deux sorties

**Une architecture couplée** forme le cœur de DiScoFormer. Le modèle utilise des couches empilées de blocs [Transformer](/signal-ia/actu/discoformer-reduit-lerreur-du-kde-de-plus-de-37-fois) et une attention croisée. Cette attention permet d’évaluer la densité et le score à n’importe quel point. Elle ne se limite donc pas aux observations présentes dans l’échantillon. Le modèle possède un socle partagé et deux têtes de sortie. La première prédit la densité. La seconde prédit le score. La relation mathématique entre ces deux quantités impose une contrainte supplémentaire. Le score doit correspondre au gradient du logarithme de la densité. Ai2 exploite cet écart comme une perte de cohérence sans étiquette. Cette contrainte intervient également pendant l’inférence.

**Une adaptation sans cible** intervient ensuite sur des entrées éloignées des données d’entraînement. DiScoFormer conserve le contexte de l’échantillon. Il effectue quelques étapes de gradient sur la perte de cohérence. Cette adaptation ne demande ni densité exacte ni score de référence. L’architecture reprend aussi une propriété de l’estimation par noyau. Ai2 montre analytiquement qu’une tête d’attention produit des poids proches d’un noyau gaussien. Un bloc d’attention croisée peut donc reproduire la densité et le score de KDE. DiScoFormer va plus loin avec plusieurs échelles. Le modèle apprend ces échelles et les adapte aux données. KDE reste ainsi un cas particulier intégré dans cette architecture, plutôt qu’une méthode simplement remplacée.

## Le modèle dépasse KDE en 100 dimensions

**Les données d’entraînement** proviennent de mélanges de lois gaussiennes. Ai2 utilise ces modèles pour deux raisons précises. Les mélanges de lois gaussiennes peuvent approximer toute distribution régulière avec suffisamment de composantes. Leurs densités et leurs scores disposent également de formes exactes. L’équipe génère un nouveau mélange pour chaque lot d’entraînement. DiScoFormer reçoit ainsi de nombreux exemples de distributions cibles. Chaque exemple possède une densité exacte et un score exact pour la supervision. Les évaluations comparent ensuite le modèle à KDE. Elles portent sur la densité et le score, avec plusieurs dimensions et plusieurs formes de distributions. Cette procédure mesure directement les deux sorties du modèle.
