# DiScoFormer calcule densité et score sans réentraînement

> Ai2 présente DiScoFormer, un transformer qui estime densité et score en un passage, avec une erreur réduite jusqu’à 37 fois en 100 dimensions.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-08-25 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/discoformer-reduit-jusqua-37-fois-lerreur-de-kde
Tags : modèles, recherche, génératif, bayésien, inference

---

## En résumé

- Ai2 présente DiScoFormer comme un modèle unique pour estimer densité et score.
- Le modèle réduit fortement les erreurs de KDE lorsque la dimension atteint 100.
- DiScoFormer s’adapte à des distributions inédites sans utiliser de vérité terrain.

**Le signal :** DiScoFormer réduit l’erreur de densité de plus de 37 fois face à KDE en 100 dimensions.

**Ai2 présente** DiScoFormer, un [transformer](/signal-ia/actu/discoformer-reduit-lerreur-du-kde-de-plus-de-37-fois) conçu pour estimer simultanément la densité et le score d’une distribution. L’annonce figure dans un article publié le 29 juin 2026. Le modèle reçoit un ensemble de points et produit ces deux quantités en un seul passage, sans nouvel entraînement pour chaque distribution. La densité décrit les zones où les observations se concentrent. Le score correspond au gradient du logarithme de cette densité. Il indique la direction dans laquelle la probabilité augmente le plus rapidement. Ai2 détaille cette approche dans son [article de présentation](https://allenai.org/blog/discoformer) et renvoie à un [rapport technique](https://arxiv.org/pdf/2511.05924).

**Le modèle associe** un socle partagé à deux têtes de sortie. La première estime la densité. La seconde estime le score. Cette organisation exploite leur relation mathématique, puisque le score est le gradient du logarithme de la densité. Ai2 impose ainsi une cohérence entre les deux sorties, sans utiliser d’étiquette supplémentaire pour cette contrainte. Le modèle utilise aussi l’[attention](/signal-ia/actu/lilian-weng-devoile-les-cles-pour-accelerer-les-transformers) croisée. Elle lui permet d’évaluer densité et score à n’importe quel point interrogé, y compris hors des positions présentes dans l’échantillon. Cette capacité distingue l’approche d’une simple évaluation limitée aux données observées.

## DiScoFormer dépasse KDE en 100 dimensions

**Les résultats montrent** un avantage marqué sur l’estimation par noyaux, ou KDE. En 100 dimensions, DiScoFormer réduit l’erreur du score d’environ 6,5 fois face au meilleur KDE réglé manuellement. Il réduit aussi l’erreur de densité de plus de 37 fois. Le modèle continue de progresser lorsque le nombre d’échantillons augmente. KDE, lui, finit par manquer de mémoire dans cette configuration. KDE conserve toutefois un avantage de vitesse lorsque les jeux de données restent petits. Ces résultats situent donc la proposition d’Ai2 sur le compromis entre précision en haute dimension et rapidité d’exécution.

**L’entraînement repose** sur des modèles de mélanges gaussiens, ou GMM. Ai2 en génère un nouveau pour chaque lot d’entraînement. Les GMM servent ici de familles de distributions capables d’approcher toute distribution lisse avec suffisamment de composantes. Ils fournissent également des densités et des scores calculables exactement. Le modèle reçoit donc des cibles précises durant l’apprentissage. Les évaluations testent ensuite des mélanges comportant davantage de modes que ceux vus pendant l’entraînement. Elles incluent aussi des formes non gaussiennes, notamment les distributions de Laplace et de Student-t. DiScoFormer reste précis sur ces distributions selon Ai2.

## Le modèle s’adapte sans vérité terrain

**L’adaptation intervient** lors de l’[inférence](/signal-ia/actu/baseten-bouscule-hugging-face-avec-kimi-k3), avec le contexte maintenu fixe. DiScoFormer effectue quelques pas de gradient sur sa contrainte de cohérence entre densité et score. Cette adaptation ne nécessite ni densité de référence ni score annoté. Ai2 indique que le modèle peut ainsi répondre à des entrées hors distribution. L’architecture reprend par ailleurs une intuition de KDE. Les poids d’une tête d’attention unique sont analytiquement proches d’un noyau gaussien appliqué aux données. Un bloc d’attention peut donc reproduire KDE, tandis que plusieurs échelles apprises permettent d’aller au-delà de cette méthode classique.
