En résumé
Hugging Face publie 207 noyaux WebGPU sous licence Apache-2.0.
Le chargeur JavaScript exécute les noyaux directement depuis le Hub.
Fleet collecte des mesures de performance et de justesse avec le consentement des utilisateurs.
Le signal : Les 207 noyaux WebGPU de Hugging Face affichent une avance médiane de 1,90x face à ORT WebGPU sur Apple M4.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Hugging Face publie le 1er septembre 2026 une bibliothèque JavaScript nommée @huggingface/kernels. Elle permet de charger et d’exécuter des noyaux WebGPU optimisés depuis le Hub. La collection initiale comprend 207 noyaux, chacun publié comme un dépôt individuel dans l’organisation webgpu-kernels. Ces composants ciblent les opérations utilisées par de nombreuses architectures et charges de travail d’apprentissage automatique. Ils sont distribués sous licence Apache-2.0. Hugging Face présente cette livraison comme la première couche de son effort consacré à l’inférence dans le navigateur. L’objectif déclaré consiste à rendre cette inférence plus rapide et plus simple à utiliser. Le projet associe aussi un outil de mesure baptisé Fleet.
Chaque noyau embarque un contrat d’interface, des modèles de nuanceurs WGSL, des cas de vérification et des scénarios de référence. Le fichier manifest.json définit les entrées, sorties, attributs, contraintes de types et règles de dérivation des formes. metadata.json conserve l’identifiant, les empreintes et la provenance. test.json rassemble les cas de justesse, tandis que bench.json regroupe les mesures et cas d’ajustement. Les fichiers *.wgsl.jinja contiennent les implémentations paramétrées. Cette organisation rend chaque opération inspectable, testable et versionnée. La fiche du noyau ai.onnx.Add documente notamment l’addition élément par élément, la diffusion multidirectionnelle et les variantes selon les formes et les appareils. Voir l’annonce de Hugging Face.
Le chargeur JavaScript s’installe avec npm install @huggingface/kernels@preview. Son exécution nécessite un navigateur compatible WebGPU. La disponibilité dépend du navigateur, du système d’exploitation, du processeur graphique et du pilote. Une application appelle getKernel avec l’identifiant du dépôt et la version du contrat. Elle fournit ensuite les données typées et les formes des tenseurs. Pour ai.onnx.Add, le chargeur déduit la forme de sortie [2, 3] à partir de deux entrées, puis alloue automatiquement le résultat. La version du contrat reste distincte d’un opset ONNX, d’une version d’opérateur ou d’une révision de modèle. Le même schéma d’appel doit fonctionner pour des opérations plus lourdes, comme ai.onnx.MatMul. Consulter le paquet npm.
Les tests comparatifs ont opposé les noyaux Hugging Face à ORT WebGPU sur un processeur graphique Apple M4. L’équipe a utilisé ONNX Runtime Web 1.30.0-dev.20260826-b1f76d586a et retenu 809 cas parmi 1 756, après vérification des sorties et des mesures. La moyenne géométrique indique une exécution 2,57 fois plus rapide, avec une médiane à 1,90 fois. Les noyaux ont remporté 629 comparaisons, contre 176 défaites et 4 égalités. Add atteint 3,52 fois, Softmax 2,11 fois et LayerNormalization 2,22 fois. MatMul atteint 1,14 fois. Un cas Einsum bilinéaire a mesuré 0,136 milliseconde contre 1 396 millisecondes pour ORT WebGPU. Ces résultats concernent le calcul sur le GPU, sans chargement ni lecture des sorties.
Fleet élargit les mesures avec une suite de tests et de références exécutée dans le navigateur. Elle évalue la justesse et la performance des noyaux sur le matériel de chaque participant. Avec son consentement, chaque exécution ajoute des éléments privés permettant de repérer des erreurs propres à certains appareils, de comparer des variantes et d’améliorer les règles de sélection. Hugging Face souligne que les performances changent selon les processeurs graphiques, les navigateurs et les pilotes. L’équipe travaille également avec celle d’ONNX Runtime pour intégrer ces améliorations dans l’écosystème ONNX Runtime Web. La collection WebGPU rejoint enfin les noyaux CUDA, ROCm et Metal disponibles sur la page Kernels du Hub. Lancer Fleet dans le navigateur.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés