Par Arthur Dekeyser
En résumé
Hetzner expérimente une API d'inférence utilisant un modèle LLM de taille raisonnable.
Cette initiative vise à explorer le potentiel du marché de l'inférence IA.
Le modèle utilisé est compatible OpenAI et teste l'utilisation des ressources GPU.
Le signal : Hetzner propose depuis juillet 2026 une API d'inférence avec le modèle Qwen3.6-35B-A3B-FP8, testée sur sa propre infrastructure.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs
Hetzner teste actuellement un nouveau modèle d’inférence pour les LLM sur sa propre infrastructure, exploitant le modèle Qwen3.6-35B-A3B-FP8, depuis le 23 juillet 2026. Cette expérimentation se fait à travers une API compatible OpenAI sans frais. L’objectif est de comprendre la demande et la scalabilité de cette solution dans un contexte de test, sans engagement de qualité de service pour le moment. Consultez Hetzner Experiments pour plus d’informations.
L’offre actuelle se focalise sur un modèle unique offrant des possibilités intéressantes. Ce modèle, avec ses 35 milliards de paramètres, accueille un contexte étendu de 262 000 tokens. Il est conçu pour faciliter le test grandeur nature des capacités d’inférence IA sans nécessité de clusters de GPU colossaux. La communautéOpenCode peut ainsi se connecter à l’API pour exploiter ce modèle.
Les performances mesurées lors des expérimentations initiales révélaient une rapidité notable, avec une latence de 153 millisecondes pour la production du premier jet de token et une capacité de 224 tokens par seconde. Ces résultats, bien que prometteurs, reflètent des tests isolés et ne garantissent pas de performances dans des conditions d’utilisation intensive. Consultez les spécifications du modèle sur Hugging Face.
Le contexte économique pousse Hetzner à maximiser l’utilisation de ses ressources matériel grâce à cette API. En partageant la puissance de ses GPU entre plusieurs utilisateurs, Hetzner pourrait rentabiliser des unités de traitement souvent inexploitées. Cela permettrait d’aligner cette offre sur des besoins réels de marché, tout en minimisant les coûts d’exploitation pour les petites entreprises.
Pour les PME françaises, cette initiative offre une opportunité d’explorer des solutions d’IA à moindre coût, et de potentiellement intégrer ces capacités dans leurs services via une API bien établie. Ce mouvement stratégique pourrait ainsi ouvrir de nouvelles perspectives pour les entreprises cherchant un levier compétitif dans l’intégration technologique.
Les perspectives futures envisagées suggèrent une expansion possible vers des clusters GPU plus sophistiqués, ce qui permettrait à Hetzner de rivaliser avec d’autres fournisseurs leaders sur le segment de l’inférence IA. Leur expertise en infrastructure et leur emplacement stratégique en Europe leur confèrent un avantage certain. Pour approfondir, explorez les détails de leur offre GPU actuelle.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs