GGUF remplace GGML dans llama.cpp, sans changer la quantification
#llama 3 min · 21 septembre 2026

GGUF remplace GGML dans llama.cpp, sans changer la quantification

Par Arthur Dekeyser

En résumé

1

GGUF remplace GGML pour identifier plus clairement l’architecture des modèles.

2

GPTQ quantifie des modèles de 175 milliards de paramètres en environ quatre heures GPU.

3

Safetensors réduit le risque d’exécuter du code arbitraire lors du chargement.

💡

Le signal : GGUF remplace GGML depuis 2023, tandis que GPTQ a quantifié des modèles de 175 milliards de paramètres en environ 4 heures GPU.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

GGUF remplace GGML depuis le 21 août 2023 pour les modèles exécutés avec GGML et ses exécuteurs dérivés. Le format binaire est notamment associé à llama.cpp. Son remplacement répond à des problèmes d’identification de l’architecture des modèles dans l’ancien format GGML. Cette évolution concerne donc le chargement et l’exécution des modèles, plutôt qu’une nouvelle méthode de quantification. La spécification de GGUF indique aussi deux objectifs de conception précis. Elle vise un déploiement dans un fichier unique et prévoit l’extensibilité du format. Ces choix donnent à GGUF un rôle de conteneur pour les exécutions fondées sur GGML. La documentation du projet détaille sa structure et ses objectifs dans la spécification GGUF.

GPTQ quantifie les poids selon une méthode post-entraînement en une seule passe. Elle utilise une information approximative du second ordre pour réduire la précision des poids. Le travail associé a quantifié des modèles de 175 milliards de paramètres jusqu’à trois ou quatre bits par poids. Cette opération a demandé environ quatre heures sur des processeurs graphiques. GPTQ se distingue ainsi de GGUF par sa fonction. GGUF décrit un format binaire d’exécution, tandis que GPTQ désigne une méthode de quantification des poids. Le travail GPTQ est attribué à Elias Frantar, Saleh Ashkboos, Torsten Hoefler et Dan Alistarh. La date associée à cette méthode est le 31 octobre 2022.

GGUF structure l’exécution des modèles

Un fichier unique simplifie le déploiement visé par la spécification de GGUF. Le format est conçu pour fonctionner avec GGML et des exécuteurs fondés sur cette base, dont llama.cpp. Sa conception prévoit également l’extensibilité, ce qui constitue un objectif explicite de la spécification. GGUF a remplacé GGML après l’identification de difficultés liées à l’architecture des modèles. Ces éléments placent le format au niveau de l’organisation des fichiers et de leur interprétation par les exécuteurs. La documentation de Hugging Face présente également GGUF dans sa documentation consacrée au format. Le lien entre GGUF et GPTQ dépend donc de leurs fonctions distinctes dans une chaîne de modèles.

Safetensors sécurise le chargement des fichiers de modèles en supprimant le risque d’exécuter du code arbitraire. Hugging Face a créé ce format de fichier. Safetensors est désormais répertorié comme projet de la PyTorch Foundation. Il ne s’agit pas d’une méthode de quantification comparable à GPTQ. Il ne s’agit pas non plus du format binaire GGUF décrit pour les exécuteurs GGML. Safetensors répond à une propriété de sécurité lors du chargement des fichiers. Le projet est accessible sur son dépôt GitHub, tandis que la PyTorch Foundation le répertorie parmi ses projets. Ces distinctions séparent le format de fichier, l’exécution et la réduction de précision.

Les choix dépendent donc de la fonction recherchée dans le cycle de déploiement. GGUF cible l’exécution avec GGML et llama.cpp, après avoir remplacé GGML pour résoudre l’identification d’architecture. GPTQ cible la quantification post-entraînement des poids, avec une méthode en une seule passe et une information approximative du second ordre. Son résultat documenté inclut des modèles de 175 milliards de paramètres en trois ou quatre bits par poids, après environ quatre heures GPU. Safetensors cible la sécurité du chargement et retire le risque d’exécuter du code arbitraire. Les quatre appellations du titre source ne décrivent donc pas toutes le même type d’objet technique. La comparaison doit conserver ces catégories distinctes.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi