Throughput (tokens per second)
Le débit mesure la vitesse à laquelle un modèle génère du texte lors de l'inférence, exprimé en tokens par seconde. C'est un indicateur clé de performance pour les applications nécessitant des réponses en temps réel.
Groq atteint plus de 300 tokens par seconde sur Llama 3 grâce à ses puces LPU dédiées, contre 30 à 50 tokens par seconde pour GPT-4 via l'API OpenAI standard, rendant Groq 6 fois plus rapide pour la génération.
Le débit mesure la vitesse à laquelle un modèle génère du texte lors de l'inférence, exprimé en tokens par seconde. C'est un indicateur clé de performance pour les applications nécessitant des réponses en temps réel.
Groq atteint plus de 300 tokens par seconde sur Llama 3 grâce à ses puces LPU dédiées, contre 30 à 50 tokens par seconde pour GPT-4 via l'API OpenAI standard, rendant Groq 6 fois plus rapide pour la génération.
Débit (tokens/s) et Inférence sont deux concepts liés mais distincts dans l'écosystème IA. Pour approfondir : Inférence, Latence, LLM, Token.
Gardez un coup d'avance en business et IA
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés