DÉBIT (TOKENS/S)

Throughput (tokens per second)

📘 FONDAMENTAUX INTERMEDIAIRE +20 XP

Definition

Le débit mesure la vitesse à laquelle un modèle génère du texte lors de l'inférence, exprimé en tokens par seconde. C'est un indicateur clé de performance pour les applications nécessitant des réponses en temps réel.

Exemple concret

Groq atteint plus de 300 tokens par seconde sur Llama 3 grâce à ses puces LPU dédiées, contre 30 à 50 tokens par seconde pour GPT-4 via l'API OpenAI standard, rendant Groq 6 fois plus rapide pour la génération.

Questions frequentes

Qu'est-ce que le débit tokens ? +

Le débit mesure la vitesse à laquelle un modèle génère du texte lors de l'inférence, exprimé en tokens par seconde. C'est un indicateur clé de performance pour les applications nécessitant des réponses en temps réel.

Comment fonctionne le débit tokens en pratique ? +

Groq atteint plus de 300 tokens par seconde sur Llama 3 grâce à ses puces LPU dédiées, contre 30 à 50 tokens par seconde pour GPT-4 via l'API OpenAI standard, rendant Groq 6 fois plus rapide pour la génération.

Quelle est la différence entre le débit tokens et l'inférence IA ? +

Débit (tokens/s) et Inférence sont deux concepts liés mais distincts dans l'écosystème IA. Pour approfondir : Inférence, Latence, LLM, Token.

NEWSLETTER BUSINESS & IA

Gardez un coup d'avance en business et IA

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés