Cohere publie un traducteur ouvert noté 83,6
#chatgpt #qwen #agents-ia 3 min · 11 septembre 2026

Cohere publie un traducteur ouvert noté 83,6

Par Arthur Dekeyser

En résumé

1

Cohere lance un modèle de traduction couvrant 50 langues.

2

North Small Translate totalise 218 milliards de paramètres et en active 25 milliards.

3

Le modèle atteint 83,6 sur WMT26 selon les évaluations publiées par Cohere.

💡

Le signal : North Small Translate active 25 milliards de paramètres par jeton et couvre 50 langues avec un score WMT26 de 83,6.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Cohere lance North Small Translate, un modèle de traduction automatique à poids ouverts développé par Cohere et Cohere Labs. Le système totalise 218 milliards de paramètres, dont 25 milliards sont actifs par jeton. Il couvre 50 langues, de l’albanais au vietnamien. Sur l’évaluation WMT26 de Cohere, il obtient un score moyen de 83,6 toutes langues confondues. La variante Agentic atteint 84,36 grâce à un processus en plusieurs passes. Ce processus détecte puis corrige ses propres erreurs. Cohere présente ces résultats dans son article de lancement, publié le 10 septembre 2026.

Une famille multilingue North Small Translate devient le premier modèle de traduction de la famille North. Il prolonge la lignée multilingue de Tiny Aya et de Command A Translate. Cohere l’a développé avec RWS, dont les scientifiques de Language Weaver et les experts linguistiques ont contribué à la qualité en conditions réelles. Le lancement rattache aussi ce modèle à l’histoire du Transformer. Des chercheurs de Google ont présenté cette architecture en 2017 dans l’article Attention Is All You Need. Ses résultats initiaux portaient sur la traduction anglais-allemand et anglais-français dans WMT 2014. Cohere revient donc à cette tâche avec un modèle dédié.

Cohere déploie un modèle MoE

Une architecture parcimonieuse North Small Translate repose sur un Transformer décodeur uniquement et un mélange parcimonieux d’experts. Le modèle comprend 128 experts, avec huit experts activés pour chaque jeton, ainsi que des experts partagés appliqués à chaque jeton. Son routeur utilise une fonction sigmoïde sur les scores d’experts, normalisés parmi les experts sélectionnés. L’attention alterne des couches à fenêtre glissante de 4 096 jetons et des couches globales, selon un ratio de trois pour une. Les couches glissantes utilisent RoPE, tandis que les couches globales n’emploient pas d’encodage positionnel. Le modèle accepte 16 000 jetons en entrée et 16 000 en sortie, uniquement sous forme de texte.

Des scores comparés Dans les résultats WMT26 publiés par Cohere, North Small Translate obtient 83,60, contre 81,56 pour Qwen 3.5 397B A17B et 81,37 pour DeepL NextGen. Gemma 4 31B atteint 79,46, GLM 5.2 FP8 obtient 76,50 et Google Translate 68,20. La variante Agentic monte à 84,36. Cohere précise que GPT-5.6-Sol a servi de juge pour ces évaluations. Les résultats restent donc rapportés par le fournisseur jusqu’à la publication de résultats WMT26 indépendants. Sur les langues européennes, le modèle standard atteint 82,17, contre 72,73 pour Gemma 4 31B. En Asie du Sud, Gemma conserve l’avantage avec 88,04, contre 86,16.

North Small Translate cible le débit

Des performances mesurées Dans les tests de Cohere, North Small Translate produit 112 jetons de sortie par seconde contre 81 pour Gemma 4 31B, à faible concurrence et sur un matériel identique. À forte concurrence, les résultats atteignent respectivement 39 et 30 jetons par seconde. Cohere présente cet écart comme un débit jusqu’à 1,4 fois supérieur. Pour les documents longs, le modèle obtient 48,9 en traduisant deux chapitres de livre dans un seul appel. Google Translate atteint 21,3, tandis que Gemma 4 31B obtient 19,4. La qualité est mesurée paragraphe par paragraphe avec xCOMET-XL dans ces essais.

Un accès gradué Le modèle est accessible via l’API Chat V2 de Cohere sans frais jusqu’aux limites de débit. Les organisations peuvent aussi l’auto-héberger pour un usage non commercial ou obtenir une licence commerciale. Cohere publie trois points de contrôle destinés à l’auto-hébergement. La version BF16 fonctionne sur quatre B200 ou huit H100. La version FP8 fonctionne sur deux B200 ou quatre H100. La version NVFP4 fonctionne sur un B200 ou deux H100. Le modèle est disponible sur Hugging Face. Sa mémoire doit toutefois contenir l’ensemble des 218 milliards de paramètres, malgré les 25 milliards actifs par jeton.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi