Tenet de Harvey dépasse presque deux fois Kimi K3 en droit

Tenet de Harvey dépasse presque deux fois Kimi K3 en droit

Par Arthur Dekeyser

En résumé

1

Harvey a présenté Tenet comme un modèle de recherche destiné au travail juridique de longue durée.

2

Tenet réussit presque deux fois plus de tâches retenues que Kimi K3 sur le Legal Agent Benchmark.

3

Harvey n’a publié ni les poids, ni la fiche modèle, ni le point d’accès API de Tenet.

💡

Le signal : Harvey Tenet réussit presque deux fois plus de tâches retenues que Kimi K3 sur le Legal Agent Benchmark.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Harvey présente Tenet comme son premier modèle post-entraîné, annoncé le 20 août 2026 en aperçu de recherche. Le modèle repose sur Kimi K3 et a été post-entraîné avec Fireworks par apprentissage par renforcement asynchrone. Son entraînement cible le travail juridique nécessitant de nombreuses étapes. Le corpus combinait données synthétiques, données juridiques publiques et données d’experts humains. Harvey affirme qu’aucune donnée client n’a été utilisée. Sur son Legal Agent Benchmark, Tenet accomplit presque deux fois plus de tâches retenues que K3. Il en accomplit aussi 20 % de plus sur LAB: Contracts. Les taux de réussite complète progressent respectivement de 9 et 2 points.

Des résultats transférés apparaissent également sur deux évaluations non vues pendant l’entraînement. Harvey rapporte des améliorations sur APEX Agents de Mercor, consacré au droit des sociétés, et sur Redline Bench de Crosby. Tenet atteint le meilleur résultat communiqué sur LAB: Contracts et la deuxième place sur LAB, selon les scores de base indiqués par Harvey. Les performances restent stables sur LegalBench, CUAD, MAUD et PRBench de Scale. Ces résultats sont rapportés par Harvey, qui présente ce transfert comme un indice de comportement appris plutôt que d’ajustement à un seul test. Le modèle maintient aussi une qualité juridique générale, sans baisse rapportée sur ces évaluations de connaissances.

Harvey entraîne Tenet sur des tâches longues

Un entraînement spécialisé a utilisé environ 150 processeurs graphiques NVIDIA B300 pendant deux mois. Les environnements juridiques reproduisaient les tâches de LAB, avec une instruction d’environ 50 mots, un dossier client et une grille d’expert. Chaque grille comptait environ 50 critères binaires, et parfois plusieurs centaines. Une trajectoire pouvait dépasser 1 000 échanges. Un modèle évaluateur attribuait les résultats selon les critères satisfaits, les problèmes juridiques résolus et une prime de réussite complète. Harvey a optimisé la politique avec GSPO et une adaptation LoRA de rang 64 sur l’ensemble du réseau K3. Fireworks a co-développé les systèmes d’entraînement et d’exécution au niveau du noyau.

Les coûts restent suivis pendant l’optimisation. Harvey indique que les poids ouverts de Kimi K3 réduisent le prix par jeton. L’entreprise indique aussi que la préférence donnée aux trajectoires plus courtes, à qualité égale, réduit le nombre de jetons consommés. Elle rapporte ainsi des gains de qualité à coût stable. Trois modèles spécialisés complètent Tenet comme outils ou sous-agents. Pour la diligence M&A, un orchestrateur GLM-5.2 post-entraîné dans un dispositif de langage récursif atteint 60,1 % des critères, contre 46,1 % seul. Dans Review Table, la qualité des réponses augmente de 3,6 points et celle des citations de 12,1 points.

Harvey réserve Tenet à sa plateforme

Une disponibilité limitée caractérise cette annonce. Tenet reste un aperçu de recherche et n’est pas encore déployable. Harvey n’a publié ni ses poids, ni sa fiche modèle, ni son point d’accès API. Le modèle de base Kimi K3 dispose de poids ouverts, mais Tenet constitue le modèle propre de Harvey. L’entreprise indique vouloir faire progresser ce travail de la recherche vers la production dans ses produits. L’accès passe par la plateforme Harvey, vendue aux cabinets d’avocats, aux cabinets de taille intermédiaire et aux équipes juridiques internes. Les usages mentionnés couvrent la diligence M&A, la rédaction, la revue et l’annotation de contrats.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi