# Thomson Reuters défie les géants de l'IA avec son modèle innovant

> Thomson Reuters publie les premiers benchmarks de son modèle Thomson, qui domine trois catégories sur sept avant son déploiement dans CoCounsel Legal.

Type : Actualité IA · Catégorie : Secteur · Publié le 2026-08-15 · Signal IA - Order & Chaos · Secteur : Juridique
Source : https://www.orderchaos.eu/signal-ia/actu/thomson-reuters-publie-ses-scores-face-aux-ia-de-pointe
Tags : thomson reuters, thomson-1-large, westlaw, cocounsel, ia juridique, claude, chatgpt, gemini

---

## En résumé

- Thomson-1-Large arrive en tête dans trois catégories sur sept, dont PrBench Legal Hard, le suivi d’instructions et le contexte long.
- Le modèle sera déployé en août comme moteur par défaut de Tabular Analysis dans CoCounsel Legal.
- Les résultats restent à relativiser, notamment parce que GPT-5.5 a été testé sans mode raisonnement et que la seconde évaluation reposait sur Westlaw et Practical Law.

**Le signal :** Thomson-1-Large termine premier dans trois des sept catégories, mais dernier en programmation avec un score de 0,399.

[Thomson Reuters](/signal-ia/actu/thomson-lia-de-reuters-eclipse-gpt-55) affirme que son modèle propriétaire Thomson rivalise désormais avec plusieurs modèles d’IA de pointe. Dans un billet publié le 31 juillet sur son blog innovation, le directeur technique Joel Hron et le responsable de la recherche en IA Jonathan Schwarz ont présenté les premiers résultats de Thomson-1-Large, développé depuis l’acquisition de Safe Sign Technologies en 2024.

## Thomson prépare son déploiement juridique

Le modèle doit être lancé à la fin de l’été. Il repose sur un modèle open source, entraîné avec des techniques de mid-training et de post-training sur des décennies de contenus propriétaires issus de Westlaw, Practical Law, Checkpoint et Reuters. Selon Thomson Reuters, des centaines d’experts ont évalué ses réponses, recensé ses modes d’échec et validé son raisonnement. Les données clients ne sont pas utilisées pour l’entraînement, et moins de 10 % des contenus propriétaires de Thomson Reuters ont encore été mobilisés.

La première intégration est prévue en août dans Tabular Analysis, au sein de CoCounsel Legal, où Thomson deviendra le modèle par défaut. Thomson Reuters vise l’analyse de documents structurés et volumineux, avec un standard de précision mesurable. L’entreprise prévoit ensuite d’intégrer le modèle à son portefeuille de produits juridiques et fiscaux au cours des douze prochains mois.

## Thomson gagne trois tests sur sept

Face à Gemini 3.1 Pro, [Claude](/signal-ia/actu/boostez-la-visibilite-ia-avec-chatgpt-et-claude) Opus 4.8 et GPT-5.5, Thomson arrive en tête dans trois des sept catégories évaluées. Il obtient 0,352 au test PrBench Legal Hard, devant GPT-5.5 à 0,333, Opus 4.8 à 0,315 et Gemini à 0,293. Il domine aussi le suivi d’instructions avec 0,914 et le test de contexte long avec 0,753, juste devant Gemini à 0,750.

Les résultats sont toutefois plus nuancés. Sur Stanford LegalBench, Thomson atteint 0,823, derrière [Gemini](/signal-ia/actu/claude-gemini-chatgpt-ia-sadapte-au-contexte) à 0,843 et GPT-5.5 à 0,832, mais devant Opus à 0,818. Sur Harvey Legal Agent Benchmark, il obtient 0,857, contre 0,869 pour Opus. En raisonnement, Thomson affiche 0,684, derrière Gemini à 0,748 et Opus à 0,737. En programmation, il termine dernier avec 0,399, loin derrière Opus à 0,598.

Les conditions de comparaison n’étaient pas parfaitement identiques. Thomson a utilisé le test-time scaling, qui lui donne davantage de temps et de calcul sur certaines tâches. Gemini et Opus ont été évalués en mode raisonnement, tandis que GPT-5.5 l’a été sans ce mode. Joel Hron estime que l’effet du test-time scaling reste limité: la moyenne générale serait passée de 0,787 à 0,789. Il ajoute que l’évaluation en mode raisonnement de GPT-5.5 n’était pas prête et doit figurer dans un futur rapport technique.

Une seconde évaluation a comparé Thomson connecté à Westlaw et Practical Law avec des modèles concurrents disposant d’un accès illimité au web via Brave. Cette comparaison mesure cependant aussi la valeur des sources de récupération: elle ne permet pas de savoir comment les modèles concurrents se comporteraient avec le même accès à Westlaw.
