Tony Lian fait du raisonnement parallèle un nouveau paradigme
4 min · 18 septembre 2026

Tony Lian fait du raisonnement parallèle un nouveau paradigme

Par Arthur Dekeyser

En résumé

1

L’APR répartit dynamiquement le calcul entre opérations parallèles et séquentielles.

2

Les méthodes classiques imposent souvent la structure de recherche avant l’exécution.

3

Multiverse réutilise le cache KV pour agréger plusieurs branches de raisonnement.

💡

Le signal : L’APR permet au modèle de choisir le nombre de fils parallèles selon la complexité du problème.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Berkeley présente le raisonnement parallèle adaptatif comme un nouveau paradigme pour l’inférence des modèles de langage. Un article publié le 8 mai 2026 analyse les progrès récents de cette approche. Tony Lian figure parmi les auteurs du texte. Il a aussi co-dirigé ThreadWeaver, une méthode examinée dans l’analyse. L’APR permet à un modèle de décider quand décomposer un problème. Il peut également choisir combien de fils lancer et comment les coordonner. La définition retenue concerne une allocation dynamique du calcul entre opérations parallèles et séquentielles. Cette capacité devient une partie du flux de contrôle généré par le modèle. L’analyse distingue donc le paradigme APR de la méthode APR proposée par Pan et ses coauteurs en 2025.

Le raisonnement séquentiel augmente le coût de l’exploration avec la longueur de la séquence produite. Les modèles peuvent générer des étapes intermédiaires, revenir sur leurs décisions et tester plusieurs hypothèses. Cette progression soutient les performances en mathématiques, en programmation et dans les tâches agentiques. Elle augmente toutefois la latence et la consommation de calcul. L’accumulation des chemins intermédiaires peut aussi provoquer une dégradation appelée « context-rot ». Pour des tâches complexes nécessitant des millions de jetons d’exploration, l’attente peut atteindre plusieurs dizaines de minutes ou plusieurs heures. Le raisonnement parallèle propose alors d’exécuter simultanément des fils indépendants, plutôt que d’empiler chaque chemin dans une seule séquence.

Les méthodes classiques imposent la structure

Les approches existantes utilisent souvent une structure décidée en dehors du modèle. Self-consistency échantillonne plusieurs raisonnements complets, puis retient la réponse majoritaire. Best-of-N utilise un vérificateur entraîné pour sélectionner la meilleure solution. Ces méthodes restent simples à mettre en œuvre, mais peuvent répéter des calculs entre branches. Tree of Thoughts, Graph of Thoughts et Skeleton of Thoughts décomposent les tâches grâce à des algorithmes de recherche connus. Monte-Carlo Tree Search estime la valeur de nœuds grâce à des simulations aléatoires. Ces techniques améliorent le fork-and-join simple, mais nécessitent une stratégie de décomposition préalable.

Les méthodes récentes explorent des formes de coordination plus intégrées. ParaThinker impose deux étapes fixes, avec plusieurs fils parallèles suivis d’une synthèse. GroupThink permet aux fils de voir leur progression partielle au niveau des jetons et de s’adapter pendant la génération. Hogwild! Inference partage un cache KV entre plusieurs fils et évite un protocole explicite de coordination. L’APR ajoute une décision absente de ces structures fixes. Le modèle peut choisir de ne pas paralléliser une tâche simple. Il peut aussi produire des sous-tâches distinctes avant de les affecter à des fils indépendants. Ces comportements peuvent émerger pendant l’apprentissage par renforcement.

Les systèmes exécutent un fork-and-join

L’exécution parallèle suit généralement un modèle fork-and-join inspiré du multithreading. Le modèle reçoit une liste de sous-tâches, puis chaque sous-tâche est préremplie avant son envoi à un moteur d’inférence. Les fils décodent ensuite en parallèle jusqu’à un jeton de fin ou une longueur maximale. Le système attend la fin de toutes les branches avant d’agréger leurs résultats. Cette agrégation pose un problème au niveau du cache KV. Les fils indépendants commencent avec des identifiants de position identiques. Leur fusion peut donc créer un chevauchement d’encodage et un schéma d’attention non causal. Deux familles de solutions se distinguent alors dans les systèmes d’inférence.

Multiverse modifie le moteur d’inférence pour réutiliser le cache KV lors de la fusion. RadixAttention, disponible dans SGLang, organise les requêtes partageant un préfixe dans un arbre de préfixes. Cette organisation évite de recalculer le cache du préfixe pour chaque fil. Multiverse, Parallel-R1 et NPR copient ensuite le cache produit par chaque branche. Ils modifient la table de pages afin d’assembler des blocs mémoire non contigus. Cette technique évite un second préremplissage et réutilise davantage le cache existant. Elle exige toutefois une gestion mémoire non standard du moteur. Le texte signale aussi une fragilité liée aux pointeurs et à l’éviction possible d’un cache référencé.

L’APR redéfinit la manière de répartir le calcul pendant l’inférence. Contrairement à une structure identique appliquée à chaque problème, il associe le niveau de parallélisation à la tâche traitée. L’analyse cite deux comportements appris comme exemples. Un modèle peut exécuter l’étape suivante tout en vérifiant une étape précédente. Il peut aussi sécuriser une approche principale avec une solution de secours. Ces stratégies seraient difficiles à concevoir manuellement avec des heuristiques générales. Les chercheurs présentent l’APR comme un paradigme, et non comme une méthode unique. Les travaux examinés incluent notamment ThreadWeaver, Multiverse, Parallel-R1 et NPR. Lire l’analyse de Berkeley, ainsi que l’article de Pan et ses coauteurs.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi