# ReAct et Reflexion font agir les LLM par étapes

> Les agents fondés sur les LLM combinent raisonnement, actions et retours binaires selon les approches CoT, ReAct et Reflexion présentées.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-01 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/react-et-reflexion-transforment-les-modeles-en-agents-autonomes
Tags : agents, llm, raisonnement, automatisation

---

## En résumé

- Les LLM peuvent être formulés comme des solveurs généraux de problèmes.
- La méthode CoT améliore les performances sur les tâches complexes.
- ReAct combine des actions discrètes et le langage dans un même espace.

**Le signal :** ReAct associe raisonnement et actions, tandis que Reflexion utilise un retour binaire dans un cadre d’apprentissage par renforcement.

**Les agents LLM** peuvent dépasser la génération de textes, d’histoires, d’essais et de programmes. L’article consacré aux agents autonomes fondés sur les LLM présente ces modèles comme des solveurs généraux de problèmes. Cette formulation élargit leur rôle au-delà de la production de copies bien écrites. Elle place le [raisonnement](/signal-ia/actu/anthropic-lance-claude-sonnet-5-plus-autonome-et-moins-couteux) et l’action au centre de l’architecture étudiée. Le sujet est détaillé dans l’article original de [Lilian Weng](https://lilianweng.github.io/posts/2023-06-23-agent/). L’enjeu décrit porte donc sur la manière d’organiser les capacités d’un LLM. Les agents ne sont pas réduits à une réponse unique. Ils sont étudiés comme des systèmes capables d’articuler plusieurs opérations dans une même tâche.

**Le raisonnement guidé** s’appuie notamment sur la méthode Chain of Thought, ou CoT. Selon Wei et ses coauteurs en 2022, cette technique de formulation est devenue standard pour améliorer les performances des modèles sur les tâches complexes. La méthode concerne le prompting, c’est-à-dire la manière de demander au modèle de traiter une instruction. Elle ne constitue pas une action externe dans la description fournie. Elle structure plutôt le raisonnement produit par le LLM. L’article de référence est disponible sur [arXiv](https://arxiv.org/abs/2201.11903). CoT représente ainsi une composante dédiée au raisonnement dans les [agents](/signal-ia/actu/frank-coyle-arme-les-agents-ia-avec-des-ontologies) décrits.

## ReAct combine raisonnement et actions

**ReAct étend l’espace** des actions accessibles au LLM. Yao et ses coauteurs en 2023 décrivent une méthode qui intègre raisonnement et action dans le même fonctionnement. Son espace d’action combine des actions discrètes, propres à la tâche, et l’espace du langage. Cette combinaison distingue ReAct d’une approche limitée à la génération de texte. Les actions discrètes apportent une structure liée à la tâche traitée. Le langage conserve une fonction dans le même espace d’action. La proposition est présentée dans l’article [ReAct](https://arxiv.org/abs/2210.03629). Le cadre décrit associe donc explicitement une capacité de raisonnement à des actions spécifiques.

**Reflexion ajoute un retour** dans une configuration standard d’[apprentissage](/signal-ia/actu/agents-autonomes-decomposition-des-taches-pour-mieux-reussir) par renforcement. Shinn et Labash décrivent un modèle dans lequel le modèle de récompense fournit une récompense binaire. L’espace d’action suit la configuration employée par ReAct. Reflexion reprend donc cette organisation des actions tout en ajoutant un signal de récompense simple. La distinction repose sur la présence de ce retour binaire dans le dispositif décrit. L’article associé est disponible sur [arXiv](https://arxiv.org/abs/2303.11366). Cette architecture relie l’action à une évaluation formulée sous la forme de deux valeurs possibles. Le cadre reste défini par ces éléments précis.

## Reflexion utilise une récompense binaire

**Les trois approches** occupent des fonctions différentes dans la description des agents LLM. CoT est présenté comme une technique de prompting pour les tâches complexes. ReAct combine les actions discrètes propres à une tâche avec l’espace du langage. Reflexion ajoute une récompense binaire fournie par un modèle de récompense. Ces propositions décrivent trois manières d’organiser le raisonnement, l’action et l’évaluation. Elles sont rattachées respectivement aux travaux de Wei et ses coauteurs, Yao et ses coauteurs, puis Shinn et Labash. Ensemble, elles composent le cadre présenté pour dépasser la simple génération de copies, d’histoires, d’essais et de programmes.
