En résumé
Un LLM peut piloter un agent autonome et décomposer une tâche complexe.
La mémoire courte repose sur le contexte, tandis que la mémoire longue utilise des bases vectorielles externes.
ReAct et Reflexion associent raisonnement, action, mémoire dynamique et réflexion.
Le signal : AutoGPT, GPT-Engineer et BabyAGI illustrent trois agents autonomes pilotés par un LLM.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Les agents LLM peuvent utiliser un grand modèle de langage comme contrôleur central. Le modèle reçoit une tâche, puis organise les étapes nécessaires à son traitement. Il peut décomposer une demande complexe en sous-objectifs plus faciles à gérer. Cette capacité constitue un mécanisme central des agents autonomes pilotés par un LLM. Plusieurs démonstrations de faisabilité illustrent cette approche. AutoGPT, GPT-Engineer et BabyAGI figurent parmi les exemples cités. Ces projets montrent des agents capables d’enchaîner des opérations à partir d’instructions formulées en langage naturel. AutoGPT est présenté dans son dépôt GitHub, comme GPT-Engineer dans son dépôt dédié.
La mémoire structure l’exécution d’un agent sur plusieurs étapes. La mémoire à court terme repose sur l’apprentissage dans le contexte. Le LLM utilise alors les informations présentes dans la séquence fournie pendant l’interaction. La mémoire à long terme fonctionne différemment. Elle peut conserver des informations sur des périodes étendues grâce à des espaces de stockage vectoriels externes. Ces stockages permettent de retrouver des informations utiles lors d’étapes ultérieures. L’architecture combine ainsi le contexte immédiat du modèle et une mémoire persistante située hors de ses paramètres. BabyAGI constitue un autre exemple cité dans cette famille d’agents, avec son dépôt GitHub.
Les API étendent l’accès d’un agent au-delà des informations contenues dans les paramètres du modèle. Un LLM peut appeler des interfaces de programmation externes pour obtenir des données supplémentaires. Ces appels ajoutent une capacité d’accès à des informations absentes de la mémoire interne du modèle. Le fonctionnement repose donc sur plusieurs éléments complémentaires. Le LLM contrôle l’agent, les sous-objectifs organisent la tâche, puis les API fournissent des informations additionnelles. La mémoire courte conserve le contexte actif. Les espaces vectoriels peuvent conserver des informations sur une durée plus longue. Ensemble, ces mécanismes décrivent une architecture combinant raisonnement, mémoire et accès à des services externes.
Les méthodes de raisonnement précisent la manière dont un agent explore une tâche. Wei et al. 2022 présentent la chaîne de pensée, ou CoT, comme une technique de formulation devenue standard pour améliorer les performances sur des tâches complexes. Yao et al. 2023 proposent Tree of Thoughts, qui étend cette approche en explorant plusieurs possibilités de raisonnement à chaque étape. Yao et al. 2023 présentent aussi ReAct. Cette méthode intègre raisonnement et action dans le LLM en étendant l’espace des actions. Ces travaux décrivent différentes façons d’organiser les étapes internes d’un agent et ses interactions avec son environnement.
Reflexion ajoute une mémoire dynamique et des capacités d’autoréflexion aux agents, selon Shinn et Labash 2023. Le cadre complète les mécanismes de raisonnement et d’action par une gestion dynamique des informations utiles. ReAct, de son côté, associe explicitement raisonnement et action au sein du LLM. Ces deux approches décrivent des architectures distinctes pour structurer le comportement d’un agent. Les démonstrations AutoGPT, GPT-Engineer et BabyAGI montrent l’usage de LLM comme contrôleurs centraux. Les fonctions décrites couvrent la décomposition des tâches, l’utilisation du contexte, la conservation externe d’informations et l’appel à des API. Le modèle devient ainsi le point de coordination de plusieurs capacités. Pour aller plus loin, consultez notre guide sur déployer un agent IA en PME sans développeur.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés