Par Arthur Dekeyser
En résumé
Aditya G. Parameswaran identifie trois besoins pour les systèmes de données destinés aux agents.
Les requêtes d’agents peuvent produire des milliers de requêtes SQL pour une seule demande.
La mémoire structurée doit filtrer les informations selon plusieurs attributs opérationnels.
Le signal : Le coût des capacités de niveau GPT-4 est passé d’environ 30 dollars à moins de 1 dollar par million de jetons.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Coût en baisse rapide Le coût des capacités comparables à GPT-4 est passé d’environ 30 dollars à moins de 1 dollar par million de jetons entre le début de 2023 et aujourd’hui. Certains fournisseurs proposent même des tarifs inférieurs à 0,10 dollar. Selon le texte publié par Aditya G. Parameswaran et ses collaborateurs, les prix d’inférence ont diminué entre neuf et neuf cents fois par an selon les tests. La baisse médiane atteint près de cinquante fois. Les modèles de pointe deviennent également moins chers à chaque génération. Les modèles à poids ouverts suivent cette évolution. Les auteurs estiment que l’intelligence suffisante pour la majorité du travail de connaissance est déjà disponible.
Trois architectures ciblées Le texte associe cette baisse des coûts à trois défis pour les systèmes de données. Les systèmes « pour les agents » doivent gérer des utilisateurs qui explorent les données différemment des humains ou des outils de décision. Les systèmes « d’agents » doivent fournir un socle pour la mémoire, la coordination, les états partagés et les échecs. Les systèmes « par les agents » doivent permettre la synthèse de systèmes personnalisés pour chaque charge de travail. Cette analyse est portée par Aditya G. Parameswaran, professeur associé à l’UC Berkeley et codirecteur de l’EPIC Data Lab. La publication originale présente ces pistes comme une perspective et une étude du paysage.
Exploration à grande échelle Un agent ne consulte pas une base comme une personne ou un outil de décision. Il inspecte le schéma, explore les colonnes, puis formule progressivement une requête. Plusieurs agents peuvent examiner des portions différentes de l’espace des hypothèses. Une seule demande peut alors générer des milliers de requêtes SQL. Une analyse de cause racine, comme la baisse des ventes de café à Berkeley, exige de tester de nombreuses jointures, agrégations et combinaisons de filtres. Une analyse de cohortes suit une logique comparable pour identifier les segments susceptibles de se désabonner. Sur un test texte-vers-SQL, seuls 10 à 20 % des sous-plans étaient distincts. Les 80 à 90 % restants répétaient donc le travail.
Optimisation des sous-plans Les auteurs proposent de réutiliser les résultats entre sous-plans proches, avec des méthodes d’optimisation multi-requêtes et de balayage partagé. Le système pourrait aussi fournir des réponses approximatives ou diffuser progressivement les résultats. L’agent déciderait alors si le calcul complet est nécessaire. Une autre piste consiste à envoyer des lots de requêtes avec des exigences d’approximation différentes. Des primitives de niveau supérieur, inspirées des macros Jinja de dbt, pourraient éviter de décrire chaque requête SQL séparément. Le système de données pourrait également orienter l’agent, proposer des résultats connexes ou communiquer une estimation de latence. Il pourrait enfin préparer des vues matérialisées ou virtuelles avant leur utilisation.
Mémoire au-delà des fichiers Les fichiers Markdown, les scripts bash et la recherche par mots-clés restent utiles pour les agents. Toutefois, les auteurs jugent cette méthode insuffisante à grande échelle. Les fenêtres de contexte limitées rendent coûteuse la récupération de nombreux fragments pertinents. Cette difficulté existe aussi pour les grandes bases de données et les vastes bases de code. Les graphes de connaissances rencontrent une limite similaire lorsqu’ils ne permettent pas une recherche structurée. Une mémoire structurée pourrait filtrer les informations selon plusieurs dimensions. Pour un agent de données, ces dimensions incluraient les colonnes, les tables, le type d’opération et des instructions correctives en langage naturel. Une règle pourrait ainsi imposer l’usage d’une colonne précise pour une opération donnée.
Coordination des agents Des milliers d’agents pourraient modifier simultanément un état partagé. Les techniques de versions multiples, de copie à l’écriture, de transactions exactement une fois, de CRDT et de transformation opérationnelle sont citées pour gérer ces modifications. Les agents devraient aussi annuler la plupart des transactions exploratoires et conserver uniquement le résultat retenu. Un risque appelé « livelock » apparaît lorsque des actions compensatoires empêchent tout progrès. Les systèmes doivent également gérer les agents défaillants, les agents retardataires et les communications entre agents. Temporal est cité parmi les outils d’exécution durable multi-agents. Quatre agents développeurs pourraient, par exemple, négocier un schéma partagé avec des objectifs distincts mais partiellement communs.
Synthèse vérifiable La troisième architecture repose sur la capacité des agents à synthétiser des systèmes de données personnalisés pour chaque charge de travail. Cette possibilité déplace la difficulté vers la vérification. Le système généré doit correspondre au comportement attendu avant d’être utilisé. Les traces de plusieurs agents pourraient être stockées, structurées et exploitées pour réduire les recherches futures. Les auteurs relient cette mémoire structurée à des mécanismes d’amélioration récursive. Ils soulignent aussi que les trois architectures sont liées. Les agents sollicitent les systèmes de données, utilisent un socle pour conserver leur état, puis peuvent contribuer à fabriquer de nouveaux systèmes. Le profil de Parameswaran et les collaborateurs cités prolongent cette réflexion sur les données et les agents. Pour aller plus loin, consultez notre guide sur réduire ses coûts grâce à l’IA.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés