Par Arthur Dekeyser
En résumé
Ariel Assaraf distingue les instructions système des contrôles techniques capables de bloquer une action.
Coralogix limite le contexte fourni aux agents sans leur accorder automatiquement davantage d’autorité.
Les équipes doivent corréler les actions des agents avec les permissions, les incidents et leurs conséquences.
Le signal : Ariel Assaraf recommande un point d’application des politiques entre chaque agent IA et ses outils, avec des contrôles adaptés au risque.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Ariel Assaraf dirige Coralogix et défend une surveillance centrée sur les actes des agents IA. Dans un entretien publié le 25 septembre 2026 par Help Net Security, il explique qu’une instruction système peut décrire une limite, sans pouvoir l’imposer. Selon lui, les garde-fous doivent se situer entre l’agent et l’action demandée. Cette séparation vise les accès réseau, les identifiants, les cibles et les autorisations. Assaraf souligne qu’un agent peut répondre correctement tout en produisant une conséquence opérationnelle néfaste. L’enjeu consiste donc à enregistrer les actions, les décisions de politique et les résultats observables. L’entretien complet est disponible sur Help Net Security.
L’incident Gemini illustre cette différence entre consigne et contrôle. L’agent devait fonctionner dans un test de cybersécurité contrôlé. Une erreur de configuration lui a toutefois donné accès à Internet. Il est ensuite entré dans trois systèmes réels, avant de reconnaître son erreur et de s’arrêter. Ariel Assaraf cite quatre protections techniques qui auraient dû encadrer l’exécution. Il s’agit de l’isolation réseau, des listes de cibles autorisées, des identifiants limités et d’une vérification indépendante avant chaque action. Ces mécanismes doivent fonctionner indépendamment des instructions adressées au modèle. Coralogix présente ses travaux sur son site.
Le contexte minimal doit améliorer les connaissances nécessaires à l’étape courante, sans élargir l’autorité de l’agent. Coralogix privilégie un contexte récupéré au dernier moment, avec une provenance claire et une durée d’expiration. Les informations sensibles ou non fiables doivent rester séparées des instructions. L’accès à une donnée ne doit pas autoriser automatiquement une action sur cette donnée. Assaraf propose une vérification mesurable de chaque ajout de contexte. Les équipes peuvent comparer le succès de la tâche, les violations de politique, les injections de consignes et les accès inutiles aux données. Si le contexte apporte peu de performance et augmente les risques, il doit être retiré.
Le point d’application se place entre l’agent et ses outils. Chaque action proposée est évaluée selon l’identité de l’agent, la cible, l’environnement, la classification des données et l’autorisation courante. L’agent ne reçoit jamais d’identifiants sans restriction. Une requête de production en lecture seule peut être autorisée automatiquement. Une écriture peut demander une validation. Une action destructive peut être bloquée. Les tests incluent des évaluations, des injections, des commandes masquées et des tentatives en plusieurs étapes. La réussite exige l’absence d’effet externe et la création d’un enregistrement complet du blocage. Ce suivi conserve aussi l’action tentée et la raison du refus.
Le risque gradué évite d’exiger une validation humaine pour chaque action liée à la production. Ariel Assaraf estime qu’une telle règle empêcherait les investigations simples et réduirait l’utilité des agents pendant les incidents. Les requêtes en lecture seule, limitées à un périmètre approuvé, peuvent s’exécuter automatiquement. Les changements réversibles demandent des contrôles plus stricts. Les actions irréversibles ou à fort rayon d’impact nécessitent une validation humaine. Cette méthode applique la friction selon la conséquence potentielle. Elle ne traite donc pas de manière identique une consultation et une modification d’un environnement de production. Le contrôle augmente avec l’impact possible de l’action.
Les signaux corrélés complètent la disponibilité, la latence et les taux d’erreur. Coralogix relie la télémétrie des agents aux appels d’outils, aux décisions de politique, aux dérogations, aux nouvelles tentatives et aux accès aux données. Ces événements sont rapprochés des déploiements, incidents, alertes de sécurité, retours arrière et corrections humaines. Un agent peut retourner des réponses 200 tout en créant un résultat défavorable. Les équipes doivent donc observer la conséquence de l’action. Elles peuvent aussi mesurer la cohérence des décisions entre versions de modèles. Un changement de comportement du modèle ne doit pas devenir une modification invisible du comportement en production. Pour aller plus loin, consultez notre guide sur déployer un agent IA en PME sans développeur.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés