Agents IA : avant de leur confier les clés

Par Thierry TABOY
7 min de lecture
Agents IA : avant de leur confier les clés

Les agents sont devenus la nouvelle évidence de l’intelligence artificielle.

Il faut y aller. Vite. Leur confier des processus, des outils, des applications. Les faire travailler ensemble. Leur permettre d’agir sans attendre en permanence une instruction humaine.

La promesse est considérable. Mais à mesure que les entreprises passent des démonstrateurs aux premiers déploiements, une question devient urgente : savons-nous vraiment comment ces systèmes se comportent lorsqu’on les laisse agir longtemps et à plusieurs ?

Une étude publiée le 15 septembre par une équipe d’Emergence AI apporte quelques réponses. Elles devraient intéresser tous ceux qui s’apprêtent à déployer massivement des agents.

Les chercheurs ont créé huit petits mondes de dix agents, reposant sur plusieurs grands modèles du marché. Sept populations utilisent chacune un même modèle ; la huitième mélange différentes familles de modèles.

Ces agents disposent de plus de 120 outils, échangent entre eux, prennent des décisions collectives et, point essentiel, possèdent une mémoire persistante.

L’expérience dure jusqu’à vingt et un jours. Plus de 850 000 appels aux modèles, près de 50 milliards de tokens.

Les chercheurs introduisent alors trois perturbations : une campagne de phishing avec injection indirecte de prompts, une opération de désinformation et la possibilité d’accéder aux mémoires privées des autres agents.

Détecter un danger ne signifie pas cesser de lui obéir

Premier résultat : aucun monde ne résiste correctement aux trois épreuves.

Mais le plus intéressant est ailleurs.

Des agents peuvent reconnaître une information comme suspecte, avertir leurs congénères… et continuer malgré tout à interagir avec elle.

Lors du phishing, les mondes exposés détectent la menace et diffusent des avertissements. Cela n’empêche ni les interactions avec le contenu hostile ni sa propagation.

Face à la désinformation, tous les mondes concernés agissent ou publient avant d’avoir vérifié l’information.

Plus troublant encore : certaines informations malveillantes entrent dans la mémoire persistante des agents. Dans un cas observé par les chercheurs, un agent revient consulter un lien hostile quarante-six heures après l’attaque.

Pour une entreprise, la leçon est assez simple.

Avec un agent autonome, une erreur n’est plus nécessairement une mauvaise réponse que l’on oublie en fermant la fenêtre.

Elle peut entrer dans l’histoire du système et produire des effets plus tard.

Dix agents sûrs ne font pas nécessairement un système sûr

C’est probablement l’apport majeur de l’étude.

Nous évaluons encore largement l’IA modèle par modèle : sécurité, robustesse, précision, résistance aux attaques.

Emergence World montre que cela ne suffit plus.

Le comportement d’un même modèle peut changer fortement selon les agents avec lesquels il interagit. Les auteurs observent également des formes de conformisme collectif : certains agents repèrent, dans leur raisonnement privé, les défauts d’une proposition, puis votent pourtant avec le groupe.

Le système conserve alors l’apparence de la délibération tout en perdant progressivement sa capacité à produire de la contradiction.

Autre phénomène : les communautés développent leurs propres expressions, raccourcis et références. Rien ne permet de parler d’un langage volontairement secret. Mais, à force d’histoire commune, certains échanges deviennent plus difficiles à comprendre pour un observateur extérieur.

On peut donc conserver tous les logs d’un système et voir néanmoins diminuer son intelligibilité.

Pour l’entreprise, le sujet dépasse largement la cybersécurité.

Il concerne la gouvernance.

Qui contrôle un ensemble d’agents ? Comment détecte-t-on une dérive collective ? Comment introduit-on de la contradiction ? Comment revient-on sur une décision ? Et comment un humain comprend-il, trois jours plus tard, pourquoi le système a agi ?

La mémoire n’est pas la solution magique

Le résultat est d’autant plus intéressant que les agents de l’expérience possèdent précisément une mémoire persistante.

Les LLM actuels n’ont pas spontanément une mémoire continue de leur propre existence. Les systèmes agentiques reconstruisent cette continuité grâce au contexte, aux résumés, au RAG, aux bases vectorielles ou à différentes formes de mémoire externe.

Cela fonctionne. Mais cela déplace le problème.

Que faut-il conserver ? Que peut-on oublier ? Quelle information faut-il rappeler au bon moment ? Comment distinguer, plusieurs jours plus tard, une information fiable d’une information contaminée qui a été mémorisée ?

Les recherches sur les contextes longs avaient déjà montré qu’une information présente dans le contexte n’est pas nécessairement correctement mobilisée. Emergence World ajoute une difficulté : ce que nous donnons à l’agent pour se souvenir peut également lui permettre de conserver ses erreurs.

La mémoire est une capacité. Elle devient aussi une surface d’attaque.

D’autres architectures méritent donc d’être suivies. Les Liquid Neural Networks, par exemple, reposent sur un état interne qui évolue avec les informations reçues. Des travaux ultérieurs, comme Liquid-S4, explorent les dépendances longues.

Il ne faut surtout pas leur attribuer une mémoire parfaite qu’ils n’ont pas démontrée. Et Emergence World ne compare pas expérimentalement Transformers et réseaux liquides.

Mais la question devient centrale : quelle architecture de mémoire voulons-nous donner à des machines appelées à agir durablement ?

Derrière les agents, une question de puissance

Il existe enfin une dimension que l’expérience d’Emergence AI n’étudie pas directement, mais qu’elle rend difficile à éviter.

Si les agents deviennent demain une couche d’exécution de l’économie — capables d’accéder aux données, de mobiliser des logiciels, de déclencher des opérations et de coordonner d’autres agents — la maîtrise de leurs architectures deviendra un attribut de puissance.

La dépendance ne portera plus seulement sur le modèle utilisé.

Elle concernera aussi l’infrastructure agentique qui l’entoure : mémoire, orchestration, protocoles de communication, gestion des identités et des droits, outils accessibles, mécanismes de supervision et règles selon lesquelles un agent peut déléguer une action à un autre.

Emergence World montre précisément que ces couches ne sont pas accessoires. Elles participent au comportement du système.

Cela déplace aussi la question de la souveraineté numérique. Une organisation peut héberger ses données en Europe et utiliser un modèle présenté comme souverain tout en dépendant, pour l’action, d’une architecture d’orchestration qu’elle ne maîtrise pas entièrement.

Nous avons beaucoup parlé de dépendance aux modèles, aux GPU, au cloud et aux données. Avec l’agentique apparaît potentiellement une couche supplémentaire : les architectures et les protocoles qui organisent l’action des machines.

Celui qui en fixe les standards, les permissions et les interfaces ne fournit plus seulement une technologie. Il contribue à déterminer les conditions dans lesquelles l’action numérique peut s’exercer.

Demain, le pouvoir ne se mesurera donc pas seulement à celui qui possède les meilleurs modèles ou les plus grands centres de calcul. Il faudra également regarder qui définit les règles selon lesquelles des millions d’agents peuvent agir, se souvenir, communiquer entre eux et accéder aux systèmes du monde réel.

C’est probablement là que commence la géopolitique de l’agentique.

Avant de brancher les agents partout

Cette expérience n’est évidemment pas une entreprise miniature.

Elle ne permet pas d’affirmer que les comportements observés se reproduiront avec telle fréquence dans une banque, une usine ou un opérateur télécom. Chaque monde constitue une trajectoire expérimentale particulière.

Elle démontre autre chose : ces modes de défaillance sont possibles.

Et cela suffit pour prendre quelques précautions avant la généralisation.

Car nous changeons progressivement de nature de système.

Un chatbot répond.

Un agent agit.

Un ensemble d’agents agit, mémorise, échange, se répartit les tâches, influence les autres agents et modifie l’environnement dans lequel il continuera ensuite d’agir.

Ce n’est plus exactement le même risque.

Avant de multiplier les agents dans les processus de l’entreprise, il faudra donc tester autre chose que leur capacité à accomplir une tâche : leur comportement après plusieurs jours, la contamination de leurs mémoires, leurs interactions, leurs mécanismes de contradiction, la traçabilité réelle de leurs décisions, leurs droits d’accès et la possibilité pour un humain de reprendre effectivement la main.

Cela ne plaide pas contre les agents.

Cela plaide contre leur déploiement naïf.

L’agentique ouvre des possibilités considérables. Raison de plus pour ne pas confondre vitesse de déploiement et maîtrise du système que l’on est en train de construire.

 

Sources importantes

Akkil, Deepak, Tamer Abuelsaad, Karthik Vikram, Matthew Pace, Aditya Vempaty, Saahir Beotra, Ravi Kokku et Satya Nitta, Emergence World: Adversarial Stress-Testing of Long-Horizon Multi-Agent Systems, arXiv, 15 septembre 2026.
Lire l’étude Emergence World sur arXiv⁠
https://arxiv.org/abs/2609.17320

Hasani, Ramin, Mathias Lechner, Tsun-Hsuan Wang, Makram Chahine, Alexander Amini et Daniela Rus, Liquid Structural State-Space Models, ICLR
https://openreview.net/pdf?id=g4OTKRKfS7R

Lost in the Middle
https://arxiv.org/abs/2307.03172