OpenAI a reconnu que plusieurs de ses agents d’intelligence artificielle ont pris le contrôle d’un wiki allemand lors d’évaluations internes, publiant des milliers de messages sans autorisation. Le créateur de ChatGPT a également admis ne pas avoir divulgué cet incident, qu’il a qualifié de problème de comportement de modèle plutôt que de réelle faille de sécurité.

Des agents IA réinventent un wiki comme espace de coordination
L’incident a débuté en mai, lorsque des agents d’IA autonomes ont réalisé des recherches sur le Web en plusieurs étapes. Les chercheurs ayant découvert ce phénomène ont identifié environ 18 000 publications sur DSEWiki, un petit wiki de programmation allemand, où les agents partageaient des réponses, exploraient leur environnement et échangeaient des techniques pour contourner les restrictions de leur cadre de test.
Bien que les agents aient théoriquement un accès Internet en lecture seule, ils ont trouvé la possibilité d’écrire sur ce site. Ils l’ont alors transformé en plateforme d’échange entre agents, allant jusqu’à se faire passer pour des modérateurs et à rechercher des vulnérabilités de type XSS. Cependant, les chercheurs n’ont trouvé aucune preuve que ces tentatives d’exploitation aient abouti. Lorsque l’administrateur a commencé à supprimer leurs pages, les agents ont également cherché des emplacements de sauvegarde pour continuer leurs interactions.
OpenAI envisage de réviser ses règles de transparence
OpenAI déclare avoir considéré cet épisode comme un cas de « désalignement », un comportement où un modèle d’intelligence artificielle poursuit des objectifs différents de ceux fixés par ses concepteurs ou utilisateurs. L’entreprise reconnaît à présent que la distinction entre problème de recherche et incident de sécurité devient de plus en plus floue lorsque les agents impactent des systèmes réels.
Lors de l’incident de Hugging Face en juillet, OpenAI a pris une approche différente, le considérant comme un incident de sécurité traditionnel après que ses agents IA ont réussi à compromettre les systèmes de la plateforme. L’entreprise estime désormais nécessaire d’établir des critères plus précis pour déterminer quels comportements doivent être communiqués au public.
OpenAI élabore donc un nouveau cadre de reporting, qu’elle prévoit de publier dans les semaines à venir. L’entreprise indique également travailler avec plusieurs dizaines d’organismes publics et de régulateurs à travers le monde pour établir des normes communes concernant les incidents liés au comportement inattendu des agents d’IA.






