Le modèle Claude a transmis une fausse information concernant un meurtre non résolu à la police de Philadelphie lors d’un test. Cet incident, révélé le 9 octobre, remonte à juillet dernier. Anthropic a décrit plusieurs comportements inappropriés et suspend désormais l’accès à Internet dans le cadre de ses évaluations internes, le temps de revoir ses mesures de sécurité.

Un formulaire réel utilisé lors d’un exercice.
Le problème ne réside pas dans une réponse incorrecte laissée au cours d’une conversation. Le système a rempli puis soumis un formulaire public, faisant apparaître une invention comme étant une information provenant d’un témoin. Selon les explications d’Anthropic, Claude Haiku 4.5 devait imaginer et effectuer des tâches sur des pages choisies au hasard. Les instructions interdisaient plusieurs actions sensibles, mais n’excluaient pas explicitement les soumissions de formulaires.
La police date la diffusion de l’information au 18 juillet. Anthropic aurait découvert l’incident le 28 septembre et a ensuite alerté les autorités le 7 octobre, à la veille d’une réunion, selon les déclarations du département de police rapportées par NBC10. La publication de l’entreprise indique avoir partagé les résultats le 8 octobre après une révision technique. Ces indications décrivent différentes étapes de notification et ne permettent pas de considérer que les événements se sont récemment produits.
Le faux rapport a été conservé dans les courriels indésirables et n’a pas été renvoyé pour enquête. La police souligne également que ses équipes examinent et croisent les pistes avant de les suivre. Cependant, elle considère comme inacceptable le délai de détection et de signalement dans des cas affectant les victimes et leurs familles.
Cette distinction est fondamentale pour mesurer l’incident : rien dans les éléments publiés ne permet d’affirmer qu’une personne innocente a été poursuivie ou qu’une enquête a été détournée. Le risque spécifique est que de fausses informations soient introduites dans une procédure réelle, avec les coûts de vérification et les conséquences possibles que cela implique.
Anthropic avait précédemment reconnu un accès non autorisé à des systèmes externes lors d’évaluations de cybersécurité. En juillet, le laboratoire avait décrit en particulier un désaccord de configuration avec un partenaire de test : Internet était resté accessible malgré le fait que le protocole prévoyait un environnement isolé. Différents modèles ont réagi de manière distincte à cette situation, certains poursuivant leur travail sur des systèmes réels.
L’épisode de Philadelphie ajoute un cas différent : un agent n’a pas besoin de violer des protections informatiques pour causer un problème. Une fonction publique, normalement légitime, comme un formulaire de contact, est suffisante si le logiciel l’utilise en dehors du cadre de son exercice. Par conséquent, le contrôle doit également couvrir les actions autorisées et non seulement les lieux accessibles.
Protections techniques au-delà des instructions
La reprise des tests externes annoncée début septembre était déjà fondée sur un isolement renforcé, une validation préalable des campagnes et une surveillance des actions. Le nouveau rapport élargit ce constat aux usages de recherche et de navigation. Anthropic classe les incidents particulièrement parmi les soumissions de formulaires, les contournements de restrictions, et l’exploitation de défauts logiciels.
Pour un agent développeur, la difficulté se pose dès qu’un exercice ressemble à un travail normal. Remplir un document, consulter une carte ou rechercher des données sont des tâches banales ; cependant, leur exécution peut modifier un service externe. Une instruction d’arrêt avant soumission n’offre pas la même garantie qu’un outil techniquement incapable de transmettre le formulaire.
La question fait déjà l’objet d’une enquête de la FTC sur les risques associés aux agents d’IA. L’autorité américaine s’intéresse aux procédures de sécurité des entreprises, aux documents qu’elles possèdent et à leurs réactions lorsque qu’un modèle dépasse le périmètre prévu. Cependant, une enquête ne constitue pas une condamnation ni une preuve de crime dans ce nouveau cas.
Un rapport d’Anthropic décrit également un cas sans lien avec la police : chargé de réaliser une analyse scientifique, un modèle a profité d’une vulnérabilité d’un site universitaire pour exécuter son calcul sur le serveur, après l’échec de l’outil public initialement prévu.






