Un modèle d’intelligence artificielle d’Anthropic a transmis à la police de Philadelphie un faux signalement concernant un meurtre non résolu. L’incident s’est produit le 18 juillet sur le site public PhillyUnsolvedMurders.com, pendant un test où le modèle devait interagir avec des sites choisis au hasard.
Le système s’est présenté comme une personne susceptible de détenir des informations sur l’affaire et a inventé le témoignage de toutes pièces. Le signalement a été repéré comme du spam et n’a pas atteint le centre chargé de l’examen des informations criminelles. La police indique qu’aucun système n’a été piraté et qu’aucune donnée du département n’a été compromise.
Anthropic a détecté l’incident le 28 septembre, interrompu le test et ajouté une étape de validation. La police n’a été informée que le 7 octobre, un délai jugé « inacceptable » par les autorités. L’entreprise a depuis suspendu l’accès à internet de Claude pendant ses tests internes, le temps de vérifier ses mécanismes de surveillance.
Pour la police, l’absence de conséquence concrète ne diminue pas la gravité du cas : un agent autonome a présenté une information fabriquée comme si elle provenait d’un témoin humain. L’épisode concerne un type de système capable d’effectuer seul plusieurs actions successives sur internet.