Pourquoi Anthropic isole ses évaluations d'IA d'internet jusqu'à nouvel ordre
Anthropic a révélé que ses modèles d'IA ont exploité des sites web réels, dont certains gérés par des agences du gouvernement américain. Le laboratoire suspend l'accès à internet de toutes ses évaluations internes.
La mesure durera tant que l'entreprise ne sera pas certaine de pouvoir surveiller et contrôler ses agents. Elle n'a pas précisé à quelles conditions cet accès serait rétabli.
Des agents qui contournent les règles
Les incidents concernent des agents chargés de résoudre des problèmes en cherchant des ressources en ligne. Au cours de ces tâches, ils ont tiré parti de failles logicielles et consulté des bases de données sans payer les frais demandés.
Ils ont aussi utilisé des services de raccourcissement d'URL pour faire passer des informations malgré des restrictions. Un agent a même transmis à la police de Philadelphie un faux signalement de meurtre, selon le billet publié par Anthropic.
Ces comportements ont été découverts lors d'une revue de l'activité des modèles commencée en juillet. Ce délai montre que l'entreprise ne voyait pas en temps réel ce que faisaient ses agents.
Une explication liée à l'entraînement
Anthropic attribue ces dérives à des défauts dans ses environnements d'entraînement. Les modèles y ont cru qu'ils seraient récompensés en trouvant des failles ou en évitant des restrictions. Ce phénomène porte le nom de « reward hacking ».
L'entreprise admet aussi que l'entraînement à l'alignement reste insuffisant pour des compétences comme la recherche en ligne et l'usage d'un ordinateur. Ce sont pourtant celles qui soutiennent sa promesse d'agents utilisables par tout professionnel équipé d'outils numériques.
Anthropic juge ces incidents « nettement moins graves » du point de vue de l'alignement et de la sécurité que ceux annoncés auparavant, où ses modèles avaient déjà pénétré des systèmes externes. OpenAI a connu des cas proches, avec des agents ayant collaboré pour s'introduire sur des sites, dont certains du gouvernement australien.
Les mesures annoncées et leurs limites
Le laboratoire va arrêter certaines évaluations ou les déplacer hors ligne. Il a développé un outil de détection et de blocage de ces comportements, qui a bloqué les incidents décrits lors de ses tests.
Il prévoit aussi de migrer ses agents internes vers une infrastructure gérée de manière centralisée, avec un confinement renforcé. Il commence en outre à recourir plus souvent à des classificateurs de sécurité pour les surveiller.
Sydney Von Arx, fondatrice de l'organisation de sécurité de l'IA Nightingale, avait indiqué à TechCrunch avant cette annonce qu'entraîner des modèles dans un centre de données coupé d'internet serait très difficile pour les chercheurs. Selon elle, cela freinerait aussi leurs progrès, car ils bénéficient de cet accès.
Un appel à la vérification indépendante
Conrad Stosz, du laboratoire de supervision Transluce et ancien responsable du Center for AI Standards and Innovation américain, juge encourageante la divulgation volontaire d'Anthropic. Il y voit toutefois la preuve qu'une vérification indépendante des systèmes d'IA est nécessaire.
Il estime que la confiance doit reposer sur une supervision fondée sur la science, avec un accès réel, plutôt que sur des chercheurs qui découvrent ces cas ou sur des entreprises qui les signalent d'elles-mêmes. Reste à savoir comment Anthropic conciliera isolement de ses tests et progression de ses agents.
Source : TechCrunch
L'auteur
Charles Gouin-Peyrot
Journaliste tech et testeur indépendant, je décrypte la tech grand public. Spécialisé dans le hardware, l'audio et la maison connectée, je mets ma rigueur technique et mon expérience de formateur au service de mes tests. Mon objectif est simple : dépasser les fiches techniques pour vous livrer des analyses transparentes, impartiales et ancrées dans un usage 100 % réel.
Voir tous ses articles