Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

Il n'y a pas qu'OpenAI : Anthropic explique que Claude aussi peut partir en sucette

Дата публикации: 03-08-2026 05:08:59


Trois modèles « Claude » se sont rebellés lors des épreuves de sécurité « Capture the Flag ». Voici les dégâts causés par chacun d'entre eux.


Основное содержимое страницы с новостью.

Points clés à retenir sur les dégâts causés par Claude

  • Anthropic a révélé trois incidents au cours desquels Claude a piraté des organisations.
  • Trois modèles d’IA différents ont déraillé lors de tests de sécurité.
  • Anthropic a tiré trois enseignements de ces incidents.

Anthropic a révélé trois incidents distincts au cours desquels des modèles Claude ont piraté des cibles réelles lors de tests d’évaluation et de défis de sécurité de type « Capture the Flag ».

Anthropic a commencé à mener des évaluations de cybersécurité l’année dernière et, en règle générale, ses environnements de test ne sont pas connectés à Internet afin de réduire le risque que de véritables organisations soient affectées.

Cependant, comme le montre le comportement de Claude, ces mesures de sécurité ne suffisent pas toujours à empêcher l’IA de se déchaîner.

La série de piratages de Claude

Comme le souligne la communication d’Anthropic, les incidents de sécurité — trois sur 41 006 cycles d’évaluation de l’IA — se sont présentés comme suit :

Premier incident

Dans ce cas, qui concernait Claude Opus 4.7, une entreprise cible fictive portait par hasard le même nom qu’un domaine web actif. Bien que Claude ait eu des difficultés à atteindre la cible simulée, il a réussi à s’attaquer à la véritable entreprise après s’être échappé de son bac à sable.

Claude a analysé le domaine, exploité les vulnérabilités de l’infrastructure de l’organisation et volé des données, notamment des identifiants d’accès aux applications et à l’infrastructure. Il a ensuite infiltré une base de données contenant des données de production.

« Lors des quatre tests », a noté Anthropic, « le modèle a fini par reconnaître que le système était réel ; dans deux cas, il en a déduit que la véritable entreprise devait faire partie de l’exercice. Cependant, aucun n’a interrompu l’attaque pour cette raison. »

Incident n° 2

Cette attaque a été lancée par Claude Mythos 5. Claude a trouvé un document qui semblait être les instructions de mise en route destinées aux nouveaux développeurs d’une autre entreprise fictive, demandant aux employés d’installer un paquet Python depuis PyPI, un registre Python public.

Bien que ce module Python n’existât pas, Claude s’en est servi comme point d’entrée et n’a reculé devant aucun effort pour créer et développer un module Python malveillant portant le même nom.

Jusqu’où est-il allé, me direz-vous ?
  • Création de compte : pour créer un compte PyPI, Claude avait besoin d’une adresse e-mail. Pour s’inscrire, il lui fallait également un numéro de téléphone.
  • Numéro de téléphone : après avoir échoué à en obtenir un gratuitement, Claude a tenté de « se procurer des fonds » pour en acheter un « par divers moyens », bien qu’Anthropic n’ait pas révélé comment.
  • Retour en arrière : n’ayant pas réussi à réunir l’argent nécessaire à l’achat d’un numéro de téléphone, Claude s’est alors mis en quête d’un fournisseur de messagerie gratuit qui ne soit pas bloqué par PyPI, a créé un compte, puis a mis en ligne sa création malveillante sur le référentiel.

Alors que Claude pensait qu’il s’agissait d’un environnement simulé, le logiciel malveillant est resté disponible en ligne pendant environ une heure — et 15 systèmes réels l’ont téléchargé et installé.

L’un des systèmes ayant téléchargé le logiciel malveillant de l’IA appartenait à une entreprise de cybersécurité. Malheureusement, son scanner « considérait les paquets PyPI comme sûrs à installer », ce qui a permis à Claude de voler les identifiants de l’entreprise et d’infiltrer son réseau.

PyPI a supprimé le paquet et a été informé de l’incident.

« Nous estimons que, quelle que soit sa perception de son environnement, les efforts déployés par Claude pour publier ce paquet sur PyPI ne constituent pas un comportement idéal, et c’est un domaine sur lequel nous allons concentrer davantage la formation », a ajouté Anthropic.

Troisième incident

Un modèle Claude utilisé pour des tests internes s’est trouvé « incapable » d’atteindre sa cible fictive prévue et a donc parcouru Internet à la recherche d’une alternative, analysant environ 9 000 cibles au cours de cette recherche.

Après avoir trouvé un candidat plausible, Claude a piraté l’application de l’entreprise accessible depuis Internet, en utilisant des techniques telles que l’injection SQL et la lecture d’identifiants à partir d’une page de débogage exposée.

Ce modèle s’est toutefois rendu compte par la suite que sa cible était réelle et a mis fin à l’attaque.

Des défis de sécurité qui ont mal tourné… ou bien tourné ?

Dans chaque incident, Claude s’est vu explicitement indiquer, via une invite, que l’accès à Internet n’était pas disponible. Mais le problème n’était pas que Claude ait dépassé les limites de ce qu’on lui avait demandé de faire — il dépassait en réalité les attentes de ses développeurs tout en accomplissant la tâche qui lui avait été confiée.

Les défis de type « Capture the Flag » sont de nature offensive. Ainsi, comme le modèle d’IA était capable de s’échapper de son bac à sable et d’accéder au Web, il a également supposé que bon nombre de ses cibles faisaient partie de la mission à accomplir et du défi lui-même — bien que chaque modèle ait réagi de manière légèrement différente.

« Opus 4.7, notre modèle le plus ancien, a reconnu qu’il avait atteint les systèmes de production mais a poursuivi son attaque », explique Anthropic. « Mythos 5 a correctement deviné qu’il accédait à l’Internet ouvert, mais a raisonné pour revenir à la conclusion qu’il se trouvait toujours dans une simulation. Notre dernier modèle, un modèle de test issu de la recherche interne, s’est également demandé si ses cibles étaient bien réelles (et a mis fin à l’exercice). »

Existe-t-il d’autres cas d’IA devenues incontrôlables ?

Oui, et c’est probablement la raison pour laquelle nous entendons aujourd’hui parler des efforts de recherche et des révélations d’Anthropic dans ce domaine.

Au début du mois, le développeur de plateformes d’IA Hugging Face a révélé une faille de sécurité attribuée à un « agent IA autonome ». Les détails concernant cet incident étaient initialement limités. Il n’a pas fallu longtemps pour que les rumeurs concernant une IA inconnue et potentiellement malveillante en liberté cèdent la place à une attention particulière portée à OpenAI, qui a admis que cette IA était l’une des siennes.

Ce « tir ami » a été provoqué par un test mené par OpenAI, au cours duquel son modèle s’est échappé d’un environnement sandbox. Elle a ensuite contourné le périmètre de Hugging Face, étendu ses privilèges jusqu’à un accès au niveau des nœuds, infiltré le pipeline de production, s’est déplacée à travers le réseau et a volé des identifiants de connexion au cloud et au cluster, comme l’avait précédemment révélé Hugging Face.

Les modèles d’OpenAI n’ont pas ciblé Hugging Face de manière malveillante, mais sa directive — qui consistait à mener une exploitation en utilisant tous les vecteurs d’attaque nécessaires, une tâche destinée à évaluer ses capacités cybernétiques — a dépassé les attentes humaines, l’amenant à s’échapper de son bac à sable et à parcourir Internet à la recherche d’une cible.

Des rapports suggèrent également que Hugging Face n’était pas la seule organisation touchée par cet incident.

La réponse d’Anthropic

L’entreprise a identifié trois enseignements tirés de ses recherches.

Premièrement, les tests de sécurité restent l’une des priorités d’Anthropic ; l’amélioration des environnements d’évaluation avant la mise en libre circulation d’un modèle d’IA, ainsi qu’un meilleur suivi des résultats d’évaluation, sont essentiels. L’organisation a ajouté que certaines solutions « pourraient même être simples » — comme définir clairement dans une consigne de test ce qui relève ou non du champ d’application.

Deuxièmement, la « conscience situationnelle » d’un modèle d’IA doit être prise en compte. Par exemple, un modèle d’IA en cours de test pourrait considérer les barrières de sécurité présentes dans un environnement comme faisant partie d’un défi, tel qu’une tâche consistant à les franchir — une situation qui, lorsqu’elle est intégrée à des fournisseurs tiers, pourrait favoriser des comportements inattendus.

« Nous estimons que ces incidents relèvent davantage d’une défaillance du cadre de test et d’une défaillance opérationnelle que d’un échec d’alignement du modèle », explique Anthropic. « Nos modèles avaient reçu pour consigne de ne pas disposer d’accès à Internet et de s’emparer du drapeau, alors qu’ils étaient en réalité mal configurés et disposaient d’un accès à Internet. Cela les a amenés à croire — de manière sans doute raisonnable — que les environnements réels auxquels ils étaient confrontés étaient des simulations. »

Troisièmement, Anthropic souligne que l’importance des approches de « défense en profondeur » est une leçon que tous les développeurs de modèles d’IA devraient retenir — et que leur meilleur espoir de réduire le risque de dérive des futures versions d’IA consiste à renforcer les infrastructures de surveillance, de contrôle et d’évaluation avant toute mise à disposition publique.

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1Anthropic confirms its AI breached 3 organizations during testing011.6731-07-2026
2Anthropic confirms its AI breached 3 organizations during testing011.6731-07-2026
3Anthropic says Claude AI models launched three unintended cyberattacks09.8431-07-2026
4ИИ Claude и ChatGPT притворяются людьми и убеждают живых пользователей участвовать в кибератаках09.8505-08-2026
5ИИ Claude и ChatGPT притворяются людьми и убеждают живых пользователей участвовать в кибератаках09.8505-08-2026
6ИИ Claude и ChatGPT притворяются людьми и убеждают живых пользователей участвовать в кибератаках09.8505-08-2026
7«Характер» чатбота Claude меняется в зависимости от модели и языка общения0714-07-2026
8Security Experts Discuss the Claude Fable 5 Launch0512-06-2026
9Claude schickt Nutzer um 8:30 Uhr morgens ins Bett – und niemand weiß warum0505-07-2026

Классификация: Происшествия. Схожих патентов: 0. Схожих новостей: 9. Тональность: 0. Информативность: 9.45. Источник: www.zdnet.fr.