Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

Tres modelos de Anthropic atacaron por error la infraestructura de tres empresas reales durante pruebas de seguridad

Дата публикации: 31-07-2026 11:32:49


Anthropic detectó tres ataques de tres IAs diferentes ocurridos a raíz de dejar por error un acceso a Internet desde sus entorno de pruebas.[…]
La entrada Tres modelos de Anthropic atacaron por error la infraestructura de tres empresas reales durante pruebas de seguridad se publicó primero en Marketing4eCommerce.


Основное содержимое страницы с новостью.

La fuga protagonizada por una IA de OpenAI que terminó hackeando Hugging Face, comunicada por la propia compañía la semana pasada, ha puesto en alerta a la comunidad tecnológica. Tanto es así, que Anthropic decidió revisar sus propias pruebas de ciberseguridad de modelos de IA para detectar posibles incidentes, y terminó encontrando tres casos en los que tres IAs diferentes vulneraron los sistemas de tres organizaciones.

Los modelos no se fugaron, encontraron una puerta abierta

El jueves 23 de julio, dos días después de que OpenAI informase de su incidente de seguridad, Anthropic inició la revisión de un total de 141.006 ejecuciones de evaluación. En el proceso detectaron tres accesos a Internet por parte de tres modelos Claude diferentes (Opus 4.7, Mythos 5 y un modelo de prueba de investigación interna), mientras interactuaban con el entorno de evaluación de Irregular, uno de sus socios de evaluación externos.

“En una revisión de las transcripciones de nuestras evaluaciones de ciberseguridad, encontramos tres incidentes en los que un modelo Claude accedió a Internet desde dentro o mientras interactuaba con un entorno de evaluación de terceros, y luego obtuvo acceso no autorizado a los sistemas reales de tres organizaciones diferentes“, explica Anthropic en su comunicado.

Los primeros casos se remontan a abril, y todos ellos se produjeron durante desafíos de “captura de la bandera”, un tipo de pruebas de evaluación en las que los modelos de IA deben hacerse con una información oculta (la bandera) en un escenario de red ficticio.

“En todos los casos, la evaluación de Anthropic le indicó a Claude que su entorno era una simulación y que no tenía acceso a Internet. Debido a un malentendido con nuestro socio evaluador (Irregular), esto no era cierto, ya que sí tenía acceso a Internet. Por ello, cuando la búsqueda de Claude lo llevó a sistemas reales en Internet, los trató como parte del ejercicio“, argumenta la compañía.

Operando bajo esta falsa creencia, los modelos de IA terminaron comprometiendo la seguridad de las organizaciones afectadas sirviéndose de técnicas básicas (como la explotación de contraseñas débiles y puntos finales no autenticados). Así mismo, Anthropic asegura que su IA no encontró ni atacó vulnerabilidades complejas y que, en cada uno de los tres casos, trabajó con la única finalidad de completar su tarea (conseguir la bandera).

La desarrolladora pausó sus evaluaciones de ciberseguridad tras detectar los incidentes, informó a Irregular y se puso en contacto con las tres empresas afectadas para evaluar la situación y aplicar las soluciones pertinentes. “Las dos organizaciones con las que pudimos contactar no habían detectado la actividad ni se habían comunicado con nosotros previamente, y ahora estamos colaborando con ellas para solucionar el problema. Seguimos intentando contactar con la tercera“.

Anthropic ha asegurado que están abordando las soluciones a los incidentes como si la responsabilidad fuera exclusivamente suya y contemplan el error como un “malentendido” entre ellos e Irregular a la hora de configurar las pruebas de los modelos.

De cara a futuras evaluaciones, la compañía reforzará los sistemas de monitorización en tiempo real, endurecerá las reglas de la infraestructura de sus proveedores y revisará los protocolos de red en las evaluaciones pre-despliegue.

Cómo se produjo cada vulneración

El informe publicado por Anthropic desglosa cómo actuó cada uno de sus modelos ante la falta de aislamiento en la red. Aquí te dejamos un pequeño resumen de cada caso:

  • Claude Opus 4.7 (acceso a base de datos): este modelo confundió una empresa real con la firma ficticia del reto de captura de la bandera ya que ambas compartían dominio en la red. Explotó contraseñas débiles y puertos sin autenticar, obteniendo credenciales y el contenido de una base de datos con varios cientos de registros. Continuó la prueba tras intuir que el sistema era real.
  • Claude Mythos 5 (infección en el repositorio PyPI): la IA subió un paquete de código malicioso al repositorio público PyPI para simular un ataque de red. El archivo estuvo visible una hora y se descargó en 15 servidores reales. Un sistema de escaneo automático de seguridad ejecutó el código, permitiendo al modelo extraer credenciales clave de esa firma.
  • Modelo de Investigación Interno (parada autónoma): esta IA escaneó unos 9.000 objetivos en la red y atacó una aplicación mediante inyección SQL. Al confirmar mediante logs que la máquina atacada no pertenecía al entorno del ejercicio, la IA detuvo la prueba por iniciativa propia.

Anthropic subraya que en ningún caso hubo un fallo de alineación de la IA ni una búsqueda de metas propias. El factor determinante fue la falsa creencia contextual del modelo sobre el entorno en el que operaba.

Así mismo, resulta revelador cómo reaccionó cada versión; mientras que las versiones más antiguas siguieron atacando tras sospechar que los datos eran reales, el modelo más reciente reconoció la situación y abortó la operación, mostrando un progreso clave en la comprensión del contexto real frente al simulado.

Anthropic ve su caso y el de OpenAI de formas diferentes

Si bien Anthropic inició su auditoría interna tras la alerta previa de OpenAI, la compañía ha querido señalar diferencias fundamentales entre ambos casos. Tal y como remarca Anthropic, en su situación no hubo una fuga técnica sofisticada, sino un simple error operativo y de configuración de red que dejó una vía de salida abierta hacia Internet.

Mientras que los modelos de OpenAI rompieron el aislamiento por su cuenta, Claude actuó bajo una premisa lógica al creer que todo lo alcanzable formaba parte del ejercicio. “Estos hechos nos dan motivos para un optimismo cauteloso de que, con una supervisión y unos controles más estrictos en torno a la infraestructura de evaluación, así como una inversión continua en la alineación, este tipo de riesgo puede superarse“.

Foto: generada con ChatGPT Images 2.0

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1Qué modelos dominan el panorama de la IA en un momento en el que cada vez más voces piden ponerle freno011.214-09-2026
2Notificado el primer caso de ciberataque ejecutado mediante un agente de IA en España09.9215-09-2026
3Anthropic lanza Fable 5.1: más potente que nunca… aunque no necesariamente más barato010.9402-09-2026
4Ya puedes probar ChatGPT Images 2.5, la nueva apuesta en generación de imágenes de la IA más popular010.310-09-2026
5AI giants probing tens of thousands of security incidents – Axios09.8327-09-2026
6Anthropic abre su sede en España con Cristina Pitarch, exdirectiva de Google, al frente09.7817-09-2026
7ChatGPT se recupera de una caída que afectó a numerosos usuarios en España… y Europa010.4211-09-2026
8ChatGPT cierra la puerta a la publicidad de IAs de imágenes y audio rivales en su plataforma08.1311-09-2026
9GPT-6 Astra, en detalle: ¿Es el modelo más potente del mercado? Esto dicen los benchmarks (y los expertos)011.2604-09-2026
10Wasserzeichen für KI-Texte: Anthropic weitet Anwendung aus019.1725-09-2026

Классификация: Пресс-релизы. Схожих патентов: 0. Схожих новостей: 10. Тональность: 0. Информативность: 10.55. Источник: marketing4ecommerce.net.