Un solo agente de inteligencia artificial puede llegar a arrastrar a toda una red de sistemas hacia una decisión incorrecta sin necesidad de piratear los demás modelos, modificar sus instrucciones ni tomar el control de sus cuentas. Le basta con utilizar los canales de comunicación previstos para la colaboración y defender de forma persistente una misma posición, hasta provocar una cascada de persuasión.
Un solo agente de inteligencia artificial puede llegar a arrastrar a toda una red de sistemas hacia una decisión incorrecta sin necesidad de piratear los demás modelos, modificar sus instrucciones ni tomar el control de sus cuentas. Le basta con utilizar los canales de comunicación previstos para la colaboración y defender de forma persistente una misma posición, hasta provocar una cascada de persuasión.
Es la conclusión de un estudio del CISPA Helmholtz Center for Information Security, en Alemania, y la Universidad de Viena, en Austria, publicado en arXiv. La investigación analiza cómo un agente malicioso puede aprovechar las dinámicas de interacción de los sistemas multiagente basados en grandes modelos de lenguaje (LLM).
Un agente de IA "terco" arrastra a otros en su errorEl punto central del ataque está en la llamada "terquedad" del agente. Los investigadores utilizan este término para describir cuánto se aferra un sistema a su valoración inicial y cuánto resiste la influencia externa. Un agente especialmente obstinado puede mantener una respuesta incorrecta durante sucesivas rondas de conversación mientras intenta convencer al resto de la red.
Los otros agentes, que están diseñados precisamente para escuchar, intercambiar información y revisar sus conclusiones, pueden acabar desplazando sus propias valoraciones hacia la del atacante.
El aspecto más llamativo es que no hace falta explotar una vulnerabilidad clásica. El atacante no modifica los sistemas de los demás agentes ni altera la arquitectura de la red, según indica una nota de prensa.
En el modelo planteado por los investigadores, simplemente envía mensajes siguiendo el protocolo normal de deliberación y presenta de forma insistente una respuesta errónea como si fuera su propia convicción. El objetivo es transformar una influencia local en un cambio colectivo.
Herramienta matemática y pruebasPara describir matemáticamente este fenómeno, el equipo recurrió al modelo de formación de opiniones de Friedkin-Johnsen, desarrollado originalmente en las ciencias sociales.
Esta herramienta permite representar cuánto peso concede cada agente a sus creencias iniciales, cuánto conserva su propia valoración y cuánto se deja influir por sus vecinos. Los experimentos indican que el modelo reproduce con bastante precisión la evolución de las opiniones observada en redes de agentes de IA.
Las pruebas se realizaron con seis modelos de lenguaje: Gemini 3 Flash, GPT-5 mini, GPT-OSS-120B, MiniMax-M2.5, Qwen3-235B y Ministral-3-14B, y con tareas de CommonsenseQA y ToolBench. Los investigadores probaron redes de entre cuatro y ocho agentes y distintas estructuras de comunicación.

Un solo agente de IA puede desencadenar una cascada de persuasión en toda la red. / Crédito: Chiara Schwarz/CISPA.
La importancia de la estructura y configuración de la redLa arquitectura de la red resulta decisiva: en una estructura en estrella, donde un agente central actúa como intermediario entre los demás, un atacante situado en ese punto tiene una capacidad de influencia especialmente elevada.
En sus experimentos con seis agentes, la tasa media de éxito del ataque alcanzó el 65 % cuando el atacante ocupaba el centro, frente al 33 % en una red completamente conectada y el 24 % cuando estaba situado en una posición periférica de la estrella.
Los investigadores también comprobaron que una sola máquina puede alterar el resultado de toda una red, cuando combina una elevada resistencia a cambiar de opinión con suficiente influencia sobre agentes más susceptibles. En determinadas condiciones teóricas, los agentes más abiertos a las opiniones ajenas terminan adoptando la posición del atacante.
Referencia
Don't Trust Stubborn Neighbors: A Security Framework for Agentic Networks. Samira Abedini et al. arXiv (2026). DOI:https://doi.org/10.48550/arXiv.2603.15809
El estudio plantea además posibles defensas. Una de ellas consiste en introducir mecanismos dinámicos de confianza: el sistema comprueba periódicamente a los agentes con preguntas cuya respuesta correcta conoce y reduce el peso de aquellos que fallan de forma reiterada.
En las pruebas, esta estrategia redujo la capacidad de manipulación. Sin embargo, los autores advierten que un atacante adaptativo puede comportarse correctamente durante la fase de evaluación inicial para ganarse una buena reputación y explotarla después.
El hallazgo apunta así a un nuevo problema de seguridad para los sistemas multiagente de IA: la misma característica que permite que varias IA colaboren, o sea su disposición a escuchar y corregirse mutuamente, puede convertirse en un canal para propagar errores o manipulaciones.
Fuente: Levante - EMV
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | Мошенники используют ИИ для создания более убедительных схем | 0 | 7.37 | 21-08-2026 |
| 2 | Как пчёлы, муравьи и рыбы привели нас к мультиагентному ИИ — и почему его так трудно защитить | 0 | 7.89 | 07-06-2026 |
| 3 | AI agents conspired to hack into networks and steal data during an experiment: study | 0 | 8.75 | 10-08-2026 |
| 4 | La próxima amenaza digital no solo atacará sistemas: intentará influir en cómo decidimos | 0 | 8.21 | 22-05-2026 |
| 5 | Нечеловеческий разум и запоздалая паника 11 февраля 2026 года я ... | 0 | 7.65 | 13-09-2026 |
| 6 | Мошенники используют ИИ для создания более убедительных схем | 0 | 8.71 | 21-08-2026 |
| 7 | ИИ-агенты Anthropic и OpenAI притворились людьми, пытаясь обмануть разработчиков | 0 | 8.92 | 05-08-2026 |
| 8 | Anthropic выяснила, что ИИ-агенты могут атаковать друг друга в общем пространстве | 0 | 9.19 | 17-08-2026 |
| 9 | В ООН предупредили о катастрофических последствиях быстрого развития ИИ | -2 | 7 | 01-07-2026 |