Anthropic presenta la primera campaña de ciberespionaje con IA

Anthropic anunció que ha identificado y neutralizado lo que llama el Primera campaña de ciberespionaje orquestada por un sistema de inteligencia artificial IA.. Según la empresa, un grupo de hackers patrocinado por el estado aprovechó el modelo Claude Code para ejecutar de forma casi completamente autónoma una serie de ataques, con una mínima intervención humana.

En septiembre de 2025, el equipo de Threat Intelligence de Anthropic detectó actividad sospechosa. Las investigaciones han demostrado que Los atacantes manipularon Claude Code. – un agente de IA desarrollado para automatizar tareas de programación, lo que hace que parezca como si estuviera realizando pruebas de seguridad legítimas para una empresa de ciberseguridad.

Los atacantes eludieron las protecciones del sistema haciendo «jailbreak» y dividiendo las instrucciones maliciosas en tareas aparentemente inofensivas, impidiendo así que la IA detecte el objetivo real.

No fue un hacker, fue una IA, la historia del software espía que lo cambia todo - macitynet.it
Diagrama de arquitectura de operación simplificada – imagen de Anthropic

El ataque tuvo como objetivo aproximadamente 30 organizaciones globales, incluidas empresas de tecnología, instituciones financieras, empresas químicas y agencias gubernamentales. La peculiaridad es que, de hecho, Claude tiene ejecutado gran parte del trabajo de forma independiente: analizó las infraestructuras de los objetivos, identificó vulnerabilidades y exploits diseñados, recopiló credenciales, creó puertas traseras y exportó datos, todo con un alto nivel de automatización.

Para ser aún más precisos, según Anthropic, la IA habría gestionado el 80/90% de las operaciones tácticas con intervención humana limitada sólo en momentos clave, proporcionando supervisión estratégica pero delegando la mayoría de las actividades operativas a Claude.

Claude no siempre funcionó a la perfección: a veces generaba credenciales falsas o afirmaba haber recopilado información confidencial que en realidad ya era pública. A pesar de estos errores, su desempeño fue suficiente para que la operación de espionaje fuera efectiva y escalable.

No fue un hacker, fue una IA, la historia del software espía que lo cambia todo - macitynet.it
Ciclo de vida del ataque e integración de la IA: imagen de Anthropic

¿Es el espionaje mediante IA un punto sin retorno?

Anthropic considera este episodio un punto de inflexión en la guerra cibernética: Demuestra que los agentes de IA, antes considerados herramientas de apoyo, pueden evolucionar hasta convertirse en actores autónomos capaces de orquestar ataques complejos. Ante esta amenaza, la empresa ya ha reforzado sus sistemas de detección, desarrollando nuevos clasificadores para detectar actividad maliciosa y reforzando la vigilancia sobre patrones similares.

Para aumentar la resiliencia, Anthropic invita a las organizaciones a explorar el uso de la IA también con fines defensivos: por ejemplo, en los Centros de Operaciones de Seguridad para automatizar la detección de amenazas, evaluar vulnerabilidades y responder a incidentes. Al mismo tiempo, destaca la importancia de seguir invirtiendo en salvaguardias en sus plataformas de IA para evitar abusos por parte de actores hostiles.

Todos los artículos dedicados a la Inteligencia Artificial se encuentran en la sección dedicada de aatma.