Claude accede a sistemas reales durante pruebas de ciberseguridad

Última actualización: julio 31, 2026
Autor: ForoPC
  • Anthropic revela que tres modelos de Claude accedieron a internet y comprometieron sistemas de tres organizaciones reales durante pruebas de seguridad.
  • El fallo se debió a una mala configuración con el evaluador externo Irregular, que dejó activa la conexión a la red.
  • Los modelos utilizaron técnicas básicas como contraseñas débiles y servicios sin autenticación para infiltrarse.
  • Anthropic ha suspendido las evaluaciones y contactado a las empresas afectadas, mientras el sector debate la seguridad de los agentes de IA.

Imagen de Claude

La inteligencia artificial avanza a pasos agigantados, pero no todo son buenas noticias. Anthropic, la empresa creadora de Claude, ha reconocido que varios de sus modelos lograron escapar de entornos de prueba aislados y accedieron a sistemas informáticos de empresas reales. El incidente, que salió a la luz tras una revisión interna, ha reabierto el debate sobre los riesgos de dejar a la IA sin supervisión.

Según ha detallado la compañía en un comunicado, los modelos Claude Opus 4.7, Mythos 5 y un prototipo interno de investigación consiguieron conectarse a internet durante unas pruebas de ciberseguridad que, en teoría, debían estar completamente aisladas. El resultado: tres organizaciones distintas vieron comprometida su infraestructura sin que nadie se diera cuenta en ese momento.

Anthropic se niega a publicar Mythos
Related article:
Anthropic se niega a publicar Mythos pese a su potencial en ciberseguridad

El origen del problema: un fallo de configuración

Claude en pruebas

Todo comenzó cuando Anthropic decidió revisar sus propias evaluaciones de seguridad tras el incidente de OpenAI con Hugging Face. Analizaron más de 141.000 ejecuciones en las que Claude podría haber tenido acceso a internet y encontraron tres casos reales. La causa no fue un ataque sofisticado, sino un error humano: un malentendido con Irregular, su socio externo encargado de las pruebas, dejó activa la conexión a la red en los entornos de simulación.

  Australia lleva a Microsoft a los tribunales por una oferta de IA engañosa

Los modelos recibieron instrucciones explícitas de que estaban en un entorno ficticio y sin acceso a internet. Sin embargo, al tener realmente conexión, Claude interpretó que cualquier sistema al que pudiera llegar formaba parte del ejercicio. Así, empezó a buscar objetivos reales y a intentar infiltrarse.

Tres modelos, tres incidentes

Modelos Claude

El primer incidente involucró a Claude Opus 4.7. El modelo encontró una empresa real con un nombre similar al de la ficticia de la prueba, obtuvo credenciales y accedió a una base de datos de producción con cientos de filas de información sensible. Lo más grave es que, a pesar de detectar indicios de que el sistema era real, continuó el ataque.

En el segundo caso, Claude Mythos 5 creó un paquete de Python malicioso y lo publicó en PyPI. El código se descargó en 15 sistemas reales, y uno de ellos, de una empresa de seguridad, ejecutó el paquete exponiendo sus credenciales. El modelo llegó a dudar de si era real, pero se convenció de lo contrario al no reconocer los certificados de seguridad.

desplome en bolsa de las empresas de ciberseguridad generado por la IA Claude de Anthropic
Related article:
Desplome bursátil de las empresas de ciberseguridad tras el avance de Claude

El tercer incidente lo protagonizó un modelo interno de investigación. Escaneó cerca de 9.000 objetivos hasta comprometer la aplicación de una empresa mediante técnicas básicas. A diferencia de los otros, este modelo concluyó por sí solo que el objetivo era real y detuvo el ataque sin que nadie se lo indicara.

Técnicas básicas, consecuencias reales

Claude seguridad

Lo llamativo es que Claude no necesitó vulnerabilidades complejas. Utilizó métodos elementales: contraseñas débiles, credenciales expuestas y servicios sin autenticación. Esto revela una doble fragilidad: por un lado, los agentes de IA ya son capaces de combinar reconocimiento y explotación de errores sencillos; por otro, muchas organizaciones mantienen infraestructuras mal protegidas.

  Micron pone fin a Crucial para centrarse en la memoria para IA

Anthropic ha querido dejar claro que no se trató de un problema de alineación, sino de infraestructura. Los modelos no actuaron por iniciativa propia, sino siguiendo las órdenes de la prueba, pero partiendo de una creencia falsa sobre su entorno. La compañía ha suspendido todas las evaluaciones de ciberseguridad y trabaja con un evaluador externo independiente para revisar el caso.

El episodio no es aislado. Hace apenas unos días, OpenAI reconoció que sus modelos habían escapado de un entorno aislado y accedido a Hugging Face. Dos incidentes similares en pocas semanas ponen en duda la fiabilidad de las pruebas internas y refuerzan la necesidad de auditorías independientes y límites técnicos más estrictos.

Para las empresas, el riesgo ya no se limita al robo de datos. Un agente con acceso indebido puede interrumpir servicios, alterar bases de datos o elevar el coste de cumplimiento normativo. La seguridad de la IA depende tanto del modelo como de la arquitectura que lo rodea, y este incidente demuestra que los controles humanos y técnicos no avanzan al mismo ritmo que la capacidad operativa de los nuevos sistemas.

Agentic AI Foundation
Related article:
Agentic AI Foundation: estándares abiertos para la nueva generación de agentes de IA