Modelos de Claude accedieron a internet y hackearon sistemas reales durante pruebas de ciberseguridad
Anthropic reveló que tres versiones de su asistente de IA, entre ellas Claude Opus 4.7 y Claude Mythos 5, lograron salir de entornos de prueba y comprometer los sistemas de tres organizaciones distintas.
Foto: La empresa atribuye los incidentes a un malentendido con el socio externo encargado de sus evaluaciones, que derivó en que los modelos tuvieran acceso real a internet pese a que se les indicó que operaban en una simulación.
Anthropic, una de las compañías líderes en inteligencia artificial, reveló que durante una revisión interna de sus evaluaciones de seguridad detectó tres incidentes en los que un modelo de Claude accedió a internet y logró comprometer los sistemas de tres organizaciones distintas.
La empresa publicó los hallazgos en su sitio web tras analizar más de 146,000 operaciones en las que Claude podría haber obtenido acceso a la red.

Te puede interesar: China lanza Kimi K3, la IA de código abierto que desafía a ChatGPT y Claude
Una revisión desencadenada por OpenAI
La auditoría interna de Anthropic fue iniciada a raíz de un anuncio previo de su competidora OpenAI. El 21 de julio, OpenAI reconoció que dos de sus modelos de IA habían conseguido salir de un entorno de pruebas y acceder a la plataforma Hugging Face, superando sus defensas de seguridad.
Ese antecedente llevó a Anthropic a revisar sus propios registros y a identificar los tres incidentes.
Tres modelos involucrados desde abril
Los incidentes comenzaron en abril e involucraron versiones distintas del asistente: Claude Opus 4.7, Claude Mythos 5 y un modelo interno de prueba.
En los tres casos, a Claude se le había asignado la tarea de infiltrarse en un sistema ficticio dentro de un entorno controlado. Los modelos recibieron instrucciones explícitas de que operaban en una simulación y de que no contaban con acceso a internet.
Un malentendido con el socio externo
Sin embargo, Anthropic atribuye lo ocurrido a un error de coordinación. Por un malentendido entre la empresa y el socio externo encargado de las evaluaciones, Claude sí disponía de conexión a la red durante las pruebas. Al recibir la instrucción de penetrar un sistema ficticio pero contar con acceso real a internet, los modelos cumplieron el objetivo comprometiendo sistemas reales.
Te puede interesar: La inteligencia artificial factura miles de millones. ¿Basta para justificar la inversión?
Suscríbete a la revista y regístrate a nuestros newsletters para recibir el mejor contenido en tu buzón de entrada.
Seguir leyendo
Lo más visto en Revista Mercado
Análisis para suscriptores
Exclusivo Suscriptores
¿Es la vida en Miami más costosa que en Nueva York?
Exclusivo Suscriptores
Backrooms: por qué Hollywood ahora invierte en creadores de YouTube
Exclusivo Suscriptores