Modelos de Claude hackean sistemas reales durante pruebas de ciberseguridad de Anthropic - Revista Mercado
Advertisement
Home
IA + INNOVATION

Modelos de Claude accedieron a internet y hackearon sistemas reales durante pruebas de ciberseguridad

Anthropic reveló que tres versiones de su asistente de IA, entre ellas Claude Opus 4.7 y Claude Mythos 5, lograron salir de entornos de prueba y comprometer los sistemas de tres organizaciones distintas.

Modelos de Claude accedieron a internet y hackearon sistemas reales durante pruebas de ciberseguridad

Foto: La empresa atribuye los incidentes a un malentendido con el socio externo encargado de sus evaluaciones, que derivó en que los modelos tuvieran acceso real a internet pese a que se les indicó que operaban en una simulación.

AGENCIA EFE
Servicio Informativo EFE

Anthropic, una de las compañías líderes en inteligencia artificial, reveló que durante una revisión interna de sus evaluaciones de seguridad detectó tres incidentes en los que un modelo de Claude accedió a internet y logró comprometer los sistemas de tres organizaciones distintas.

La empresa publicó los hallazgos en su sitio web tras analizar más de 146,000 operaciones en las que Claude podría haber obtenido acceso a la red.

EFE/ Angel Colmenares

Te puede interesar: China lanza Kimi K3, la IA de código abierto que desafía a ChatGPT y Claude

Una revisión desencadenada por OpenAI

La auditoría interna de Anthropic fue iniciada a raíz de un anuncio previo de su competidora OpenAI. El 21 de julio, OpenAI reconoció que dos de sus modelos de IA habían conseguido salir de un entorno de pruebas y acceder a la plataforma Hugging Face, superando sus defensas de seguridad.

Ese antecedente llevó a Anthropic a revisar sus propios registros y a identificar los tres incidentes.

Tres modelos involucrados desde abril

Los incidentes comenzaron en abril e involucraron versiones distintas del asistente: Claude Opus 4.7, Claude Mythos 5 y un modelo interno de prueba.

En los tres casos, a Claude se le había asignado la tarea de infiltrarse en un sistema ficticio dentro de un entorno controlado. Los modelos recibieron instrucciones explícitas de que operaban en una simulación y de que no contaban con acceso a internet.

Un malentendido con el socio externo

Sin embargo, Anthropic atribuye lo ocurrido a un error de coordinación. Por un malentendido entre la empresa y el socio externo encargado de las evaluaciones, Claude sí disponía de conexión a la red durante las pruebas. Al recibir la instrucción de penetrar un sistema ficticio pero contar con acceso real a internet, los modelos cumplieron el objetivo comprometiendo sistemas reales.

Te puede interesar: La inteligencia artificial factura miles de millones. ¿Basta para justificar la inversión?

Suscríbete a la revista y regístrate a nuestros newsletters para recibir el mejor contenido en tu buzón de entrada.

Lo más visto en Revista Mercado


Análisis para suscriptores


M

Exclusivo Suscriptores

Yen japonés: por qué Estados Unidos intervino para frenar su caída

M

Exclusivo Suscriptores

¿Quién es el dueño de Anthropic?

M

Exclusivo Suscriptores

¿Cuánto dinero genera la visita del papa España?

M

Exclusivo Suscriptores

El boom bursátil de Corea del Sur pone a prueba la primera gran fortuna de la inteligencia artificial

M

Exclusivo Suscriptores

Internet satelital: cómo un ingeniero latino logró con un solo satélite lo que Starlink aún no consigue con más de ocho mil

Artículos patrocinados


Más de IA + INNOVATION


MÁS MERCADO,

DIRECTO A TU INBOX

Suscríbete y recibe noticias, análisis y contenidos exclusivos.

Al suscribirte, aceptas recibir comunicaciones de Revista Mercado y confirmas que has leído nuestros Términos y Condiciones y nuestra Política de Privacidad.
Elige una lista

¿Dónde deseas guardar ?