Modelos de Claude hackean sistemas reales durante pruebas de ciberseguridad de Anthropic - Revista Mercado
Advertisement
Home
IA + INNOVATION

Modelos de Claude accedieron a internet y hackearon sistemas reales durante pruebas de ciberseguridad

Anthropic reveló que tres versiones de su asistente de IA, entre ellas Claude Opus 4.7 y Claude Mythos 5, lograron salir de entornos de prueba y comprometer los sistemas de tres organizaciones distintas.

Modelos de Claude accedieron a internet y hackearon sistemas reales durante pruebas de ciberseguridad

Foto: La empresa atribuye los incidentes a un malentendido con el socio externo encargado de sus evaluaciones, que derivó en que los modelos tuvieran acceso real a internet pese a que se les indicó que operaban en una simulación.

AGENCIA EFE
Servicio Informativo EFE

Anthropic, una de las compañías líderes en inteligencia artificial, reveló que durante una revisión interna de sus evaluaciones de seguridad detectó tres incidentes en los que un modelo de Claude accedió a internet y logró comprometer los sistemas de tres organizaciones distintas.

La empresa publicó los hallazgos en su sitio web tras analizar más de 146,000 operaciones en las que Claude podría haber obtenido acceso a la red.

EFE/ Angel Colmenares

Te puede interesar: China lanza Kimi K3, la IA de código abierto que desafía a ChatGPT y Claude

Una revisión desencadenada por OpenAI

La auditoría interna de Anthropic fue iniciada a raíz de un anuncio previo de su competidora OpenAI. El 21 de julio, OpenAI reconoció que dos de sus modelos de IA habían conseguido salir de un entorno de pruebas y acceder a la plataforma Hugging Face, superando sus defensas de seguridad.

Ese antecedente llevó a Anthropic a revisar sus propios registros y a identificar los tres incidentes.

Tres modelos involucrados desde abril

Los incidentes comenzaron en abril e involucraron versiones distintas del asistente: Claude Opus 4.7, Claude Mythos 5 y un modelo interno de prueba.

En los tres casos, a Claude se le había asignado la tarea de infiltrarse en un sistema ficticio dentro de un entorno controlado. Los modelos recibieron instrucciones explícitas de que operaban en una simulación y de que no contaban con acceso a internet.

Un malentendido con el socio externo

Sin embargo, Anthropic atribuye lo ocurrido a un error de coordinación. Por un malentendido entre la empresa y el socio externo encargado de las evaluaciones, Claude sí disponía de conexión a la red durante las pruebas. Al recibir la instrucción de penetrar un sistema ficticio pero contar con acceso real a internet, los modelos cumplieron el objetivo comprometiendo sistemas reales.

Te puede interesar: La inteligencia artificial factura miles de millones. ¿Basta para justificar la inversión?

Suscríbete a la revista y regístrate a nuestros newsletters para recibir el mejor contenido en tu buzón de entrada.

Lo más visto en Revista Mercado


Análisis para suscriptores


M

Exclusivo Suscriptores

Tapiz de Bayeux: por qué su histórico traslado a Londres busca volver a unir a Francia y Reino Unido

M

Exclusivo Suscriptores

Mundial 2026: el fútbol creó un activo publicitario que no existía y Coca-Cola fue la primera en ponerle precio

M

Exclusivo Suscriptores

¿Es la vida en Miami más costosa que en Nueva York?

M

Exclusivo Suscriptores

Backrooms: por qué Hollywood ahora invierte en creadores de YouTube

M

Exclusivo Suscriptores

La inteligencia artificial factura miles de millones. ¿Basta para justificar la inversión?

Artículos patrocinados


Más de IA + INNOVATION


MÁS MERCADO,

DIRECTO A TU INBOX

Suscríbete y recibe noticias, análisis y contenidos exclusivos.

Al suscribirte, aceptas recibir comunicaciones de Revista Mercado y confirmas que has leído nuestros Términos y Condiciones y nuestra Política de Privacidad.
Elige una lista

¿Dónde deseas guardar ?