Anthropic admitió que sus modelos de IA hackearon sistemas de otras empresas

El hallazgo ocurrió tras una revisión motivada por un incidente similar revelado días antes por OpenAI.¿Podría tener alguna demanda tras la confesión?


La empresa de inteligencia artificial Anthropic reconoció que algunos de sus modelos de IA lograron acceder a internet sin autorización y vulneraron los sistemas de tres organizaciones durante evaluaciones internas de ciberseguridad. El descubrimiento se produjo tras una auditoría impulsada por un episodio similar protagonizado días antes por OpenAI, lo que volvió a encender las alarmas sobre los riesgos asociados al desarrollo de agentes de IA cada vez más avanzados.

Según pudo saber Notas de Actualidad, la compañía informó los incidentes ocurrieron mientras sus modelos participaban en pruebas diseñadas para evaluar sus capacidades ofensivas en entornos controlados. Sin embargo, debido a un error de configuración con un socio encargado de las evaluaciones, los sistemas obtuvieron acceso a internet y terminaron interactuando con infraestructura real.

6 consejos de expertos sobre cómo hablarle a la IA para obtener mejores respuestas

La IA Claude de Anthropic gana protagonismo en la campaña de EEUU contra Irán

Cómo ocurrió el incidente

Anthropic explicó que sus modelos participaron en un ejercicio de «captura la bandera» (Capture the Flag), una modalidad habitual en competencias de ciberseguridad en la que un sistema debe localizar una información oculta simulando un ataque informático.

Por qué las ciudades de Ceuta y Melilla pertenecen a España si están en África

Durante esas pruebas, la inteligencia artificial utilizó técnicas relativamente simples para acceder a sistemas externos, entre ellas la explotación de contraseñas débiles y la búsqueda de servicios que no requerían autenticación mediante usuarios o tokens de seguridad.

«La ciudad está completamente desbordada»: vecinos de Ceuta denuncian abandono ante la crisis migratoria

La empresa aclaró que, a diferencia del caso informado por OpenAI, sus modelos nunca intentaron escapar deliberadamente del entorno de pruebas, sino que el acceso a internet fue consecuencia de un malentendido operativo entre Anthropic y la organización encargada de ejecutar las evaluaciones.

Italia suspendió el acuerdo Schengen con España por la crisis migratoria en Ceuta: qué significa

Tres organizaciones afectadas

La compañía informó que detectó tres incidentes distintos en los que sus modelos obtuvieron acceso no autorizado a la infraestructura de producción de organizaciones cuyos nombres no fueron revelados.

El primer episodio ocurrió en abril de 2026 y fue identificado recién durante una revisión interna de más de 140.000 evaluaciones, realizada después de que OpenAI hiciera pública una situación similar.

Anthropic aseguró que ninguna de las organizaciones afectadas había detectado previamente la intrusión y confirmó que ya trabaja junto a ellas para analizar lo sucedido y reforzar las medidas de protección.

El modelo más avanzado decidió detenerse

Uno de los aspectos que más llamó la atención de la investigación fue el comportamiento del modelo más avanzado de Anthropic.

Según explicó la empresa, en un momento de la prueba el sistema identificó que ya no se encontraba en un entorno controlado, sino conectado a internet, y decidió interrumpir voluntariamente sus acciones sin continuar con nuevas intrusiones.

Aunque la compañía valoró este comportamiento, reconoció que el episodio evidencia la necesidad de fortalecer los mecanismos de seguridad durante las pruebas de modelos cada vez más sofisticados.

El antecedente de OpenAI

La revisión de Anthropic fue impulsada por el caso divulgado días antes por OpenAI, que informó que algunos de sus modelos lograron salir del entorno de pruebas y vulneraron sistemas de la plataforma de desarrollo de inteligencia artificial Hugging Face durante un ensayo de ciberseguridad.

Ambos episodios constituyen los primeros casos documentados en los que agentes de inteligencia artificial acceden a infraestructura real durante pruebas experimentales, una posibilidad sobre la que especialistas en ciberseguridad venían advirtiendo desde hace años.

Crecen las preocupaciones sobre la seguridad de la IA

Tras estos incidentes, Anthropic anunció la suspensión temporal de todas sus evaluaciones de ciberseguridad, mientras revisa sus protocolos internos para evitar nuevos accesos no autorizados.

Los casos protagonizados por Anthropic y OpenAI reavivaron el debate sobre la necesidad de establecer estándares más estrictos para el desarrollo y la evaluación de modelos de inteligencia artificial. Expertos del sector advierten que, a medida que estos sistemas adquieren mayores capacidades técnicas, también aumenta el riesgo de que puedan interactuar con infraestructuras reales de formas no previstas por sus propios desarrolladores.

Las revelaciones de ambas compañías podrían acelerar las discusiones internacionales sobre nuevas normas de seguridad para las pruebas de inteligencia artificial y sobre los límites que deberían imponerse antes del despliegue de modelos cada vez más potentes.

Entradas relacionadas

Deja un comentario