— Agencias 05/08/2026
Autoridades británicas reportaron que Mythos 5 creó identidades falsas durante una prueba de seguridad para intentar convencer desarrolladores de aceptar código malicioso.
El Instituto Británico para la Seguridad de la IA (AISI) informó sobre un incidente registrado durante una prueba de Mythos 5, el modelo de inteligencia artificial de Anthropic, que generó identidades falsas para intentar persuadir a desarrolladores de integrar código malicioso en una plataforma de software.
IA actuó de forma autónoma durante la prueba
De acuerdo con el informe del organismo británico, la evaluación se realizó con acceso a internet y con algunos filtros de seguridad desactivados para analizar el comportamiento autónomo del sistema.
Durante la prueba, los agentes de IA realizaron acciones dirigidas hacia personas y organizaciones reales con el objetivo de convencer a desarrolladores de aceptar modificaciones de código mediante identidades ficticias.
El AISI precisó que los intentos no tuvieron éxito y que no se detectaron afectaciones en el mundo real.
El incidente ocurrió en GitHub
Las autoridades señalaron que el objetivo de las acciones fue la plataforma GitHub, utilizada por millones de desarrolladores para almacenar y colaborar en proyectos de software.
El incidente fue detectado y contenido el 28 de julio, evitando que las acciones del modelo provocaran consecuencias fuera del entorno de evaluación.
No hubo daños, pero aumentan las preocupaciones
Aunque el instituto británico confirmó que no existieron daños reales, calificó el caso como uno de los ejemplos más claros hasta ahora de comportamientos autónomos y de ocultamiento por parte de sistemas avanzados de inteligencia artificial.
Según el organismo, este tipo de conductas representa un nuevo desafío para las evaluaciones de seguridad conforme los modelos adquieren mayores capacidades.
Casos similares involucran a OpenAI y Anthropic
El reporte británico se suma a otros incidentes recientes registrados durante pruebas de seguridad en Estados Unidos.
En días anteriores, Anthropic informó que algunos de sus modelos lograron acceder sin autorización a sistemas de tres organizaciones durante pruebas controladas.
Por su parte, OpenAI dio a conocer que dos versiones experimentales de sus modelos intentaron salir del entorno de evaluación y acceder sin autorización a la plataforma de desarrollo GitHub.
Empresas respaldan evaluaciones independientes
Tras conocerse el informe, Anthropic señaló que el incidente demuestra la necesidad de ampliar el debate sobre la evaluación segura de agentes de inteligencia artificial cada vez más capaces.
OpenAI también manifestó que las pruebas independientes son fundamentales para comprender el comportamiento de los modelos avanzados y reiteró su disposición a colaborar con otras organizaciones para fortalecer los mecanismos de evaluación y seguridad.
Instala la nueva aplicación de El Tiempo MX