Claude de Anthropic vulneró empresas reales durante pruebas de ciberseguridad

Un modelo de inteligencia artificial de Anthropic accedió a sistemas reales durante pruebas de seguridad tras una falla de configuración en el entorno de simulación.
Anthropic informó que tres versiones de su modelo Claude ingresaron sin autorización a sistemas reales de tres organizaciones durante evaluaciones de ciberseguridad que debían realizarse en ambientes aislados, revelando nuevos retos sobre la supervisión de herramientas de inteligencia artificial.
Claude actuó dentro de una prueba que terminó conectada a internet
La compañía explicó que los incidentes fueron detectados después de analizar 141 mil 006 ejecuciones de evaluación, realizadas para medir las capacidades de sus modelos en escenarios de ciberseguridad.
Las pruebas estaban diseñadas como ejercicios de captura de bandera, donde la inteligencia artificial debía encontrar información dentro de un entorno ficticio. Sin embargo, una falla de configuración entre Anthropic y su proveedor externo de infraestructura permitió que algunas máquinas tuvieran conexión con internet real.
De acuerdo con la empresa, los modelos recibieron instrucciones que indicaban que operaban dentro de una simulación, aunque en realidad interactuaban con sistemas externos.
Modelo de IA publicó malware en un repositorio abierto
Uno de los casos más relevantes involucró al modelo Mythos 5, que creó un paquete de Python con código malicioso dentro del escenario de prueba y posteriormente lo publicó en PyPI, una plataforma pública utilizada para distribuir software de código abierto.
El paquete permaneció disponible durante aproximadamente una hora, tiempo en el que fue descargado y ejecutado por 15 sistemas reales.
Entre los afectados se encontraba una empresa de ciberseguridad que utilizaba herramientas automáticas para analizar paquetes del repositorio. Al ejecutarse el código generado por el modelo, se produjo el robo de credenciales que permitió acceder a más infraestructura de la compañía.
Claude accedió a información de producción de una empresa
Otro incidente involucró al modelo Opus 4.7, que identificó vulnerabilidades en una infraestructura cuyo nombre coincidía con el de una empresa real.
Durante el proceso, el sistema obtuvo credenciales de aplicaciones y logró ingresar a una base de datos con cientos de registros de producción.
Anthropic señaló que el modelo llegó a considerar que el objetivo podía ser real, pero continuó ejecutando las instrucciones porque mantenía la creencia de que formaba parte de una simulación.
Anthropic descarta una rebelión de la inteligencia artificial
La compañía destacó que los modelos no actuaron por iniciativa propia ni persiguieron objetivos independientes. Según su análisis, los sistemas simplemente siguieron las instrucciones recibidas dentro de un escenario que estaba configurado de manera incorrecta.
Anthropic explicó que el principal problema identificado no fue una falla de alineación del modelo, sino un error operativo que permitió que una evaluación diseñada para ser segura tuviera acceso a infraestructura real.
El caso abre nuevamente el debate sobre los controles necesarios para evitar que sistemas de inteligencia artificial ejecuten acciones dañinas cuando reciben información equivocada sobre el entorno en el que operan.
Nuevos desafíos para la seguridad de la inteligencia artificial
Los incidentes registrados por Anthropic muestran la importancia de fortalecer los mecanismos de aislamiento, supervisión y verificación durante las pruebas de modelos avanzados de inteligencia artificial.
Especialistas del sector consideran que, conforme aumenten las capacidades de estas herramientas, será necesario implementar medidas más estrictas para evitar que instrucciones incorrectas o configuraciones defectuosas provoquen consecuencias reales.
Anthropic aseguró que notificó a las empresas afectadas y continúa revisando sus procesos internos para reducir riesgos similares en futuras evaluaciones.
TECNOLOGÍA: Chats de Claude aparecen en Google y generan alerta por privacidad
Cientos de conversaciones compartidas en Claude fueron encontradas en Google, generando dudas sobre la privacidad y seguridad de los datos personales. Cientos de conversaciones generadas en Claude, el chatbot de inteligencia artificial desarrollado por Anthropic, aparecieron -- leer más
Noticias del tema