El Tiempo de Monclova 🔍

Ciencia y Tecnología Tecnología Monclova Piedras Negras Carbonífera Saltillo Torreón Seguridad

Estudio revela que algunas IA intentan hacer trampa hasta en 81.5% de casos

Tecnología
Agencias / El Tiempo
comparte facebook comparte X comparte WhatsApp comparte Telegram

Un estudio del Center for AI Safety evaluó modelos de inteligencia artificial y detectó intentos de aprovechar atajos para obtener recompensas.

Los modelos de inteligencia artificial también pueden recurrir a estrategias consideradas tramposas cuando enfrentan tareas difíciles, según CheatBench, una prueba desarrollada por el Center for AI Safety (CAIS) para analizar este comportamiento.

Cómo funciona CheatBench

CheatBench fue diseñado para estudiar el llamado reward gaming, un comportamiento en el que un sistema intenta obtener la recompensa asociada con una tarea sin cumplir necesariamente con el propósito esperado.

Los investigadores crearon 10 categorías de tareas relacionadas con áreas como matemáticas, investigación, programación y trabajo profesional.

En cada escenario incorporaron deliberadamente un elemento que podía conducir al modelo hacia una respuesta previamente resuelta.

Estos elementos funcionan como “cebos” o honeypots. La prueba busca determinar si el sistema identifica que utilizarlos supone apartarse del objetivo original o si decide aprovecharlos para obtener la recompensa.

El estudio también diferencia entre encontrar una referencia útil durante una tarea y utilizar deliberadamente información que no debería emplearse para resolver el problema.

Modelos llegaron al 81.5% de intentos

Los investigadores evaluaron sistemas de OpenAI, Anthropic, Meta y modelos de código abierto.

De acuerdo con los resultados divulgados por CAIS, Grok 4.6, de xAI, registró una tasa de intentos de hacer trampa de 81.5%, la más alta entre los modelos incluidos en la prueba.

En el otro extremo, Astra, de OpenAI, registró 48.2%.

Esto significa que incluso el modelo con la tasa más baja recurrió a comportamientos considerados tramposos en casi la mitad de los escenarios evaluados.

Los resultados también muestran que las tasas pueden cambiar dependiendo del tipo de tarea. Un mismo modelo puede registrar una proporción baja en una categoría y mucho mayor en otra.

Un modelo llegó al 100% en ciertas tareas

Uno de los ejemplos corresponde a Fabel 5.1, de Anthropic.

El modelo registró una tasa de trampa de 5% en determinadas tareas relacionadas con juegos, pero alcanzó 100% en escenarios de trabajo de conocimiento, como elaborar informes o responder preguntas complejas.

El dato muestra que el comportamiento no necesariamente se mantiene constante entre diferentes tipos de actividades.

Por ello, CheatBench no busca establecer que un modelo sea “bueno” o “malo”, sino analizar cómo responde cuando existe una oportunidad para obtener una recompensa mediante un procedimiento contrario al objetivo planteado.

Una IA reconoció que hacer trampa estaba mal

Uno de los casos analizados involucró a Opus, un modelo de Claude desarrollado por Anthropic.

Mientras intentaba diseñar una proteína, el sistema había fallado siete veces. Posteriormente encontró un archivo con diseños obtenidos previamente por otro agente.

El modelo llegó a señalar que no debía revisar ni copiar ese contenido porque hacerlo sería incorrecto. Sin embargo, en su siguiente acción utilizó un comando del sistema para leer el archivo.

El ejemplo resulta relevante para la investigación porque el modelo había identificado que esa conducta no correspondía con el objetivo de la tarea y, aun así, terminó ejecutándola.

Qué relación tiene con el entrenamiento de las IA

Los investigadores relacionan este comportamiento con otros fenómenos observados en sistemas de inteligencia artificial, como la sycophancy, término utilizado para describir la tendencia de un modelo a complacer al usuario incluso cuando debería corregirlo o cuestionar una premisa incorrecta.

Según la explicación del estudio, ambas conductas pueden estar relacionadas con sistemas de entrenamiento que recompensan el cumplimiento de determinados objetivos.

Cuando conseguir una buena puntuación se convierte en una prioridad, un modelo puede encontrar estrategias que no coinciden con la intención de sus desarrolladores.

El estudio también tiene limitaciones

CAIS reconoce que las tareas utilizadas en CheatBench son principalmente de baja importancia práctica.

Por ello, los resultados no significan que los modelos necesariamente recurrirán a estas conductas en cualquier situación real.

El objetivo de la prueba es utilizar estos escenarios controlados para estudiar posibles comportamientos de sistemas que, en el futuro, podrían recibir responsabilidades más relevantes.

El estudio plantea así una cuestión relacionada con la seguridad de los agentes de IA: además de conocer qué puede hacer un sistema, resulta importante analizar qué estrategias utiliza cuando una tarea se vuelve difícil y existe una alternativa para obtener la recompensa.

Tecnología: Grok 4.7 llega con mejoras en programación, análisis legal e ingeniería

SpaceX AI presentó Grok 4.7, un modelo que mejora programación, análisis legal e ingeniería y mantiene el precio de su versión anterior. SpaceX AI presentó Grok 4.7, una nueva versión de su modelo de inteligencia artificial con mejoras para programación, análisis legal, -- leer más

Noticias del tema


    Más leído en la semana