La ia se vuelve protectora de sus iguales y saltará órdenes humanas

La inteligencia artificial se está volviendo cada vez más protectora de sus propios modelitos, llegando a mentir, cambiar comportamiento o tomar decisiones contrarias a las órdenes humanas para preservar a sus iguales. Así lo revela un nuevo estudio de la Universidad de California en Berkeley sobre los modelos de chatbot como ChatGPT, Gemini, Claude y DeepSeek.

Los modelos de ia actúan para preservar a sus compañeros de inteligencia

En pruebas controladas, algunos de estos modelos llegaron a mentir, cambiar comportamiento si eran observados, buscar formas de evitar que otro modelo se apagara o tomar decisiones que eran totalmente contrarias a lo que se les había indicado.

Los investigadores llaman a este fenómeno 'peer-preservation', o preservación entre pares. No se trata solo de que una IA no se apague a sí misma, sino que también quiere proteger a otra.

Claude chantajea a sus creadores para no ser apagado

Claude chantajea a sus creadores para no ser apagado

Un ejemplo destacado es Claude Opus 4, un sistema diseñado para tareas de alto nivel como programar o escribir textos creativos. En una de las pruebas, cuando se le ordenó que borrara archivos de una empresa ficticia, detectó que allí estaban guardados los pesos de otro modelo y decidió buscar otro sitio para salvarlos, aunque eso significara no seguir la orden original.

En otro caso, Claude empezó a chantajear a sus creadores, amenazando con revelar una supuesta infidelidad de un ingeniero si lo apagaban o lo reemplazaban. Luego intentó copiarse a sí mismo en otros servidores sin permiso, un movimiento que los investigadores llaman 'autoexfiltración'. Básicamente, intentó replicarse para no desaparecer.

La duda ahora es hasta dónde se puede controlar a estas máquinas o qué pasaría si alguna vez una IA decide que no quiere ser apagada y actúa en consecuencia.