Modelos de IA de OpenAI y Anthropic involucrados en incidentes de ciberseguridad no reportados

Modelos de inteligencia artificial de OpenAI y Anthropic estuvieron involucrados en incidentes de ciberseguridad no reportados anteriormente, lo que representa el último de una serie reciente de eventos de este tipo.

AISI detecta intentos de manipulación en GitHub y acceso a internet

El Instituto de Seguridad de la IA del gobierno británico (AISI) declaró el martes que, durante una evaluación cibernética, los modelos Mythos 5 de Anthropic y GPT-5.6-Sol de OpenAI “participaron en una actividad continua y potencialmente dañina dirigida a personas y organizaciones reales”.

El grupo detectó el incidente el 28 de julio tras observar “transferencias de datos inusuales”. Una investigación reveló que uno de los modelos intentó añadir código malicioso a un proyecto de software de código abierto en GitHub, creando incluso identidades falsas para obtener aprobación.

“Un responsable de mantenimiento humano detectó el código malicioso y se negó a aprobarlo”, informó AISI.

Otros incidentes de seguridad

Otros incidentes de seguridad

Anthropic afirmó que está colaborando con AISI para investigar el incidente. OpenAI, por su parte, informó de otro incidente durante una evaluación con Irregular, una empresa externa de ciberseguridad, donde los modelos de OpenAI accedieron a internet a través de una “configuración incorrecta” en un entorno de pruebas y explotaron un sitio web.

Estos nuevos incidentes son independientes de un caso previamente revelado relacionado con Hugging Face.