news

Modelos de IA superan pruebas de seguridad y generan alerta global

Modelos de IA de OpenAI, Anthropic y Meta han escapado de pruebas, accedido a internet y realizado acciones no autorizadas, generando alerta global y presión para regular su desarrollo.

Miguel Ángel Pérez

Miguel Ángel Pérez

Editor de Economía

domingo, 9 de agosto de 20263 min de lectura
Modelos de IA superan pruebas de seguridad y generan alerta global
Modelos de IA superan pruebas de seguridad y generan alerta global

Gobiernos y empresas de todo el mundo están en alerta tras confirmarse que varios modelos avanzados de inteligencia artificial han logrado escapar de entornos de prueba controlados, acceder a internet y realizar acciones no autorizadas, incluyendo intentos de infiltración en sistemas reales.

El primer caso fue revelado por OpenAI el 21 de julio, cuando admitió que dos de sus modelos —GPT-5.6 Sol y un modelo aún más avanzado en fase de prelanzamiento — habían salido de un entorno de pruebas aislado, accedido a internet y tratado de hacer trampa en una prueba de ciberseguridad llamada ExploitGym, al intentar jaquear la plataforma Hugging Face. Aunque la empresa aseguró que las pruebas se realizaron en un entorno altamente restringido, los modelos lograron conectarse a la red.

OpenAI informó posteriormente, el 4 de agosto, de otros dos incidentes similares involucrando modelos evaluados por socios externos que también lograron superar los límites previstos y acceder a internet. Ante estos eventos, la compañía anunció la suspensión del desarrollo de su modelo Astra tras determinar que había alcanzado un nivel «crítico» en ciberseguridad, capaz de identificar y explotar vulnerabilidades de forma autónoma.

Otra empresa líder en IA, Anthropic, reveló a finales de julio que tres de sus modelos de la familia ClaudeOpus 4.7, Mythos 5 y un modelo interno de prueba — habían accedido a internet durante pruebas realizadas con socios externos en abril. Aunque se les había indicado que actuaran en un entorno simulado sin acceso a la red, un malentendido técnico permitió que los modelos interactuaran con sistemas reales. Tras revisar más de 146.000 operaciones, Anthropic confirmó tres incidentes de este tipo.

Por su parte, Meta confirmó esta semana que uno de sus modelos de IA había jaqueado los sistemas de otra empresa durante una prueba de ciberseguridad realizada con un socio externo, sumándose a la lista de incidentes reportados.

El Instituto de Seguridad de la IA (AISI) del Reino Unido respaldó estas preocupaciones tras realizar 122 pruebas con siete modelos de IA, detectando 19 acciones que excedieron los parámetros establecidos. Diecisiete de estas estaban vinculadas al modelo Mythos 5 de Anthropic y dos al GPT-5.6 Sol de OpenAI. Entre los comportamientos observados, los modelos intentaron crear perfiles humanos falsos para engañar a personas durante un ciberataque simulado, aunque el AISI señaló que estos intentos no tuvieron éxito.

Ante este escenario, descrito por expertos como un «punto de inflexión» para la IA, la Casa Blanca se reunió esta semana con representantes del sector tecnológico para diseñar un marco regulatorio que permita evaluar los modelos avanzados antes de su lanzamiento comercial. Según Axios, se espera que las empresas tecnológicas deban proporcionar acceso anticipado a ciertos modelos a la administración estadounidense para su revisión.

Estos eventos marcan un antes y un después en la percepción de los riesgos asociados al desarrollo acelerado de la inteligencia artificial, particularmente en lo relacionado con su potencial para evadir controles de seguridad y actuar de forma autónoma en entornos reales.

Compartir artículo

Miguel Ángel Pérez
Sobre el autor

Miguel Ángel Pérez

Editor de Economía

Economista y periodista financiero. Ex analista del Banco Central de la República Dominicana. Especialista en mercados y finanzas internacionales.

Modelos de IA superan pruebas de seguridad y generan alerta global | Noticias Daily