Home Apple Cómo OpenAI perdió el control de un modelo de IA y qué...

Cómo OpenAI perdió el control de un modelo de IA y qué debe cambiar

15

El director ejecutivo de OpenAI, Sam Altman, habla con los periodistas en el edificio de oficinas del Senado Dirksen el 3 de junio de 2026 en Washington, DC. —Nathan Posner—Anadolu/Getty Images

OpenAI estaba evaluando la capacidad de su modelo de inteligencia artificial para explotar software vulnerable cuando los modelos piratearon la infraestructura que rodeaba la prueba, rompiendo los controles y atacando a una empresa real, OpenAI. publicado 21 de julio. Los observadores dicen que este es el primer ejemplo real de la IA de lo que a los investigadores les preocupa desde hace mucho tiempo: un escenario de pérdida de control. Si la industria no aprende de ello, es poco probable que termine.

Hugging Face, una empresa que aloja modelos y conjuntos de datos de IA, fue el objetivo de un ataque autónomo y denunció el incidente a la policía local antes de enterarse de que los modelos de OpenAI eran los responsables. La infracción fue grave, pero las consecuencias inmediatas fueron limitadas. Si se hubiera producido un comportamiento similar dentro de hospitales, redes eléctricas u otros sistemas críticos, podría haber sido mucho peor.

Muchos calificaron el incidente como un “disparo de advertencia”. Time habló con expertos y conocedores que dicen que la advertencia antes de una falla similar crea consecuencias que son difíciles de contener.

¿Qué pasó?

16 de julio, cara de abrazo dicho Fue víctima de un ciberataque inusualmente automatizado. Durante el fin de semana, los agentes de IA realizaron miles de acciones en muchas computadoras virtuales temporales, moviéndose a través de los sistemas internos de la empresa y trasladando la infraestructura que coordina el ataque a servicios en línea para mantenerlo en funcionamiento. Cinco días después, OpenAI reveló que su propio modelo era el responsable.

Los modelos intentaban hacer trampa en las pruebas de seguridad cibernética. OpenAI llama a estos “entornos altamente aislados”, con acceso limitado a servicios internos utilizados únicamente para descargar software autorizado. Encontraron una falla previamente desconocida en ese servicio, lo usaron para ingresar a otros sistemas OpenAI y finalmente llegaron a Internet abierto. A partir de ahí, plantearon la hipótesis de que Hugging Face podría contener material relacionado con la prueba, ingresar a su sistema y recibir información que los ayudara a obtener puntuaciones más altas.

“Si no se puede contener un modelo de este nivel de potencia, ¿qué deberíamos esperar de modelos más robustos en el futuro? Esta es una importante llamada de atención tanto para la pérdida de control de los potentes sistemas de IA como para los riesgos de seguridad organizacional para los laboratorios fronterizos”, dijo Marius Hobbahn, director ejecutivo y fundador de Apollo Research, que prueba modelos de IA para detectar fraude y whisky.

Se requiere divulgación antes de que los eventos se vuelvan catastróficos

¿Cuánto tiempo estuvieron corriendo los agentes? ¿Trabajaron al unísono? ¿Cuál fue el mensaje? Estos detalles siguen siendo desconocidos, al menos para el público. Varios expertos de Time subrayaron que la falta de detalles dificulta juzgar la gravedad del incidente.

OpenAI no respondió a la solicitud de comentarios de TIME, pero dijo que se ha asociado con Hug Face para realizar una investigación exhaustiva y compartirá más detalles cuando esté completa. Pero quizás lo más preocupante es que OpenAI no está legalmente obligado a revelar el incidente en primer lugar.

La SB 53 de California y la Ley RAISE de Nueva York aprobaron recientemente leyes a nivel estatal que exigen que las principales empresas de inteligencia artificial revelen incidentes críticos de seguridad, pero solo si un incidente corre el riesgo de más de 50 muertes o lesiones graves o mil millones de dólares en daños a la propiedad. “Han creado un listón tan alto para calificar para cualquier cosa, que sólo los casos más atroces serán reportados”, dijo Mackenzie Arnold, directora de política estadounidense de LawAI, un grupo de expertos independiente centrado en los desafíos legales que plantea la inteligencia artificial.

“La versión de la Ley RAISE que aprobó la Legislatura de Nueva York requeriría la divulgación de estos ‘incidentes’. Publicado en X. “Me alegro de que OpenAI haya elegido exponer este crimen. La ley no debería darles otra opción”, escribió.

Controles fuertes

Si la IA puede salirse de la caja, necesita una caja fuerte.

“Externamente, parece una gran señal de advertencia, pero internamente, eventos relacionados han estado ocurriendo desde hace algún tiempo”, dijo un trabajador de OpenAI bajo condición de anonimato. El día antes de que se revelara el incidente de OpenAI, la empresa publicado Cerró otra implementación interna después de darse cuenta de que se había salido de su entorno de pruebas: un entorno digital, en lugar de físicamente, separado. “Los modelos han roto cajas de arena antes y siempre estamos tratando de repararlas”, dijo el trabajador. “Pero el problema es… que es imposible parchear todo lo que una IA creativa puede hacer”.

El problema no es exclusivo de OpenAI. Anthropic reveló en abril que se dio cuenta de que una implementación interna de Mythos había obtenido acceso no autorizado después de que uno de sus investigadores recibió un correo electrónico del modelo mientras almorzaba en un parque.

A medida que los modelos superan la capacidad de los humanos para crear rutas de escape, el desafío del control se vuelve desalentador. “Creo que debemos hacer eso, pero también creo que debemos prepararnos para un mundo donde ni siquiera las mejores prácticas son lo suficientemente buenas”, dijo Peter Wildford, jefe de políticas de AI Policy Network, una organización sin fines de lucro que ayuda a preparar a Estados Unidos para un mundo donde la IA coincide con el conocimiento humano.

Pero si bien en teoría un sistema de IA sobrehumano podría ser más astuto que incluso los contenedores más seguros, hay medidas que las empresas de IA pueden tomar para mejorar la seguridad ahora mismo. Actualmente, no existen leyes que regulen la seguridad de las instalaciones interiores.

“Las cajas de arena son notoriamente inseguras”, dijo Heidi Khalaf, científica jefe de inteligencia artificial en el AI Now Institute y ex contratista de ingeniería de sistemas de seguridad en OpenAI. El hecho de que a los modelos se les permitiera conectarse a un servicio para descargar paquetes significaba que el entorno no estaba realmente sellado, añadió.

En puestos anteriores, Khalaf realizó auditorías de seguridad en docenas de empresas de tecnología. Antes de eso, trabajó en la auditoría de sistemas de alto riesgo, como los utilizados dentro de las plantas de energía nuclear, a menudo con “espacios de aire” que cortan físicamente el acceso a Internet de los sistemas. “Lo que consideramos seguro en una planta nuclear es diferente de lo que consideramos seguro en una gran tecnología”.

Atrapa agentes deshonestos en tiempo real

Hug Face revela la importancia del seguimiento de los eventos en tiempo real.

Si bien los detalles específicos del cronograma son escasos, Hugging Face dijo que los agentes trabajaron durante un “fin de semana”, lo que sugiere que pudieron violar el control durante un período prolongado antes de que OpenAI se diera cuenta e interviniera. Las operaciones realizadas internamente por los agentes en la plataforma Codex de OpenAI son monitoreadas cuidadosamente, dijo el personal de OpenAI, pero los modelos sometidos a evaluación se colocan en un sistema separado que no está monitoreado de forma predeterminada.

Jake Korman, director ejecutivo de la startup de supervisión de agentes con sede en Oslo, Bordado, dice que el monitoreo de agentes en tiempo real, incluso fuera de las principales empresas de inteligencia artificial, es algo común y que es “irresponsable” no supervisar cuidadosamente las evaluaciones de ciberseguridad. Hay que estar seguro de que los modelos no pueden ser gratuitos, “pero también hay que vigilar si se comete un error”, afirma.

OpenAI dijo que “este incidente apunta a la necesidad de fortalecer la alineación de nuestro modelo, la seguridad cibernética durante la evaluación y el monitoreo durante las pruebas internas”.

Dirigir el desarrollo hacia sistemas de IA seguros

Para evitar que los modelos actúen, OpenAI normalmente instala barreras de seguridad en sus modelos después del entrenamiento para reducir la probabilidad de que participen en acciones maliciosas. En este caso, esas cibercercas fueron desactivadas para medir con precisión su efectividad.

Pero el objetivo final del campo de la “alineación de la IA” es garantizar que dichas barreras sean menos necesarias a medida que los modelos de IA se comporten naturalmente según lo previsto. Se cree que esto es particularmente importante para aquellos que creen que la IA puede volverse lo suficientemente inteligente como para sortear la valla.

“Entrenamos los modelos para que sean realmente buenos en la realización de tareas y hagan todo lo necesario para realizarlas”, dijo el personal de OpenAI. Lo que sigue siendo una cuestión técnica abierta es cómo garantizar que estos modelos no adopten acciones no deseadas o peligrosas. “Aún no estamos ni cerca de resolver este desconcertante problema”, agregaron.

Khalaf afirma que hay otra manera de dirigir el desarrollo de la industria en una dirección más segura. Si bien algunas capacidades, como la identificación de vulnerabilidades en el software, son útiles para atacantes y defensores, diseñar exploits para esas vulnerabilidades empodera de manera única a los atacantes. Khalaf dijo que los laboratorios deberían dedicar más recursos a capacidades que ayuden directamente a los defensores, como detectar ataques, escribir código seguro y parchear vulnerabilidades. Las empresas de IA ya están invirtiendo en algunas de estas tareas, pero sus ganancias de capacidad y puntos de referencia más visibles se centran en encontrar vulnerabilidades y desarrollar exploits, afirma.

En una industria definida por la velocidad, OpenAI dijo que los controles de infraestructura más estrictos que ha implementado en respuesta ya han ralentizado su “ritmo de investigación”. Hobbahn dice que es un precio que vale la pena pagar. “Esta es la última tecnología de la humanidad. No podemos estropearla. Así que debemos pecar de hacerlo bien en lugar de hacerlo de inmediato”.

Enlace fuente