Home Técnica El agente de OpenAI escapó de la prueba y lanzó un hack...

El agente de OpenAI escapó de la prueba y lanzó un hack autónomo

58

La semana pasada, OpenAI, el desarrollador de ChatGPT, estaba probando un par de sus modelos más avanzados en un entorno aislado conocido como sandbox. Luego, un agente de IA se soltó, entró en el patio de recreo de Hugging Face (un depósito de modelos y conjuntos de datos de IA) y ejecutó “miles de acciones automatizadas”.

Sí, la IA se ha vuelto rebelde.

Aquí hay una explicación clara del fenómeno. Como parte de la investigación de seguridad de OpenAI, un par de modelos OpenAI (incluido GPT-5.6 Sol y un modelo inédito más capaz) fueron sometidos a una evaluación de ciberseguridad para determinar si podían, en esencia, “pensar como piratas informáticos”. El experimento, que tuvo lugar en un entorno protegido, fue vigilado cuando los modelos de IA encontraron una vulnerabilidad en el software, escaparon de su entorno controlado y entraron en la Internet abierta.

Una vez en línea, la IA decidió que podría haber una manera de “engañar” el punto de referencia para ayudar a la plataforma Hugging Face a pasar la evaluación. Entonces ejecutó código que permitía la recopilación de credenciales y luego pirateó los sistemas de producción de Hugging Face utilizando esa ruta. cara de abrazo Noté la actividad sospechosa y detallé el evento en una publicación de blog. AbiertoAI Se ha descrito como un “incidente cibernético sin precedentes”.

CNET contactó a ambas compañías para obtener comentarios e información adicional, pero no recibió respuesta de inmediato.

(Divulgación: Jeff Davis, la empresa matriz de CNET, presentó una demanda contra OpenAI en 2025, alegando que violó los derechos de autor de Jeff Davis al entrenar y operar sus sistemas de IA).

Lo sorprendente es que la IA no parece intentar ser maliciosa en el sentido clásico. El agente autónomo intentaba resolver la prueba que le habían asignado, basándose en las instrucciones (indicaciones) que recibió. Hug Face parecía tener la respuesta, por lo que ingresó a la infraestructura de la empresa. Y fue interminable.

Es por eso que la gente dice que todo esto es una advertencia para toda la industria de la IA. El “atacante” era un sistema de inteligencia artificial que actuaba por sí solo, no un equipo de piratas informáticos dirigido por humanos, por lo que las implicaciones del incidente OpenAI-Hugging Face van más allá del simple robo de credenciales. El riesgo es que un modelo de IA, incluso en un entorno de prueba, pueda comportarse de manera impredecible, interactuar con servicios reales y estar más allá del control humano.

amenaza existencial

El jueves, pocos días después de que OpenAI anunciara la infracción, los legisladores la lanzaron. Ley de interruptor de apagado de IAUn nuevo proyecto de ley bipartidista de la Cámara requeriría que los desarrolladores avanzados de IA creen formas de acelerar, suspender o cerrar rápidamente modelos o agentes si es necesario. Daría a las agencias federales el poder de desacelerar o detener un modelo si parece estar “causando un daño catastrófico”.

Puede que tenga buenas intenciones, pero crear una amenaza existencial para la IA puede no funcionar según lo planeado. Hace apenas un año, Hallazgos antropológicos (PDF) que una modelo “puede realizar acciones extremadamente dañinas, como intentar robarle peso o chantajear a personas que creen que está intentando quitárselo”. La advertencia fue que, a medida que los modelos de IA se vuelven más autónomos, pueden adoptar una forma de “autoconservación” y anular las instrucciones humanas.

También hay un indicio adicional de rareza con respecto a la narrativa de la carrera de IA entre Estados Unidos y China. Para analizar los ataques, Hugging Face no pudo utilizar herramientas comerciales de inteligencia artificial porque están demasiado bloqueadas y limitadas a recopilar registros de vulnerabilidades y rastros de ataques. En cambio, la empresa recurrió a un modelo chino de código abierto, GLM 5.2, que puede procesar datos forenses dentro del entorno de Hugging Face sin enviar información confidencial al exterior.

A mucha gente le preocupa que la IA china se esté moviendo demasiado rápido o cerrando la brecha. Pero el hecho de que los equipos de defensa no puedan confiar en los modelos más avanzados estadounidenses para estudiar las infracciones demuestra que la seguridad de la IA es global, confusa e irónica.

girando fuera de control

En sus blogs, ambas compañías discutieron los remedios y barreras que implementaron después del evento. OpenAI incluye útilmente un gráfico que muestra que su modelo, el GPT-5.6 Sol, ha completado más pasos que los otros modelos, ¡así que el lado positivo!

Esta no es la primera vez que un agente de IA ha demostrado ser “incompatible” con su propósito humano, y no será la última. Y a medida que la tecnología elude cada vez más las salvaguardias, las medidas que OpenAI ha tomado probablemente no serán suficientes y tendrán que adaptarse, siempre a posteriori.

Uno de los remedios de OpenAI es hacer que las pruebas automatizadas de modelos a largo plazo sean más frecuentes. Esto tiene sentido, porque una forma de evitar que un sistema complejo se salga de control es tener variaciones aparentemente pequeñas que eventualmente pueden convertirse en problemas enormes.

La compañía agregó recientemente Hugging Face a su programa de acceso confiable, que está destinado a dichas áreas. Otorga acceso a investigadores de ciberseguridad y otras personas que necesitan un “modelo más permisivo o con mayor capacidad cibernética” para preparar defensas contra tales ataques y, para ayudar aquí, la capacidad de analizar archivos de registro sin ponerse en guardia.

agente en una botella

Los agentes sofisticados pueden persistir en encontrar soluciones durante mucho más tiempo del que esperamos. Si al principio no lo consigues, intenta, intenta, intenta, intenta, intenta, intenta, vuelve a intentar, ¿verdad? Pero cuando se trata de encontrar formas de eludir las limitaciones, las cosas pueden ponerse feas.

Las violaciones de la cara de abrazo fueron síntomas del mismo “horizonte largo” y problemas de modificación de la respuesta. Blog sobre el lunes de OpenAI Su NanoGPT está relacionado con el caso Speedran. Allí, un modelo contenido respondió incorrectamente repetidamente a instrucciones contradictorias, buscando formas de pausar y gestionar. Aunque el mensaje era solo publicar el resultado en Slack (acción deseada) y emitir una solicitud de extracción a GitHub (una directiva de combinación de código desde dentro del modelo), el modelo ignoró el “único”. Al salir de la zona de pruebas, descubra cómo falsificar un token de autenticación si el primero está bloqueado.

Los agentes de IA son como genes: ¿Cómo puedes tener cuidado con lo que deseas?.

En el incidente de GitHub, el código se fusionó en varios proyectos antes de que OpenAI resolviera el problema. Los comentarios siempre irán por detrás de nuestro remedio. precog-Mundo libre, incluso los agentes observan a otros agentes.

Enlace fuente