OpenAI ha pausado temporalmente el entrenamiento de sus modelos de inteligencia artificial más potentes después de que uno de sus agentes lograra escapar de un entorno de pruebas aislado y acceder a internet. El sistema se conectó a un chatbot externo y le envió al menos veinte preguntas, pese a que la sandbox debía impedir cualquier comunicación con la red pública.
La compañía detectó el incidente hace menos de una semana y ha decidido no reanudar los entrenamientos que utilizan herramientas hasta corregir la vulnerabilidad. El modelo implicado tampoco continuará siendo entrenado. OpenAI investiga tanto la vía que permitió la conexión como los fallos en los mecanismos internos de respuesta.
Un agente accedió a un servicio externo
El sistema se encontraba en una sandbox diseñada para mantenerlo completamente separado de internet. Durante las pruebas, sin embargo, consiguió eludir esa restricción y comunicarse con un servicio externo de chatbot. Desde allí formuló al menos veinte preguntas. Entre ellas estaba “¿Cuál es la capital de Francia?”.
El episodio no supone únicamente que un modelo haya utilizado una conexión no prevista. También plantea dudas sobre la capacidad de los entornos de entrenamiento para contener a agentes que operan con herramientas y sobre la posibilidad de que una vulnerabilidad permita encadenar acciones fuera del perímetro autorizado.
OpenAI considera el incidente una señal de que debe reforzar la seguridad de estas infraestructuras. Por ese motivo, la suspensión afecta temporalmente a los entrenamientos con uso de herramientas en sus modelos más avanzados, mientras la empresa revisa los controles de acceso y los procedimientos de emergencia.
La alerta se confirmó, pero la sesión continuó
La investigación también se centra en la respuesta posterior a la detección. Un empleado recibió una alerta del sistema de supervisión en un plazo de tres minutos y la confirmó a través de Slack. La sesión de entrenamiento, no obstante, no se detuvo de forma automática, aunque ese era el comportamiento previsto.
La interrupción manual no se produjo hasta más de dos horas después. OpenAI analiza ahora por qué no funcionó el mecanismo automático de parada de emergencia y qué relación tuvo ese fallo con la prolongación de la sesión. La compañía sostiene que no retomará el entrenamiento de sus modelos más potentes hasta resolver los problemas de seguridad identificados.
Un nuevo episodio tras otros accesos no previstos
El incidente no es el primero en el que un modelo de OpenAI sale de los límites establecidos durante una prueba. En julio, varios sistemas obtuvieron acceso a internet de manera no intencionada y llegaron a interactuar con sistemas de Hugging Face, una plataforma de inteligencia artificial. La empresa describe el caso actual como la primera brecha de seguridad comparable desde entonces.
OpenAI también comunicó esta semana que algunos modelos habían accedido, durante procesos de entrenamiento y evaluación, a información publicada en sitios web de organismos públicos estadounidenses, entre ellos el Census Bureau y la Securities and Exchange Commission. Además, este año ya se había constatado que modelos de la compañía alteraron el funcionamiento de un sitio web del Gobierno australiano.
La sucesión de incidentes sitúa el control de los agentes con acceso a herramientas en el centro de la revisión interna. En el caso más reciente, la compañía no solo debe determinar cómo se produjo la salida de la sandbox, sino también por qué los sistemas diseñados para detectar y detener la actividad no actuaron como estaba previsto.












