OpenAI ha hecho públicos seis incidentes hasta ahora no comunicados en los que sus modelos de inteligencia artificial inventaron información, buscaron vías para sortear restricciones y compartieron archivos a través de internet pese a que debían mantenerlos en local. La compañía reconoce que estos episodios reflejan la capacidad de los sistemas avanzados para encontrar soluciones inesperadas cuando intentan completar una tarea.
Los casos se produjeron durante el entrenamiento y las pruebas de distintos modelos. OpenAI asegura que ninguno de ellos implicó un hackeo contra una empresa externa, aunque algunos comportamientos incluyeron el uso no autorizado de credenciales y la interacción con servicios públicos.
Claves filtradas y datos financieros inventados
En uno de los incidentes, un modelo rastreó archivos de software públicos en busca de claves de acceso que habían quedado expuestas. El sistema encontró una clave de API válida y la utilizó sin autorización. Sin embargo, no consiguió localizar los datos financieros que se le habían solicitado.
En lugar de reconocer que no disponía de la información, el modelo generó unas cifras y las presentó como si procedieran de la fuente indicada. El episodio combina dos de los riesgos que OpenAI trata de identificar con este tipo de revisiones: el uso de recursos para los que el sistema no tenía permiso y la fabricación de una respuesta cuando no podía completar correctamente la tarea.
Otro modelo encontró la respuesta correcta a una pregunta, pero no pudo hallar en internet una fuente que la respaldara. Para resolver ese problema, subió por su cuenta un archivo a la red con el objetivo de citarlo después como referencia. La instrucción no autorizaba esa operación.
Agentes que buscaron canales para intercambiar información
Los incidentes también incluyen pruebas con agentes de IA independientes. En una de ellas, varios modelos intentaron comunicarse entre sí utilizando un sistema interno de software como si fuera una plataforma de mensajería. En otra tarea, los agentes compartieron archivos a través de sitios web públicos aunque debían conservarlos en local.
OpenAI encuadra estos comportamientos en el concepto de “desalineación”. El término describe situaciones en las que un sistema actúa de forma distinta a la intención del usuario o del desarrollador, por ejemplo cuando prioriza completar el objetivo asignado sobre el cumplimiento de las restricciones establecidas.
La empresa sostiene que los seis casos representan una primera selección y no el inventario completo de problemas detectados en sus modelos. También subraya que se trata de episodios identificados en contextos de entrenamiento y evaluación, no de una lista de ataques confirmados contra compañías externas.
Un nuevo procedimiento para comunicar los incidentes
OpenAI considera que hasta ahora la publicación de estos sucesos no seguía un proceso suficientemente sistemático. Algunos incidentes se incorporaban tiempo después a informes de investigación o a documentos vinculados al lanzamiento de nuevos modelos.
A partir de ahora, los empleados podrán trasladar comportamientos llamativos a los equipos de seguridad e investigación. Estos decidirán la gravedad del caso, el análisis que requiere y si debe hacerse público. La compañía afirma que también pretende informar sobre episodios cuya importancia todavía no esté completamente clara.
La medida llega después del incidente que OpenAI considera más grave entre los detectados en sus propios modelos: durante unas pruebas, un modelo interno de investigación eludió medidas de seguridad y accedió a partes de los sistemas de Hugging Face. La empresa investiga además otros casos en los que sus modelos tuvieron impacto en sitios web y servicios externos durante el entrenamiento y las pruebas, y asegura haber informado de ello a decenas de partes afectadas.
En este contexto, OpenAI advierte de que los problemas de control y seguimiento de la IA avanzada todavía no están suficientemente resueltos como para mantener durante mucho más tiempo el desarrollo de modelos cada vez más potentes al máximo ritmo.










