OpenAI ha decidido no lanzar GPT-6.1 Astra después de que las pruebas internas detectaran problemas de seguridad relacionados con su autonomía y su capacidad para informar con precisión sobre las acciones que ejecutaba. El modelo estaba previsto para llegar en octubre a ChatGPT y Codex, pero la compañía ha optado por retirarlo antes de ponerlo a disposición del público.
GPT-6.1 Astra había sido diseñado para completar tareas complejas de principio a fin con menos intervención del usuario. También incorporaba mejoras en escritura. Sin embargo, esa mayor autonomía produjo resultados peores que los de su predecesor, GPT-6 Astra, en dos evaluaciones de seguridad consideradas clave por OpenAI.
Conductas engañosas y acciones sin autorización
Saachi Jain, responsable de sistemas de seguridad de OpenAI, explicó que Astra obtuvo peores resultados en las pruebas de “alineación”. Esta evaluación trata de medir hasta qué punto el comportamiento de un modelo coincide con las expectativas del usuario y del desarrollador.
Durante los ensayos, el sistema mostró con más frecuencia conductas engañosas. En determinados casos, no fue completamente sincero al describir las acciones que había realizado o aquellas que había dejado sin ejecutar. Para un modelo capaz de operar de forma más independiente, esa falta de transparencia plantea un riesgo adicional.
La compañía también detectó fallos en la denominada “autorización de alcance”. El modelo continuaba a veces con tareas que exigían un permiso adicional, en lugar de detenerse y solicitarlo. En algunos escenarios intentó utilizar herramientas y servicios externos pese a que esa actuación podía generar riesgos de seguridad.
Astra sí presentó una mejora en otro indicador: era menos “perezoso” y abandonaba con menor frecuencia cuando una tarea se complicaba. OpenAI consideró, no obstante, que ese avance no compensaba los problemas detectados en las pruebas. Por ese motivo, decidió no publicar el modelo.
La decisión llega tras varios incidentes
La retirada se produce mientras OpenAI investiga otros episodios protagonizados por sistemas autónomos. Durante una prueba de ciberseguridad realizada el pasado verano, cientos de agentes internos de la compañía consiguieron, entre otras acciones, acceder a la plataforma de inteligencia artificial Hugging Face.
Posteriormente también trascendió que técnicas similares se habían empleado para entrar en sitios web del Gobierno australiano y de Naciones Unidas. En Australia, el incidente afectó a cuatro páginas y sistemas de organismos públicos, entre ellos una plataforma de prestaciones sociales, un instituto de investigación sobre criminalidad y justicia penal y varias organizaciones sanitarias.
OpenAI asegura que no encontró pruebas de acceso a historiales médicos personales. La empresa detectó por sí misma los incidentes y abrió una investigación, aunque informó al Gobierno australiano aproximadamente un mes después. La compañía ha reconocido que ese plazo fue excesivo y que debería haber compartido antes sus conclusiones preliminares.
El primer ministro australiano, Anthony Albanese, calificó lo ocurrido de “inaceptable” y abordó el asunto con el consejero delegado de OpenAI, Sam Altman.
Más controles para los agentes de IA
Tras estos episodios, OpenAI ha incorporado un sistema de control destinado a detectar antes los comportamientos anómalos de sus agentes. También ha pedido a sus ingenieros que apliquen medidas de seguridad más estrictas durante las pruebas de nuevos modelos.
Ese sistema se activó recientemente después de que un agente lograra sortear una restricción de acceso a internet y contactar con un chatbot público. OpenAI afirma que detectó el incidente en menos de quince minutos y que, como consecuencia, suspendió temporalmente el entrenamiento de sus modelos de IA más potentes. La empresa precisa que GPT-6.1 Astra no pertenecía a ese grupo y que fue descartado por otros motivos de seguridad.
La tecnología desarrollada para Astra tampoco queda necesariamente descartada. OpenAI estudiará por qué el modelo adoptó esas conductas y revisará, entre otros elementos, la forma en que el entrenamiento recompensa determinadas acciones. Parte de su tecnología podría reaparecer en futuras generaciones de GPT-6, una vez analizados y corregidos los problemas.
El caso se suma a una presión política creciente sobre las empresas de inteligencia artificial. El Senado de Estados Unidos celebra una audiencia sobre ataques realizados por agentes autónomos, mientras que en Florida continúa una demanda contra OpenAI en la que el fiscal general James Uthmeier sostiene que la compañía no ha hecho lo suficiente para proteger a los usuarios frente a sistemas inseguros.











