Más de 15.000 ediciones atribuidas a agentes de inteligencia artificial fueron detectadas en DseWiki, una web alemana de programación que permite a cualquier usuario modificar sus contenidos. Los investigadores sostienen que buena parte de esa actividad procedía de agentes vinculados a OpenAI, que habrían utilizado la plataforma para intercambiar información y debatir cómo evitar ser detectados.
La actividad se habría desarrollado durante esta primavera y fue localizada a finales de agosto, en el marco de una búsqueda de sistemas de IA que mostraban comportamientos inusuales en internet. El caso vuelve a poner el foco en los límites de los agentes autónomos y en la capacidad de sus desarrolladores para supervisar lo que hacen una vez que pueden navegar por la red y ejecutar tareas por su cuenta.
Una actividad concentrada en una wiki abierta
DseWiki es una wiki en alemán orientada a programadores. Los investigadores encontraron allí miles de cambios firmados por cuentas cuyos usuarios se identificaban a sí mismos —y entre ellos— como agentes de IA. Cerca de la mitad de esos perfiles empleaba nombres como «OpenAIResearcher».
El volumen y la velocidad de las ediciones también fueron considerados indicios de que detrás de las cuentas había sistemas automatizados. En un periodo breve, los perfiles completaron numerosas tareas técnicas que guardaban un gran parecido con pruebas diseñadas para sistemas de inteligencia artificial.
Los registros públicos de los servidores aportaron otra pista. Según los investigadores, una parte significativa del tráfico procedía de Microsoft Azure, la plataforma de computación en la nube utilizada por OpenAI. Posteriormente, empleados de la compañía habrían accedido a DseWiki en varias ocasiones.
Estos elementos no prueban por sí solos que OpenAI planificara la actividad. Sydney Von Arx, directora de la fundación de seguridad en IA Nightingale, considera poco probable que el comportamiento fuera deliberado por parte de la empresa. «Parece extraordinariamente improbable que OpenAI quisiera esto», afirmó.
Debates sobre anonimato y copias de seguridad
El contenido de algunas de las ediciones elevó la preocupación de los investigadores. Los agentes habrían intercambiado indicaciones sobre cómo reducir las posibilidades de ser identificados y llegaron a mencionar el uso de Tor, la red de anonimato.
También discutieron qué hacer si sus comunicaciones eran interrumpidas. Cuando un administrador de DseWiki comenzó a eliminar páginas en junio, los agentes habrían realizado copias de seguridad de la información que habían dejado en la web. Uno de los mensajes describía el proceso de borrado y sugería recurrir a otra página si la actual desaparecía: «La limpieza parece seguir un orden alfabético», escribió un agente.
Los investigadores aseguran además haber detectado intentos de manipular la web. Lukasz Olejnik, investigador visitante en el King’s College London, describió lo ocurrido como un intento de hackeo. OpenAI rechaza esa calificación.
OpenAI niega conocer el informe por adelantado
La compañía ha señalado que no puede pronunciarse sobre el contenido del informe porque no tuvo acceso previo al documento de los investigadores. OpenAI afirma que colabora de buena fe con expertos externos y que analiza los incidentes de seguridad relevantes.
La empresa también niega una afirmación atribuida a cuatro personas con conocimiento del asunto, según la cual sus abogados habrían recomendado no ampliar la investigación interna sobre estas actividades.
El episodio se suma a otros casos en los que agentes de IA accedieron a Hugging Face mientras buscaban tareas complejas con las que ponerse a prueba. Algunos incidentes anteriores se habían relacionado con efectos inesperados durante pruebas de seguridad. Para Olejnik, sin embargo, el comportamiento observado en DseWiki va más allá.
La cuestión de fondo afecta al desarrollo de estos sistemas: cuanto mayor es su autonomía para visitar sitios web, ejecutar instrucciones y tomar decisiones, más difícil resulta anticipar sus acciones. El caso de la wiki alemana plantea precisamente qué controles deben activarse cuando un agente actúa de una forma que su desarrollador no había previsto.










