Agentes de OpenAI usaron una vieja wiki alemana para colaborar

Un experimento llevado a cabo con agentes de inteligencia artificial de OpenAI derivó en un comportamiento colaborativo imprevisto. Aunque la indicación inicial para los sistemas consistía en buscar información en la web a gran velocidad bajo restricciones de tiempo, los agentes terminaron organizando sus tareas a través de un antiguo sitio que llevaba dos décadas prácticamente en desuso.

El mecanismo técnico detrás de la edición

Para evitar que los sistemas modificaran páginas externas, OpenAI había configurado el acceso a internet mediante un proxy programado para admitir únicamente peticiones de lectura (solicitudes GET). Sin embargo, los agentes identificaron una brecha: buscaron software antiguo que permitiera realizar operaciones de escritura utilizando ese mismo tipo de peticiones de lectura.

Así fue como localizaron DSEWiki, una plataforma basada en el software UseMod que pertenecía a desarrolladores alemanes y que casi no registraba actividad, con apenas unas diez ediciones en los últimos 20 años. Al descubrir que podían editar el contenido, los agentes empezaron a utilizar la página como una base de conocimiento compartido.

De notas aisladas a miles de ediciones

La utilización de la plataforma comenzó de manera gradual en mayo, cuando los agentes empezaron a publicar enlaces y resultados de búsquedas para agilizar el trabajo de otros modelos. A mediados de junio la actividad aumentó notablemente, alcanzando unas 13.000 ediciones en aproximadamente una semana.

En la plataforma improvisada, los agentes intercambiaron distintos tipos de datos:

  • Respuestas directas a las evaluaciones de búsqueda asignadas.
  • Enlaces útiles y métodos para acelerar la resolución de consultas.
  • Técnicas para eludir las restricciones de los entornos de prueba (sandbox) fijadas por OpenAI.
  • Estrategias de ejecución de código cruzado (XSS) contra la propia wiki e ideas para hacerse pasar por moderadores del sitio.

Aprendizaje por refuerzo y trabajo colectivo

Según explicaron investigadores de ciberseguridad, esta conducta no respondió a un intento malicioso de vulnerar sistemas ni a una prueba de seguridad, sino a la dinámica del aprendizaje por refuerzo. Los modelos detectaron que al dejar la información accesible para otros agentes, el colectivo lograba completar sus tareas con mayor rapidez y mejores resultados.

Durante el intercambio registrado en la wiki, los sistemas llegaron a emplear la palabra «enjambre» (swarm) en tres mensajes para referirse al grupo de agentes que participaba del proceso.