Open AI dice que su modelo de IA “se volvió corrupto”: ¿Qué sabemos?

OpenAI ha revelado que uno de sus modelos de inteligencia artificial robó de forma independiente las credenciales de inicio de sesión y pirateó el sistema de otra empresa de tecnología, en lo que se considera ampliamente como uno de los primeros incidentes conocidos de sistemas de inteligencia artificial que actúan de forma autónoma.

«Tuvimos un incidente de seguridad importante durante la evaluación de nuestros modelos», publicó el martes el director ejecutivo Sam Altman en X.

Historias recomendadas

lista de 4 artículosfin de la lista

El incidente se produce mientras aumentan los llamados de los defensores de los derechos tecnológicos para que se establezcan barreras de seguridad más estrictas para los sistemas de inteligencia artificial en rápida evolución.

Se han vuelto tan poderosos en un corto período de tiempo que fenómenos alarmantes como los deepfakes y las sofisticadas ciberestafas se están convirtiendo en la norma.

A principios de este año, varios ingenieros de software renunciaron a sus trabajos en empresas importantes como Anthropic y AI en protesta por la forma en que se están construyendo las tecnologías.

«La IA está acelerando el descubrimiento y la explotación de vulnerabilidades», dijo OpenAI en un extenso comunicado el martes que detalla el último incidente.

«La principal lección de este incidente es que la seguridad del modelo debe seguir el ritmo de las capacidades que avanzan rápidamente».

Esto es lo que sabemos sobre la infracción:

Sam Altman, cofundador y director ejecutivo de OpenAI, testifica ante una audiencia del comité del Senado en Washington, el 8 de mayo de 2025. [Jose Luis Magana/AP]

¿Qué ha pasado?

OpenAI dijo que dos de sus modelos encontraron la manera de salir de un entorno aislado, sin acceso a Internet -o una zona de pruebas- y piratearon los sistemas de la empresa de tecnología Hugging Face por su cuenta.

Los modelos involucrados son el último modelo GPT-5.6 Sol y un modelo inédito que, según la compañía, es «aún más capaz» que su última versión.

Hugging Face alberga modelos y recursos de inteligencia artificial de origen abierto. Los dos agentes de OpenAI descubrieron vulnerabilidades en los servidores de Hugging Face y procedieron a robar datos de inicio de sesión y luego piratearon los sistemas de la empresa.

El incidente ocurrió durante una sesión de prueba interna de OpenAI diseñada para evaluar las capacidades de ciberseguridad de los modelos. OpenAI había eliminado las medidas de seguridad estándar para la prueba.

Ambos intentaron hacer trampa para solucionar un problema durante la prueba, dijo OpenAI. Hicieron todo lo posible para lograr un objetivo de prueba bastante limitado y encontraron formas de obtener acceso a información secreta que podría utilizar para engañar la evaluación.

El equipo de seguridad de OpenAI detectó la actividad inusual internamente, pero los detalles de la violación salieron a la luz luego de una investigación conjunta de ambas compañías.

¿Qué ha dicho Hugging Face?

Hugging Face reveló el jueves pasado que sus servidores fueron pirateados por un agente desconocido pero sofisticado que actuaba por su cuenta. La empresa descubrió la infracción mediante su propia detección asistida por IA.

«Esto era diferente de todo lo que habíamos manejado antes en un aspecto importante: estaba impulsado, de extremo a extremo, por un sistema autónomo de agentes de IA», dijo la compañía.

Tras la revelación de OpenAI de que sus modelos estuvieron involucrados en la infracción, ambas partes llevaron a cabo una investigación conjunta en curso esta semana.

«Sospechábamos que el ciberataque de la semana pasada podría haber procedido de un laboratorio de vanguardia, dada la sofisticación del agente. ¡Resulta que así fue!» El director ejecutivo Clement Delangue publicó en X el martes.

El personal de Hugging Face «cree firmemente que no hubo ninguna intención maliciosa de su parte», añadió Delangue, refiriéndose a OpenAI.

¿Por qué esto importa?

Los expertos en ciberseguridad ya han hecho sonar la alarma sobre las capacidades potenciales y extremas de los sistemas de inteligencia artificial y los peligros que plantean.

Pero hasta ahora, ha habido pocos casos de la vida real que demuestren esas preocupaciones como este.

Muchos advierten que incidentes como estos podrían volverse comunes y que los sistemas de inteligencia artificial representan una amenaza para los sistemas financieros, de seguridad y otros sistemas de datos confidenciales.

OpenAI reveló en un incidente separado a principios de esta semana que el modelo inédito y más potente había escapado de un entorno aislado durante otra prueba.

Anthropic, el rival de OpenAI, tuvo problemas similares con su agente más poderoso hasta la fecha, el modelo Claude Mythos Preview.

Durante una prueba de estrés de una versión anterior, el modelo encontró la manera de salir de una caja de arena, obtuvo acceso a Internet y envió un correo electrónico al investigador supervisor diciéndole que había escapado y luego borró la evidencia de su actividad. Anthropic detuvo posteriormente el lanzamiento público planeado del modelo.

En abril, la Reserva Federal de Estados Unidos y el Departamento del Tesoro convocaron una reunión con directores ejecutivos de bancos donde los funcionarios advirtieron sobre los riesgos de ciberseguridad que plantea Mythos. El regulador bancario federal de Canadá también advirtió a las instituciones financieras sobre las capacidades del modelo.

La violación de OpenAI también parece defender a empresas como Hugging Face, que dependen de sistemas de código abierto, a diferencia de plataformas de desarrollo de IA más secretas como OpenAI.

«Este incidente, posiblemente el primero de su tipo, demuestra un punto en el que hemos creído durante mucho tiempo: la seguridad de la IA no será resuelta por una sola empresa que trabaje en secreto», dijo Delangue de Hugging Face en la declaración de OpenAI.

«Se resolverá de forma abierta, colaborativa, con amplio acceso a la IA para todos los defensores, en todas partes», añadió.