Un equipo de especialistas en ciberseguridad logró acceder al código fuente privado de OpenAI utilizando el modelo de inteligencia artificial Claude, desarrollado por Anthropic, para escribir código de ataque funcional en un proceso que tomó menos de 72 horas.
La cadena de vulnerabilidades
La intrusión llevada a cabo por Harsh Jaiswal, Mohan Pedhapati y Rahul Maini, integrantes del equipo de Hacktron AI, se originó en una herramienta de subida de archivos dentro del foro de ayuda de la comunidad, gestionado mediante el software de terceros Discourse.
El filtro de seguridad implementado no reconoció determinados formatos fotográficos, lo que permitió que los archivos avanzaran hacia una biblioteca de procesamiento de imágenes afectada por una vulnerabilidad conocida de corrupción de memoria. Tras superar las restricciones iniciales, el modelo más reciente de Claude logró redactar las instrucciones necesarias para materializar la brecha.
El acceso a los repositorios y la respuesta institucional
Aunque el exploit inicial otorgó control únicamente sobre los servidores del foro, una falla independiente en el sistema de autenticación de OpenAI facilitó la toma de control de la sesión de un empleado, conectando las credenciales con cuentas de ChatGPT y Codex para ingresar al repositorio privado de código.
Tras recibir el reporte mediante el programa de recompensas de bugs, la plataforma Discourse corrigió el fallo original con una calificación de gravedad de 8,8 sobre 10, mientras que OpenAI solucionó la brecha de autenticación en aproximadamente 14 horas.
