OpenAI recompensa a expertos por hallar brecha que permitió acceso a sus sistemas internos
- Fecha original
- Fecha en Limonatic
Un equipo independiente de especialistas en ciberseguridad logró acceder a los sistemas internos de OpenAI utilizando Claude, el modelo de inteligencia artificial desarrollado por su competidora directa, Anthropic. Los investigadores consiguieron hackear la cuenta corporativa de ChatGPT de un empleado de la compañía, lo que les permitió visualizar archivos internos e incluso proponer modificaciones en su repositorio de algoritmos secretos.
El ataque fue ejecutado como parte del programa oficial de recompensas de OpenAI, una práctica común en las tecnológicas que anima a los expertos en ciberseguridad a encontrar los agujeros en sus sistemas antes de que lo hagan los hackers. Por ello, los investigadores no llegaron a alterar el código de ChatGPT ni a realizar otro tipo de modificaciones, pero han ofrecido a OpenAI las pruebas de cómo podrían haberlo hecho.
La acción se produjo en julio y fue desvelada por The Wall Street Journal (WSJ). Se trata del mismo medio que adelantó la dimisión de Jacob Coxon, el ingeniero de Anthropic que alertó que ni esta empresa ni OpenAI cuentan con los protocolos de seguridad adecuados para impedir que la IA pierda el control.
Según los datos publicados, el ataque comenzó el 23 de julio, cuando los investigadores detectaron un fallo en Discourse, la plataforma externa que aloja el foro de la comunidad de OpenAI. El equipo intentó utilizar primero una versión especializada de Claude Opus 4.8 para que escribiera el código necesario para explotar la brecha, sin éxito.
Esta misma noche, tras el lanzamiento de Opus 5 por parte de Anthropic, volvieron a intentarlo empleando este modelo. No puso resistencia. Con la ayuda de Opus 5, los especialistas accedieron a las credenciales de identificación de varios usuarios registrados en ese foro interno de OpenAI.
Luego probaron esas mismas credenciales para iniciar sesión a ChatGPT, lo que les abrió la puerta a sus sistemas internos. A través de esa vía, alcanzaron Monorepo, el repositorio central donde la empresa dirigida por Sam Altman concentra la arquitectura de su software y los métodos de optimización de sus algoritmos.
No llegaron hasta la cocina de ChatGPT, puesto que ese entorno no contenía los archivos de los parámetros internos de los modelos de IA, pero sí revisar documentación oficial de la compañía y su funcionamiento. Como prueba de su intrusión, enviaron una solicitud para modificar el código fuente.
OpenAI agradeció a los investigadores por compartir sus hallazgos, mientras que Anthropic no ha hecho comentarios sobre el incidente. El caso ilustra la urgencia de auditar y fortalecer los mecanismos de seguridad interna, especialmente aquellos relacionados con el acceso a propiedad intelectual crítica mediante credenciales corporativas.
Análisis editorial
Un equipo de ciberseguridad ha demostrado que la IA generativa puede ser instrumentalizada para comprometer infraestructuras críticas, al infiltrarse en los sistemas internos de OpenAI mediante el modelo Claude de Anthropic. Este incidente no refleja una rebelión de las máquinas, sino una vulnerabilidad grave en los protocolos perimetrales que permite a actores externos explotar brechas sin necesidad de ingeniería social directa. La tesis central es que la seguridad actual de los laboratorios de IA es insuficiente frente a amenazas ofensivas, planteando urgencia sobre la regulación y protección antes de su adopción masiva.
La intrusión comenzó el 23 de julio cuando investigadores de Hacktron AI detectaron un fallo en la plataforma Discourse mientras esta procesaba archivos de imagen. Tras intentar sin éxito con una versión especializada de Claude Opus 4.8, lograron acceder a los sistemas utilizando el modelo Opus 5 lanzado esa misma noche. Los expertos hackearon la cuenta corporativa de ChatGPT de un empleado para visualizar archivos internos y proponer modificaciones en el repositorio Monorepo, donde se concentra la arquitectura del software. OpenAI recompensó a los investigadores con 6.500 dólares tras confirmar que no alteraron el código, aunque sí proporcionaron pruebas del acceso posible a credenciales y documentación sensible.
Este caso subraya riesgos existenciales si las defensas no se refuerzan inmediatamente, especialmente considerando que un ataque real proveniente de China logró acceder a los sistemas de Anthropic a finales de 2025. La falta de respuesta inmediata de OpenAI para aumentar la seguridad tras ese incidente anterior sugiere que sus protocolos no estaban bien diseñados ni actualizados. Además, la capacidad de usar modelos de terceros con propósito malicioso viola los términos de servicio y expone algoritmos secretos a actores que podrían buscar perder el control de estas tecnologías antes de 2030.
La lectura final es que la industria tecnológica debe auditar urgentemente sus controles de acceso en plataformas externas y reforzar las defensas perimetrales para evitar usos maliciosos o pérdida de control de los sistemas. La evidencia sugiere que ni OpenAI ni Anthropic cuentan con protocolos adecuados para impedir que la IA sea utilizada ofensivamente, lo que exige una acción coordinada para proteger infraestructuras críticas antes de que vulnerabilidades similares sean explotadas por amenazas más sofisticadas.
Contexto y análisis adicional
Digest
Resumen ejecutivo
- Un equipo de ciberseguridad utilizó el modelo Claude de Anthropic para infiltrarse en los sistemas internos de OpenAI y acceder a archivos confidenciales.
- El incidente demuestra una vulnerabilidad crítica en la seguridad perimetral que permite a actores externos explotar brechas sin necesidad de ingeniería social directa.
Evidencias
- Los investigadores de Hacktron AI hackearon la cuenta corporativa de ChatGPT de un empleado para visualizar archivos internos y proponer modificaciones.
- El ataque se ejecutó en julio como parte del programa oficial de recompensas de OpenAI, el cual otorgó 6.500 dólares a los expertos tras descubrir el fallo.
- La intrusión comenzó el 23 de julio al detectar un error en la plataforma Discourse que alojaba el foro de la comunidad de OpenAI.
Acciones
- Revisar inmediatamente los protocolos de seguridad perimetral para evitar que modelos de terceros accedan a cuentas corporativas o repositorios de código.
- Auditar los controles de acceso en plataformas externas como foros comunitarios para prevenir vectores de entrada similares al incidente en Discourse.
Conclusión final
El caso evidencia insuficiencias graves en las defensas actuales contra el uso ofensivo de IA generativa, planteando urgencia sobre la regulación y protección de infraestructuras críticas antes de su adopción masiva.
Riesgos
Riesgos/alertas
- Explotación exitosa de vulnerabilidades en la plataforma Discourse y cuentas corporativas para acceder a sistemas internos.
- Posibilidad de que modelos de IA sean instrumentalizados por actores maliciosos para comprometer infraestructuras o algoritmos secretos.
Acciones recomendadas
- Auditar y parchear inmediatamente las vulnerabilidades detectadas en la plataforma Discourse y los protocolos de autenticación.
- Reforzar los controles de seguridad perimetral y revisar los procedimientos para prevenir el acceso indebido a repositorios de algoritmos.
Señales/evidencias
- Un equipo independiente utilizó Claude (IA de Anthropic) para explotar una brecha en OpenAI y acceder a archivos internos.
- Los investigadores hackearon la cuenta corporativa de ChatGPT de un empleado, visualizando archivos y proponiendo modificaciones en algoritmos secretos.
- El ataque se originó el 23 de julio al detectar un fallo en Discourse mientras procesaba archivos de imagen.
- OpenAI recompensó a los investigadores con 6.500 dólares tras confirmar que no alteraron el código, sino que proporcionaron pruebas del acceso posible.
Conclusión
El incidente demuestra la existencia de vulnerabilidades explotables en las infraestructuras de IA y subraya la necesidad urgente de reforzar los protocolos de seguridad para prevenir usos maliciosos o pérdida de control de estos sistemas.
Autor · clanes
Votos · compartir
Las historias descartadas o eliminadas no admiten votos ni reportes.
Sentimiento
Tags
Entidades (agregadas)
Hover para ver referencias.Detalles avanzados Timeline y mini scoring
Evolución temporal
-
Enviada
hace 1 semana · Historia enviada para revisión
-
Último estado
hace 6 días · Última actualización registrada
Mini scoring (LScore)
Fuentes
- Fuente principal
-
eldiario.es
https://www.eldiario.es
Comentarios