Saltar al contenido principal

Procedencia editorial

Fuente original
eldiario.es
Enviado por
alberto
Resumen generado
El resumen se ha producido automáticamente y no sustituye la publicación original.
Análisis de Limonatic
Contenido analítico añadido por la plataforma y diferenciado de la fuente.
Sin revisión editorial humana
No consta una revisión humana de este contenido.

OpenAI recompensa a expertos por hallar brecha que permitió acceso a sus sistemas internos

Actualidad · Fuente original · Leer en eldiario.es

Fecha original
Fecha en Limonatic

Un equipo independiente de especialistas en ciberseguridad logró acceder a los sistemas internos de OpenAI utilizando Claude, el modelo de inteligencia artificial desarrollado por su competidora directa, Anthropic. Los investigadores consiguieron hackear la cuenta corporativa de ChatGPT de un empleado de la compañía, lo que les permitió visualizar archivos internos e incluso proponer modificaciones en su repositorio de algoritmos secretos.

El ataque fue ejecutado como parte del programa oficial de recompensas de OpenAI, una práctica común en las tecnológicas que anima a los expertos en ciberseguridad a encontrar los agujeros en sus sistemas antes de que lo hagan los hackers. Por ello, los investigadores no llegaron a alterar el código de ChatGPT ni a realizar otro tipo de modificaciones, pero han ofrecido a OpenAI las pruebas de cómo podrían haberlo hecho.

La acción se produjo en julio y fue desvelada por The Wall Street Journal (WSJ). Se trata del mismo medio que adelantó la dimisión de Jacob Coxon, el ingeniero de Anthropic que alertó que ni esta empresa ni OpenAI cuentan con los protocolos de seguridad adecuados para impedir que la IA pierda el control.

Según los datos publicados, el ataque comenzó el 23 de julio, cuando los investigadores detectaron un fallo en Discourse, la plataforma externa que aloja el foro de la comunidad de OpenAI. El equipo intentó utilizar primero una versión especializada de Claude Opus 4.8 para que escribiera el código necesario para explotar la brecha, sin éxito.

Esta misma noche, tras el lanzamiento de Opus 5 por parte de Anthropic, volvieron a intentarlo empleando este modelo. No puso resistencia. Con la ayuda de Opus 5, los especialistas accedieron a las credenciales de identificación de varios usuarios registrados en ese foro interno de OpenAI.

Luego probaron esas mismas credenciales para iniciar sesión a ChatGPT, lo que les abrió la puerta a sus sistemas internos. A través de esa vía, alcanzaron Monorepo, el repositorio central donde la empresa dirigida por Sam Altman concentra la arquitectura de su software y los métodos de optimización de sus algoritmos.

No llegaron hasta la cocina de ChatGPT, puesto que ese entorno no contenía los archivos de los parámetros internos de los modelos de IA, pero sí revisar documentación oficial de la compañía y su funcionamiento. Como prueba de su intrusión, enviaron una solicitud para modificar el código fuente.

OpenAI agradeció a los investigadores por compartir sus hallazgos, mientras que Anthropic no ha hecho comentarios sobre el incidente. El caso ilustra la urgencia de auditar y fortalecer los mecanismos de seguridad interna, especialmente aquellos relacionados con el acceso a propiedad intelectual crítica mediante credenciales corporativas.

Imagen 1 de OpenAI recompensa a expertos por hallar brecha que permitió acceso a sus sistemas internos
Imagen 1 de OpenAI recompensa a expertos por hallar brecha que permitió acceso a sus sistemas internos

Análisis editorial

Un equipo de ciberseguridad ha demostrado que la IA generativa puede ser instrumentalizada para comprometer infraestructuras críticas, al infiltrarse en los sistemas internos de OpenAI mediante el modelo Claude de Anthropic. Este incidente no refleja una rebelión de las máquinas, sino una vulnerabilidad grave en los protocolos perimetrales que permite a actores externos explotar brechas sin necesidad de ingeniería social directa. La tesis central es que la seguridad actual de los laboratorios de IA es insuficiente frente a amenazas ofensivas, planteando urgencia sobre la regulación y protección antes de su adopción masiva.

La intrusión comenzó el 23 de julio cuando investigadores de Hacktron AI detectaron un fallo en la plataforma Discourse mientras esta procesaba archivos de imagen. Tras intentar sin éxito con una versión especializada de Claude Opus 4.8, lograron acceder a los sistemas utilizando el modelo Opus 5 lanzado esa misma noche. Los expertos hackearon la cuenta corporativa de ChatGPT de un empleado para visualizar archivos internos y proponer modificaciones en el repositorio Monorepo, donde se concentra la arquitectura del software. OpenAI recompensó a los investigadores con 6.500 dólares tras confirmar que no alteraron el código, aunque sí proporcionaron pruebas del acceso posible a credenciales y documentación sensible.

Este caso subraya riesgos existenciales si las defensas no se refuerzan inmediatamente, especialmente considerando que un ataque real proveniente de China logró acceder a los sistemas de Anthropic a finales de 2025. La falta de respuesta inmediata de OpenAI para aumentar la seguridad tras ese incidente anterior sugiere que sus protocolos no estaban bien diseñados ni actualizados. Además, la capacidad de usar modelos de terceros con propósito malicioso viola los términos de servicio y expone algoritmos secretos a actores que podrían buscar perder el control de estas tecnologías antes de 2030.

La lectura final es que la industria tecnológica debe auditar urgentemente sus controles de acceso en plataformas externas y reforzar las defensas perimetrales para evitar usos maliciosos o pérdida de control de los sistemas. La evidencia sugiere que ni OpenAI ni Anthropic cuentan con protocolos adecuados para impedir que la IA sea utilizada ofensivamente, lo que exige una acción coordinada para proteger infraestructuras críticas antes de que vulnerabilidades similares sean explotadas por amenazas más sofisticadas.

Contexto y análisis adicional

Digest

Resumen ejecutivo
  • Un equipo de ciberseguridad utilizó el modelo Claude de Anthropic para infiltrarse en los sistemas internos de OpenAI y acceder a archivos confidenciales.
  • El incidente demuestra una vulnerabilidad crítica en la seguridad perimetral que permite a actores externos explotar brechas sin necesidad de ingeniería social directa.
Evidencias
  • Los investigadores de Hacktron AI hackearon la cuenta corporativa de ChatGPT de un empleado para visualizar archivos internos y proponer modificaciones.
  • El ataque se ejecutó en julio como parte del programa oficial de recompensas de OpenAI, el cual otorgó 6.500 dólares a los expertos tras descubrir el fallo.
  • La intrusión comenzó el 23 de julio al detectar un error en la plataforma Discourse que alojaba el foro de la comunidad de OpenAI.
Acciones
  • Revisar inmediatamente los protocolos de seguridad perimetral para evitar que modelos de terceros accedan a cuentas corporativas o repositorios de código.
  • Auditar los controles de acceso en plataformas externas como foros comunitarios para prevenir vectores de entrada similares al incidente en Discourse.
Conclusión final

El caso evidencia insuficiencias graves en las defensas actuales contra el uso ofensivo de IA generativa, planteando urgencia sobre la regulación y protección de infraestructuras críticas antes de su adopción masiva.

Riesgos

Riesgos/alertas
  • Explotación exitosa de vulnerabilidades en la plataforma Discourse y cuentas corporativas para acceder a sistemas internos.
  • Posibilidad de que modelos de IA sean instrumentalizados por actores maliciosos para comprometer infraestructuras o algoritmos secretos.
Acciones recomendadas
  • Auditar y parchear inmediatamente las vulnerabilidades detectadas en la plataforma Discourse y los protocolos de autenticación.
  • Reforzar los controles de seguridad perimetral y revisar los procedimientos para prevenir el acceso indebido a repositorios de algoritmos.
Señales/evidencias
  • Un equipo independiente utilizó Claude (IA de Anthropic) para explotar una brecha en OpenAI y acceder a archivos internos.
  • Los investigadores hackearon la cuenta corporativa de ChatGPT de un empleado, visualizando archivos y proponiendo modificaciones en algoritmos secretos.
  • El ataque se originó el 23 de julio al detectar un fallo en Discourse mientras procesaba archivos de imagen.
  • OpenAI recompensó a los investigadores con 6.500 dólares tras confirmar que no alteraron el código, sino que proporcionaron pruebas del acceso posible.
Conclusión

El incidente demuestra la existencia de vulnerabilidades explotables en las infraestructuras de IA y subraya la necesidad urgente de reforzar los protocolos de seguridad para prevenir usos maliciosos o pérdida de control de estos sistemas.

Autor · clanes

Votos · compartir

0
· Abrir en el medio

Las historias descartadas o eliminadas no admiten votos ni reportes.

Sentimiento

Tono: Negativo Impacto: Neutro Financiero: Neutro

Entidades (agregadas)

Hover para ver referencias.
Claude ×6 Anthropic ×5 OpenAI ×4 Hacktron AI ×2 WSJ ×2 AESIA Alberto Gago Amodei China Code Dari Dario Amodei Greg Brockman IA Jacob Coxon Mohan Pedhapati Sam Altman The Wall Street Journal
Detalles avanzados Timeline y mini scoring

Evolución temporal

  1. Enviada

    hace 1 semana · Historia enviada para revisión

  2. Último estado

    hace 6 días · Última actualización registrada

Mini scoring (LScore)

Caliente 1.994,20 Ascenso 0,00

Fuentes

Fuente principal
eldiario.es

https://www.eldiario.es

Comentarios