Claude Opus 5 y el día que la IA derribó la puerta de OpenAI: así se encadenaron dos fallos para tomar cuentas de empleados

La inteligencia artificial ha dejado de ser una herramienta pasiva para convertirse en un actor activo en el campo de la ciberseguridad ofensiva. Tres investigadores de la firma de seguridad Hacktron utilizaron Claude Opus 5, el modelo más avanzado de Anthropic, para encadenar dos vulnerabilidades y tomar el control de las cuentas de ChatGPT y Codex de varios empleados de OpenAI.

Desde ahí, llegaron a un repositorio de código interno de la compañía. Todo el proceso, desde el primer vistazo hasta el acceso interno, les llevó menos de 72 horas.

No fue un ataque real, sino una investigación de seguridad autorizada. El equipo reportó los fallos a OpenAI, demostró el acceso con una pull request inofensiva y se detuvo. OpenAI confirmó la corrección aproximadamente 14 horas después del informe y el 1 de septiembre, pagó al equipo una recompensa de 6.500 dólares.

La compañía aclaró que el pago “reconoce el hallazgo del lado de OpenAI, no las acciones contra Discourse”, el software de código abierto que ejecuta el foro. Probar el foro en sí quedaba fuera de su programa de recompensas.

La cadena: de un fallo en el foro a las cuentas de empleados

La cadena de ataque comenzó con un fallo en el software que ejecuta el foro público de ayuda de OpenAI y avanzó a través de una debilidad en el propio sistema de inicio de sesión de la compañía. La razón por la que un fallo en un foro público pudo alcanzar cuentas de empleados reside en el sistema de inicio de sesión, no en el software del foro.

El foro de OpenAI ofrece una opción de “Iniciar sesión con OpenAI”, el mismo inicio de sesión único (SSO) que los empleados utilizan en otros servicios. Una vez que los investigadores tomaron el control del servidor del foro, el inicio de sesión compartido les permitió hacerse con las cuentas de ChatGPT y Codex de los miembros del foro que trabajaban en OpenAI. Las víctimas no tuvieron que hacer nada.

Hacktron señaló que se trataba de un problema de identidad de OpenAI, no de un fallo en el software del foro: cualquier servicio de primera o tercera parte que utilizara el mismo inicio de sesión podría haber otorgado el mismo acceso.

El fallo en libheif: una imagen que corrompe la memoria

La vía de entrada fue un fallo en el procesamiento de imágenes. El foro funciona con Discourse, que pasa las imágenes subidas en formato HEIC y HEIF a una herramienta llamada ImageMagick, que utiliza la librería libheif para leerlas. Un fallo en libheif permitía que una imagen especialmente diseñada corrompiera la memoria del servidor del foro.

El aviso de Discourse califica el resultado como ejecución remota de código, con una puntuación de 8,8 sobre 10, y lo rastrea como CVE-2026-32882. Aunque el registro público del fallo es más limitado. En el aviso de libheif y en las bases de datos nacionales de vulnerabilidades, CVE-2026-32882 es una lectura fuera de límites que puede bloquear el software o filtrar memoria cercana, no un fallo de ejecución de código directo.

Esa memoria filtrada ayuda a derrotar una protección común llamada ASLR. Los investigadores afirman que combinaron los fallos de memoria de libheif, con la ayuda de la IA, para convertir el bloqueo en una ejecución de código funcional en el servidor del foro. La corrección upstream llegó en libheif 1.22.0 en mayo de 2026.

Esa corrección existía meses antes de la prueba. Pero la imagen del servidor del foro, construida sobre la distribución Debian 12, todavía incluía la versión antigua y sin parchear de libheif, la 1.19.7, cuando los investigadores la examinaron en julio. La corrección y su CVE ya eran públicos, pero Debian aún no los había incluido en la versión empaquetada que el foro utilizaba.

Si ejecutas tu propio servidor Discourse, esta parte te afecta directamente. Reconstruye sobre la imagen más reciente para obtener el libheif parcheado, porque una actualización de la interfaz web por sí sola puede no reemplazar la librería antigua. Los sitios alojados por Discourse ya estaban parcheados, y las versiones autoalojadas corregidas son 2026.7.0, 2026.6.1, 2026.5.2 y 2026.1.6.

El papel de la IA: de la frustración al exploit en horas

Los investigadores utilizaron la IA para hacer la parte difícil. Primero probaron con Claude Opus 4.8, que luchó durante varias sesiones para construir un exploit funcional una vez que se habilitó una defensa de memoria estándar, ASLR.

Anthropic lanzó su siguiente modelo, Claude Opus 5, la noche del 24 de julio, y en una sesión nueva produjo un exploit funcional en cuestión de horas.

Opus 5 se distribuyó con salvaguardas destinadas a impedir que escribiera código de explotación para objetivos reales. Los investigadores las sortearon apuntando el modelo a su propio servidor de pruebas, disfrazado como un objetivo de práctica de tipo capture-the-flag y luego dejándolo funcionar en un bucle automatizado.

Aun así, señalan que el trabajo no fue completamente autónomo: la dirección humana experta siguió siendo importante, y esto no fue hacking automatizado sin nadie a los mandos.

El caso encaja con lo que investigadores y empresas de IA han descrito este año: los modelos de IA capaces están recortando drásticamente el tiempo y la habilidad que antes requería el trabajo ofensivo serio. Anthropic ha informado de que grupos criminales y respaldados por estados ya están utilizando sus modelos Claude para llevar a cabo intrusiones reales, no solo para responder preguntas.

HEIF Heist: el proyecto más amplio

OpenAI fue un objetivo dentro de un proyecto más amplio que Hacktron llama HEIF Heist. Durante aproximadamente dos meses, el equipo afirma haber encontrado la misma clase de fallos de decodificación de imágenes en software utilizado por otras grandes empresas, con un coste total inferior a 3.000 dólares en uso de IA. Vinculan la campaña a fallos reportados en Slack, productos de Meta, GitHub Enterprise y frameworks web como Next.js.

Esas afirmaciones más amplias están respaldadas de forma desigual. El fallo de Next.js está confirmado en el aviso de Vercel, y los mantenedores de libheif confirmaron un exploit funcional de ejecución de código para el fallo vinculado a Meta. La afirmación más amplia de ejecución de código en muchas aplicaciones no ha sido confirmada de forma independiente.

La campaña más amplia utilizó un modelo diferente, GPT-5.6 Sol de OpenAI, para casos en los que el equipo no sabía nada sobre el objetivo de antemano. Solo una empresa, Shopify, parece haber notado la actividad, según los investigadores, a pesar de que sus procesadores de imágenes se bloquearon repetidamente bajo miles de cargas de prueba.

¿Qué deben hacer las organizaciones?

Las lecciones más importantes van más allá de Discourse. Si tu servicio acepta imágenes de usuario y lee archivos HEIC, HEIF o AVIF a través de libheif, una compilación antigua podría estar expuesta.

Y si un servicio público de menor confianza comparte tu inicio de sesión único con herramientas internas, una intrusión en ese servicio puede convertirse en una intrusión en todo lo que ese inicio de sesión alcanza.

Las recomendaciones son claras:

  • Actualizar libheif a la última versión de seguridad (1.23.4 a principios de septiembre de 2026) o a la compilación parcheada de tu distribución.
  • Desactivar la decodificación de imágenes HEIF y AVIF no confiables donde no sea necesario, o ejecutar el procesamiento de imágenes dentro de un sandbox aislado.
  • Limitar los servicios en los que confía tu inicio de sesión único y exigir una verificación de identidad fresca antes de acciones sensibles, en lugar de confiar en una sesión existente.

No hay indicios de que el fallo de OpenAI se haya utilizado contra nadie en el mundo real. A mediados de septiembre de 2026, no estaba en la lista del gobierno estadounidense de vulnerabilidades conocidas como explotadas, aunque esa lista no es prueba definitiva en ningún sentido.

El futuro de la seguridad asistida por IA

El caso de Hacktron y Claude Opus 5 es un punto de inflexión. No porque sea el primer ataque que utiliza IA como herramienta, sino porque demuestra que la IA puede ser el instrumento que convierte una vulnerabilidad de baja severidad en una cadena de ejecución de código completamente funcional. Lo que antes requería semanas de trabajo experto, ahora puede lograrse en horas con la dirección adecuada.

Para las organizaciones, el mensaje es doble. Primero, la seguridad de la cadena de suministro es tan importante como la seguridad del núcleo. Una librería desactualizada en una imagen de servidor puede ser la puerta de entrada a toda la infraestructura. Segundo, la autenticación única compartida entre servicios de diferente confianza crea un riesgo sistémico. Si un servicio público cae, todo lo que comparte ese inicio de sesión cae con él.

La IA no ha hecho que la seguridad sea obsoleta. Ha hecho que la seguridad sea más urgente. Porque si los defensores pueden usar la IA para encontrar y corregir fallos más rápido, los atacantes también pueden usarla para encontrar y explotar esos mismos fallos. La carrera continúa, y en esta ocasión, la IA ha demostrado que puede correr más rápido que nunca.

Vistas: 1

Descubre más desde CIBERED

Suscríbete y recibe las últimas entradas en tu correo electrónico.

Scroll al inicio