Hugging Face revela una intrusión en su infraestructura provocada por un conjunto de datos malicioso

La compañía afirma que no hay indicios de manipulación de modelos, datasets públicos ni Spaces, aunque continúa investigando si algunos clientes o socios pudieron verse afectados.

Hugging Face ha revelado que sufrió una intrusión en parte de su infraestructura de producción tras detectar que un conjunto de datos malicioso explotó vulnerabilidades en el sistema de procesamiento de datasets para ejecutar código dentro de la plataforma.

Según el informe publicado por la compañía el 16 de julio, el incidente permitió a los atacantes acceder a un número limitado de conjuntos de datos internos y a varias credenciales utilizadas por sus servicios. La investigación sigue en marcha para determinar si la intrusión afectó también a datos de clientes o socios.

¿Cómo comenzó el ataque?

De acuerdo con Hugging Face, el punto de entrada fue un dataset especialmente diseñado para aprovechar dos mecanismos relacionados con el procesamiento automático de datos:

  • un cargador de código remoto (remote-code dataset loader);
  • una vulnerabilidad de inyección de plantillas (template injection) en la configuración del dataset.

La combinación de ambas técnicas permitió ejecutar código en uno de los servidores encargados del procesamiento de datos.

A partir de ahí, los atacantes habrían conseguido:

  • elevar privilegios hasta el nivel del nodo;
  • obtener credenciales de la nube y del clúster;
  • desplazarse lateralmente entre distintos sistemas internos durante varios días.

Un ataque presuntamente automatizado mediante IA

Uno de los aspectos más llamativos del informe es que Hugging Face atribuye la operación a un sistema autónomo basado en inteligencia artificial.

Según la compañía, la campaña habría sido ejecutada mediante miles de acciones independientes realizadas por una red de entornos efímeros (sandboxes) coordinados automáticamente, utilizando además infraestructura de mando y control desplegada sobre servicios públicos.

La empresa no ha identificado públicamente qué modelo de lenguaje o plataforma de IA habría utilizado el supuesto sistema autónomo.

¿Qué no resultó afectado?

Hasta el momento, Hugging Face asegura que no ha encontrado evidencias de manipulación en:

  • modelos públicos;
  • datasets públicos;
  • Spaces;
  • paquetes de software publicados;
  • imágenes de contenedores distribuidas por la plataforma.

La compañía afirma haber verificado la integridad de toda su cadena de suministro de software (software supply chain).

Medidas adoptadas

Luego de detectar la intrusión, Hugging Face informó de que ha llevado a cabo diversas acciones para contener el incidente:

  • cierre de las rutas de ejecución de código explotadas;
  • reconstrucción de los servidores comprometidos;
  • revocación y rotación de credenciales y tokens afectados;
  • inicio de una rotación preventiva de secretos a mayor escala;
  • implantación de controles de admisión más estrictos en sus clústeres;
  • mejora de los sistemas de detección y monitorización;
  • contratación de especialistas externos en análisis forense;
  • notificación a las autoridades competentes.

Además, la empresa recomienda a los usuarios rotar sus tokens de acceso y revisar la actividad reciente de sus cuentas como medida de precaución.

Una lección para las plataformas de IA

El incidente pone de manifiesto que las plataformas dedicadas al entrenamiento y distribución de modelos de IA afrontan riesgos similares a los de cualquier infraestructura de producción, especialmente cuando ejecutan contenido proporcionado por terceros.

Los procesos de ingestión, conversión y evaluación de datasets constituyen una superficie de ataque especialmente sensible si los entornos donde se ejecutan tienen acceso a credenciales de nube, sistemas de orquestación o servicios internos.

Los expertos consideran que este tipo de plataformas deberían aplicar medidas como:

  • aislamiento estricto entre los trabajadores que procesan datos y los sistemas críticos;
  • credenciales con privilegios mínimos;
  • segmentación de la infraestructura;
  • controles de salida (egress filtering);
  • rotación periódica de secretos;
  • sistemas avanzados de detección de comportamientos anómalos.

Investigación aún abierta

Hugging Face continúa analizando el alcance definitivo del incidente y todavía no ha confirmado si la intrusión permitió acceder a información perteneciente a clientes o socios comerciales.

Mientras tanto, la compañía sostiene que no existen pruebas de que los modelos, datasets públicos o Spaces hayan sido alterados, aunque promete seguir informando a medida que avance la investigación.

Vistas: 0
Scroll al inicio