Una coalición sin precedentes une a Google DeepMind, Meta, Isomorphic Labs, el Departamento de Energía y los Institutos Nacionales de Salud de EE.UU. con Biohub, la organización sin ánimo de lucro de Mark Zuckerberg y Priscilla Chan.
El objetivo: crear un modelo predictivo de la célula humana capaz de simular experimentos biológicos antes de pisar el laboratorio.
El ambicioso objetivo: una célula virtual que transforme la medicina
Imagina poder probar un fármaco contra una enfermedad rara sin necesidad de cultivarlo en un laboratorio. O predecir cómo responderá una célula cancerosa a una mutación genética concreta antes de recurrir a costosos ensayos clínicos.
Eso es, en esencia, lo que persigue la Virtual Biology Initiative, un proyecto liderado por Biohub, la organización sin ánimo de lucro fundada por Mark Zuckerberg y Priscilla Chan.
La meta final es lo que Biohub denomina una “célula virtual universal” : un modelo de inteligencia artificial capaz de predecir cómo se comportan las células y cómo responden a intervenciones como fármacos o cambios genéticos. La idea es que los científicos puedan realizar experimentos digitalmente antes de comprometer tiempo y recursos en el laboratorio, acelerando radicalmente el descubrimiento de nuevos tratamientos.
Según Alex Rives, jefe de ciencia de Biohub, “un modelo predictivo preciso de la biología podría acelerar drásticamente el descubrimiento científico”. Y añade: “La creación de una célula virtual es uno de los desafíos más importantes para la próxima era de la ciencia” .
Una coalición sin precedentes: quién pone el dinero
El proyecto ha reunido una alianza de 1.800 millones de dólares en financiación, datos, capacidad de cómputo y tecnología de medición.
La distribución de las aportaciones revela un equilibrio poco habitual entre capital público y privado:
- Biohub comprometió 500 millones de dólares en abril, cuando lanzó la iniciativa. De esa cifra, 400 millones se destinan a desarrollar tecnologías de vanguardia para medir, visualizar y manipular la biología, y 100 millones a financiar investigación externa.
- Google DeepMind, Isomorphic Labs y Meta invierten conjuntamente 300 millones de dólares para crear las tecnologías y los conjuntos de datos multimodales necesarios.
- El Departamento de Energía de EE.UU. (DOE) aporta más de 500 millones de dólares a lo largo de cinco años para medición, modelado y computación. Utilizará desde supercomputación exaescalar hasta tomografía crioelectrónica.
- Los Institutos Nacionales de Salud (NIH) contribuyen con conjuntos de datos, repositorios y bases de conocimiento derivados de una inversión federal previa de más de 500 millones de dólares.
A ellos se suman instituciones de investigación de primer nivel como el Allen Institute, Arc Institute, Broad Institute y el Wellcome Sanger Institute, junto a consorcios internacionales como el Human Cell Atlas y el Human Protein Atlas. Nvidia aporta la infraestructura de computación acelerada.
¿Cómo se construye una célula virtual? El papel de los datos
El obstáculo fundamental no es la falta de algoritmos, sino la escasez de datos biológicos de alta calidad. Los modelos de IA actuales han avanzado gracias a la combinación de mejores algoritmos, más potencia de cómputo y enormes cantidades de datos. Pero la biología presenta un desafío adicional: gran parte de la información que la IA necesita aún no existe y debe medirse pacientemente del mundo físico.
Rives lo explica con claridad: “Para construir inteligencia artificial que pueda representar con precisión la complejidad total de la biología y acelerar la investigación científica, necesitamos órdenes de magnitud más datos de los que existen hoy” . Y añade que “la biología es una especie de lenguaje” , y capturar ese lenguaje celular requiere herramientas y mediciones que aún no se han desarrollado por completo.
Los conjuntos de datos actuales abarcan cientos de millones de células. Rives estima que los modelos predictivos precisos requerirán miles de millones, y eventualmente billones, de células y estados celulares.
Para cerrar esa brecha, los investigadores utilizarán técnicas como la transcriptómica espacial, la microscopía avanzada, la tomografía crioelectrónica y el cribado celular a gran escala, registrando cómo responden las células a fármacos, modificaciones genéticas y cambios ambientales.
Los desafíos: plazos ambiciosos y preguntas sin respuesta
El calendario es, cuanto menos, ambicioso. Según Rives, “un trabajo de esta escala normalmente llevaría décadas” , pero los socios esperan comprimirlo en cinco años. El primer gran conjunto de datos debería estar listo en aproximadamente un año, y los primeros modelos predictivos funcionales se esperan dentro del mismo horizonte quinquenal.
Aunque el escepticismo persiste. Los críticos señalan que la biología resiste la abstracción limpia y que la precisión predictiva depende de datos multimodales intrínsecamente complejos. La gobernanza de los datos, las restricciones de privacidad, la reproducibilidad y la aceptación regulatoria siguen sin resolverse.
Incluso algunos investigadores argumentan que escalar la capacidad del modelo no es suficiente: el verdadero desafío es cubrir la diversidad de contextos biológicos, no aumentar la expresividad del modelo.
La letra pequeña: acceso exclusivo para los financiadores privados
Uno de los puntos más controvertidos del proyecto es el régimen de acceso a los datos. Aunque la iniciativa se presenta como un recurso abierto para la comunidad científica, los socios comerciales obtendrán un año de acceso exclusivo a los datos que contribuyan a generar antes de que se hagan públicos.
Rives defiende esta medida como un incentivo necesario: “Tenemos que dar algún incentivo a los actores comerciales para que participen, y el período de embargo crea ese incentivo. Pero es un embargo de un año. Eso significa que muy rápidamente los datos estarán ampliamente disponibles para los esfuerzos científicos” .
El matiz importante es que los datos financiados con fondos gubernamentales no tendrán esa restricción. Esto genera una tensión evidente: más de 1.000 millones de dólares de dinero público frente a 300 millones de capital privado, y las empresas tecnológicas que aportan una fracción menor obtienen un año de ventaja competitiva sobre el resto de la comunidad científica.
Esta asimetría plantea preguntas incómodas: si el público financia la mayor parte de la ciencia y proporciona las muestras biológicas, ¿quién posee lo que la IA aprende sobre las células? ¿Y quién se beneficia de vender ese conocimiento de vuelta al público como medicina? Son cuestiones que nadie respondió en la presentación del proyecto.
Descubre más desde CIBERED
Suscríbete y recibe las últimas entradas en tu correo electrónico.


