Por Redacción Pangea IA · 7 de octubre de 2026
Estados Unidos, Meta, Google DeepMind e Isomorphic Labs se han unido a Biohub para ampliar hasta 1.800 millones de dólares una iniciativa que quiere construir grandes conjuntos de datos biológicos para entrenar modelos de inteligencia artificial. El objetivo no es crear un «médico artificial» inmediato, sino aprender a predecir cómo responden las células a enfermedades, fármacos y cambios de su entorno.
La ampliación de la llamada Virtual Biology Initiative se hizo pública este 7 de octubre. Es una novedad sustancial sobre el proyecto presentado por Biohub en abril, cuando la organización filantrópica respaldada por Mark Zuckerberg y Priscilla Chan comprometió 500 millones de dólares durante cinco años. Ahora se incorporan nuevas aportaciones públicas y privadas, además de infraestructuras y datos ya financiados, para intentar convertir una colección dispersa de experimentos en una base común apta para entrenar IA.
Qué se ha anunciado realmente
Según la información facilitada por Biohub y recogida por Reuters y Axios, Meta, Google DeepMind e Isomorphic Labs aportarán conjuntamente 300 millones de dólares. El Departamento de Energía de Estados Unidos prevé invertir más de 500 millones durante cinco años en mediciones de laboratorio, modelización y capacidad de computación. Los Institutos Nacionales de Salud coordinarán, además, repositorios creados con más de 500 millones de financiación federal anterior para que Biohub pueda estandarizarlos y hacerlos más útiles para entrenar modelos.
La cifra total de 1.800 millones requiere una lectura cuidadosa. No representa necesariamente 1.800 millones de dinero nuevo transferido hoy a una sola entidad. Combina el compromiso inicial de Biohub, nuevas inversiones de socios tecnológicos, financiación pública durante varios años y el valor de conjuntos de datos construidos previamente que se integrarán en el programa. Es, por tanto, la escala económica y material de la colaboración, no una única ronda de financiación convencional.
La noticia tiene potencial porque ataca uno de los principales cuellos de botella de la IA científica: la falta de datos experimentales amplios, comparables y suficientemente diversos. Los modelos de lenguaje progresaron al entrenarse con enormes volúmenes de texto; en biología, cada observación exige muestras, instrumentos, protocolos y validación. No basta con recopilar más archivos: deben describir de forma coherente qué célula se estudió, en qué condiciones y cómo cambió.
Del mapa de proteínas a una célula virtual
Herramientas como AlphaFold demostraron que la IA puede predecir estructuras moleculares con enorme utilidad para la investigación. La ambición de Biohub va más allá de una estructura estática: pretende desarrollar modelos capaces de anticipar el comportamiento de células completas cuando cambia su entorno, aparece una mutación o se aplica un compuesto.
La idea de una «célula virtual universal» no significa copiar una célula humana con precisión absoluta dentro de un ordenador. Describe una plataforma predictiva que permita formular preguntas digitales, descartar hipótesis poco prometedoras y reservar los experimentos físicos —más lentos y costosos— para las opciones con mayor valor científico.
Biohub prevé obtener datos mediante técnicas como la transcriptómica espacial, que sitúa la actividad molecular dentro del tejido, y mediante ensayos que registran cómo reaccionan las células ante cambios ambientales. La organización sostiene que los conjuntos actuales contienen información de cientos de millones de células, pero que los modelos realmente predictivos necesitarán miles de millones y, con el tiempo, quizá billones de observaciones.
El responsable científico de Biohub, Alex Rives, calcula que el primer conjunto de datos podría estar disponible en aproximadamente un año y que los modelos fiables podrían llegar en cinco. Son objetivos del programa, no resultados demostrados. Todavía no se sabe si la biología responderá a las mismas leyes de escalado observadas en otros tipos de IA, es decir, si añadir datos y cómputo producirá mejoras previsibles.
Para qué podría servir
Seleccionar mejores experimentos
Un modelo celular útil podría comparar miles de perturbaciones antes de llevar unas pocas al laboratorio. Por ejemplo, un equipo podría estudiar qué rutas biológicas parecen responder a un candidato farmacológico, qué combinaciones merecen comprobarse o en qué tipos celulares conviene centrar recursos. La IA no sustituiría el experimento: ayudaría a decidir cuál realizar primero.
Acortar las primeras fases del desarrollo de fármacos
El desarrollo farmacéutico tarda años y acumula numerosos fracasos. Si las predicciones celulares permiten eliminar antes hipótesis débiles, podrían reducir tiempo y costes en las etapas iniciales. Eso no equivale a garantizar que un medicamento funcionará en personas: después seguirán siendo necesarios estudios preclínicos, ensayos clínicos y evaluación regulatoria.
Crear una infraestructura común para la IA biológica
El valor potencial no reside únicamente en un modelo concreto. Un formato común y datos de calidad podrían permitir que universidades, empresas biotecnológicas y laboratorios comparasen resultados y desarrollasen herramientas propias. Pangea IA ya analizó cómo 480 modelos de IA biológica intentan descifrar ADN, proteínas y células; la nueva iniciativa quiere aportar la materia prima experimental que muchos de esos sistemas necesitan.
Datos abiertos, pero con una ventaja temporal para las empresas
Biohub presenta el proyecto como ciencia abierta, aunque el acceso no será idéntico desde el primer día. Las empresas que financien determinados conjuntos de datos tendrán un periodo de embargo durante el cual podrán utilizarlos antes de su publicación. Axios cifra esa ventaja comercial en un año. Según Biohub, los trabajos financiados directamente por el Gobierno estadounidense no estarán sujetos a esa restricción.
El matiz es importante. Abrir finalmente los datos puede ampliar la investigación mundial, pero el acceso anticipado ofrece a los socios privados tiempo para entrenar modelos, registrar propiedad intelectual o iniciar programas de descubrimiento. La colaboración deberá demostrar que el beneficio público compensa esa asimetría y que los datos se liberan con documentación suficiente para reutilizarlos de verdad.
También habrá que aclarar las licencias, la trazabilidad de las muestras y las condiciones de uso. «Abierto» puede significar consulta, descarga, reutilización científica o explotación comercial, y esas posibilidades no son equivalentes. La noticia confirma la intención general, pero todavía no publica todos los términos que regirán cada repositorio futuro.
Qué puede significar para España y Europa
Los centros de investigación y las empresas biotecnológicas europeas podrían beneficiarse si los conjuntos se publican con licencias reutilizables, formatos interoperables y suficiente información sobre su procedencia. Para una pyme, acceder a datos bien estandarizados evita repetir parte del trabajo experimental y facilita probar modelos especializados sin financiar desde cero una infraestructura comparable.
La oportunidad también expone una debilidad: la mayor parte de la financiación y de la capacidad de decisión anunciada se concentra en Estados Unidos y en grandes grupos tecnológicos. Europa dispone de investigación biomédica potente y reglas estrictas sobre datos y salud, pero necesitará infraestructuras compartidas para que sus laboratorios no dependan exclusivamente de repositorios y modelos desarrollados fuera de la UE.
La Visión de Kioto acordada por 17 países para acelerar la ciencia con IA ya situó los laboratorios automatizados, la computación y el acceso a datos entre las prioridades internacionales. El proyecto de Biohub muestra cómo esa estrategia empieza a traducirse en inversiones concretas, aunque también abre preguntas sobre quién controla la infraestructura científica.
Los límites que no deben perderse de vista
Una célula aislada no reproduce por sí sola un organismo. Los modelos deberán capturar diferencias entre tejidos, edades, antecedentes genéticos, enfermedades y condiciones ambientales. Si los datos representan mal a determinadas poblaciones, la IA puede funcionar de manera desigual y trasladar ese sesgo a las hipótesis que recomienda.
La reproducibilidad será otro reto. Resultados generados con instrumentos, laboratorios y protocolos distintos pueden parecer compatibles sin serlo. La estandarización que coordinarán Biohub y los organismos públicos será tan importante como el volumen. Acumular observaciones deficientes no crea automáticamente una buena representación de la biología.
También debe separarse una predicción estadística de una explicación causal. Un modelo puede anticipar una respuesta celular sin identificar correctamente por qué ocurre. Antes de convertir una correlación en tratamiento, los científicos tendrán que verificarla experimentalmente y someterla a revisión independiente.
La aceleración no elimina los riesgos de uso dual. Los mismos modelos que ayudan a comprender enfermedades podrían ofrecer conocimiento aprovechable para diseñar daños biológicos. La gobernanza, el control de acceso a capacidades sensibles y la evaluación de seguridad deberán avanzar junto con la apertura de datos. La reciente ampliación del acceso de Claude para profesionales de ciberseguridad muestra que los laboratorios de IA ya están probando sistemas escalonados de verificación en otros ámbitos de riesgo.
Una apuesta enorme cuyo resultado aún está por demostrar
La ampliación de la Virtual Biology Initiative es relevante por la combinación poco habitual de financiación pública, grandes tecnológicas, laboratorios y ciencia abierta. Su principal aportación inmediata no es una cura ni un modelo terminado, sino la promesa de construir datos coordinados a una escala que la biología computacional todavía no posee.
Si consigue producir conjuntos diversos, fiables y realmente reutilizables, el proyecto puede acelerar la transición desde modelos que describen componentes aislados hacia sistemas que anticipen respuestas celulares. Si la calidad, las licencias o la validación no están a la altura, los 1.800 millones generarán volumen sin garantizar comprensión. El primer examen serio llegará cuando aparezcan los conjuntos iniciales, previsiblemente dentro de un año, y otros equipos puedan comprobar qué predicen y dónde fallan.
Lecturas relacionadas
Fuentes consultadas
- Reuters: inversión de 1.800 millones en datos biológicos para IA. Publicado y consultado el 7 de octubre de 2026.
- Axios: colaboración para desarrollar una célula virtual universal. Publicado y consultado el 7 de octubre de 2026.
- Biohub: presentación original de la Virtual Biology Initiative. Publicado el 29 de abril de 2026 y consultado el 7 de octubre de 2026.


Deja una respuesta