Claude descubrió un sistema biológico a partir de más de 200.000 secuencias de transcriptasa inversa que nunca antes se habían descrito en la literatura científica. La hilera de ADN repetitivo que se encontraba junto a él se parecía mucho a la estructura de CRISPR cuando se descubrió por primera vez.
El 23 de septiembre, Anthropic anunció este descubrimiento y lo denominó “transcriptasa inversa asociada a matrices” (ART). Los experimentos preliminares demostraron que el ADN repetitivo se traducía en un conjunto de ARN cortos. Feng Zhang, pionero de la edición genética CRISPR, tras revisar la prepublicación, comentó que el descubrimiento era “realmente interesante y merecedor de un estudio más profundo”.
Lo más destacable es el proceso de descubrimiento. La búsqueda completa requirió aproximadamente 950 sesiones con el agente Claude, dedicando 21,5 horas a examinar bases de datos, detectar anomalías y compararlas con sistemas conocidos. Anthropic afirmó que los científicos humanos fueron responsables de definir la dirección inicial de la investigación y los experimentos posteriores, mientras que la búsqueda y el análisis fueron realizados principalmente por Claude.
En este caso, “ver” no se refiere al reconocimiento de imágenes. La secuencia de ADN consiste en una larga cadena de letras, y Claude reconoció directamente el patrón recurrente en el texto.
A continuación, contabilizó el número de repeticiones y los intervalos, comparó esta disposición con sistemas de transcriptasa inversa conocidos y consultó artículos para confirmar si alguien había descrito previamente una combinación similar. Tras completar el análisis, redactó un informe sobre esta pista y lo presentó al equipo de investigación humana para su revisión.
El equipo de investigación continuó analizando esta secuencia, identificando una asociación estable entre la transcriptasa inversa, los genes asociados vecinos y las repeticiones, y denominó a esta familia ART. Lo que se confirmó fue este conjunto de características previamente no descritas, no su función biológica.
950 sesiones para una búsqueda a gran escala
Anthropic le asignó a Claude una tarea de investigación para encontrar nuevos sistemas de transcriptasa inversa. El agente recopiló más de 200.000 grupos de secuencias de transcriptasa inversa de la base de datos, los clasificó en nueve categorías y analizó 3.564 familias de proteínas que aparecían repetidamente cerca de estas enzimas.
El análisis inicial arrojó 16 familias candidatas, y las tareas posteriores implementadas por el agente añadieron una decimoséptima familia.
La búsqueda completa comprendió en última instancia 119 tareas, 98 de las cuales fueron derivadas por el agente a partir de pistas descubiertas durante el proceso; se realizaron un total de 949 sesiones del agente, acumulando aproximadamente 77 horas de trabajo, y se completaron en 21,5 horas.
Esto no equivale a 950 agentes trabajando simultáneamente. Calculado en función del tiempo de ejecución acumulado, el número promedio de agentes paralelos es de aproximadamente 3,6, pero esta cifra solo describe la programación de tareas y no indica si la inversión en investigación es grande o pequeña.
La búsqueda arrojó finalmente 19 informes. Entre las 17 familias de proteínas candidatas, se identificaron 3 como asociaciones de transcriptasa inversa no reportadas previamente; el agente también identificó 3 nuevos linajes de transcriptasa inversa durante el proceso.
El ART fue descubierto en una de las investigaciones posteriores. El análisis inicial se centró en los genes codificadores de proteínas adyacentes a la transcriptasa inversa, pero se descubrió que el agente seguía leyendo ADN no codificador de proteínas situado río arriba, lo que condujo al descubrimiento de la matriz de repeticiones.
Por lo tanto, este descubrimiento no fue ni el resultado directo de criterios de selección predefinidos ni un accidente ajeno al proceso principal. Se debe a la capacidad del agente para seguir investigando anomalías fuera de sus tareas predeterminadas.
Anthropic estima que la recopilación de secuencias a gran escala y el análisis de candidatos, si los realizaran científicos profesionales, podrían llevar de semanas a meses. Esta comparación se refiere a todo el proceso de análisis de datos, no a experimentos rigurosos entre humanos y máquinas, y no incluye la validación biológica posterior.
¿Por qué no apareció al repetir la búsqueda 10 veces más?
Para comprobar si los resultados podían replicarse, el equipo de investigación puso en marcha 10 rondas más de búsqueda utilizando la misma tarea y el mismo marco de agentes.
Casi todas las tareas que completaron la selección inicial recolectaron secuencias que contenían ART, y dos rondas más investigaron el linaje de la transcriptasa inversa relacionada. Aunque ninguna de las rondas analizó activamente el ADN corriente arriba, por lo que se omitió toda la matriz de repeticiones.
Los investigadores cambiaron entonces su método de prueba: en lugar de dejar que el agente buscara por sí solo en una enorme base de datos, le dieron directamente al modelo las secuencias cercanas a ART y le dejaron juzgar qué características merecían ser tenidas en cuenta.
Los resultados fueron significativamente diferentes. Cuando el ADN relevante estaba presente directamente en el contexto, el modelo Claude, más capaz, podía identificar secuencias repetitivas en al menos el 90% de las pruebas; cuando la secuencia se colocaba en un archivo y el modelo tenía que abrirlo manualmente, la tasa de reconocimiento se redujo al 32% en algunas pruebas.
Tras revisar el registro de trabajo, el equipo de investigación descubrió que, en las pruebas realizadas con la documentación y las herramientas proporcionadas, el 39% de los intentos no lograron leer más de 200 bases de ADN consecutivamente. A medida que aumentaba la longitud del ADN leído en el contexto, la probabilidad de que el modelo reconociera secuencias repetitivas se incrementaba; Mythos 5 alcanzó un máximo del 96% en algunos casos.
ART y CRISPR: parecidos estructurales, no funcionales
ART consta de tres partes: una transcriptasa inversa, un gen asociado situado junto a ella y una larga cadena de ADN repetitivo espaciado situada río arriba.
Esta transcriptasa inversa en sí misma no es nueva. Estudios previos han identificado este tipo de enzima en bacteriófagos gigantes, pero la combinación de su presencia con secuencias repetitivas y genes asociados no se había descrito.
Una búsqueda posterior realizada por Anthropic reveló 95 grupos de secuencias de transcriptasa inversa relacionadas, 28 de las cuales estaban acompañadas de secuencias repetitivas identificables. Esta disposición relativamente estable fue la base principal para que el equipo la clasificara en una nueva familia.
La característica más llamativa es la disposición repetitiva, ya que CRISPR también tiene una estructura similar.
En el sistema CRISPR, las secuencias espaciadoras entre secuencias repetitivas son las principales registradoras de información sobre invasores anteriores. Tras ser transcritas a ARN, estas secuencias espaciadoras guían a las proteínas Cas para que reconozcan y corten sitios de ADN que cumplen ciertos criterios, lo que permite a los científicos convertirlas en herramientas de edición genética.
Actualmente, ART solo se asemeja a los sistemas CRISPR en apariencia. Carece de proteínas Cas conocidas y su secuencia espaciadora es más larga que la de un sistema CRISPR típico. El equipo de investigación aún no ha demostrado que pueda reconocer el ADN objetivo, y mucho menos cortar, copiar o reescribir genes.
El experimento solo progresó hasta ARN cortos
Luego de descubrir las secuencias repetitivas, el equipo de investigación analizó primero un conjunto de datos sobre procesos de infección disponibles públicamente.
Los datos muestran que tras la infección de bacterias por un bacteriófago llamado SA1, el conjunto de ARN ART se transcribe en grandes cantidades. A los 15 minutos de la infección, estos ARN representan aproximadamente el 8% del ARN total del bacteriófago y se encuentran entre los transcritos con mayor expresión en ese momento.
Estas conclusiones se basan en un reanálisis de los datos existentes, no en nuevos experimentos húmedos realizados por Anthropic.
Posteriormente, los investigadores expresaron el conjunto de secuencias SA1 ART en E. coli. El experimento observó nuevamente un grupo de ARN cortos bien definidos, lo que demuestra que estas secuencias repetitivas pueden transcribirse.
El hecho de que se transcriban no implica que tengan una función demostrada. Aún se desconoce si estos ARN cortos actúan en conjunto con transcriptasas inversas o proteínas asociadas, qué papel desempeñan en el ciclo de vida del fago y si pueden ser utilizados como herramientas biotecnológicas.
¿Por qué anunciarlo ahora?
Este resultado es actualmente una versión preliminar y no ha sido sometido a revisión por pares. Anthropic tampoco esperó a que se completaran los estudios funcionales de ART antes de publicarlo.
En su comunicado, Anthropic declaró que ahora hace público este trabajo aún sin resolver para demostrar las capacidades de Claude, informar al mundo exterior sobre la dirección de la investigación del equipo e invitar a los científicos a participar en la colaboración.
Hace apenas unos días, Anthropic confirmó la creación de su propio laboratorio de biología molecular en el Área de la Bahía de San Francisco. El laboratorio se dedicará exclusivamente a la investigación de bajo riesgo en los niveles BSL-1 y BSL-2 y no manipulará patógenos que puedan infectar a los humanos; todas las operaciones prácticas seguirán siendo realizadas por científicos.
Anthropic intenta trasladar a Claude, desde la recuperación de literatura y el análisis de datos, al ciclo real de investigación científica: la IA busca datos, propone candidatos y diseña experimentos, mientras que los humanos son responsables de ejecutar los experimentos, comprobar los resultados y, a continuación, devolver los nuevos datos a la IA para su análisis.
El director ejecutivo, Dario Amodei, calificó a ART como un descubrimiento liderado por Claude y afirmó que sería algo de lo que se sentiría orgulloso durante sus estudios de doctorado. Asimismo, declaró explícitamente que las funciones específicas, las aplicaciones prácticas y la importancia final de ART aún no están claras.
Considera este trabajo como un primer intento de acelerar la investigación biológica con IA, más que como una novedosa herramienta de edición genética. En el futuro, Claude podría controlar equipos experimentales con medidas de seguridad, pero Anthropic aún no ha permitido que la IA opere directamente los experimentos.
La empresa se está preparando para una oferta pública inicial (OPI), lo que proporciona un contexto para comprender su demostración de capacidades de investigación; sin embargo, los materiales existentes no prueban que el lanzamiento de ART en este momento haya sido impulsado directamente por el plan de OPI.
Feng Zhang: “Vale la pena seguir estudiándolo”
Luego de revisar la versión preliminar, Feng Zhang valoró positivamente el papel de Claude en este trabajo:
“Este es un ejemplo fascinante de cómo los agentes de IA pueden contribuir a los descubrimientos biológicos. Identificar la secuencia repetitiva de ARN asociada a la transcriptasa inversa es realmente interesante y merece una investigación más profunda.”
El punto clave de esta afirmación es que “merece un estudio más profundo”. Confirma el valor de la pista para la investigación, pero no verifica la función de ART, y mucho menos la define como la próxima generación de CRISPR.
En los últimos años, equipos de investigación humana han descubierto varios sistemas biológicos programables, como VIPR y Fanzor. El equipo de Stanford también utilizó recientemente modelos de lenguaje genómico para estudiar otro sistema de transcriptasa inversa. Este y ART son sistemas diferentes que evolucionaron por separado y utilizan métodos distintos.
Estos estudios no niegan la novedad de la ART en sí misma, pero recuerdan que la transcriptasa inversa y los conjuntos de secuencias no codificantes se están convirtiendo en líneas de investigación activas. Claude no descubrió el sucesor de CRISPR solo en un terreno inexplorado.
Su tarea consiste en seleccionar, entre una enorme cantidad de datos existentes, una pista que justifique la continuación del experimento. Aún queda por determinar qué es exactamente la ART mediante experimentos adicionales realizados por humanos, tubo por tubo.
Descubre más desde CIBERED
Suscríbete y recibe las últimas entradas en tu correo electrónico.



