Claude, da Anthropic, identificou um sistema enzimático previamente desconhecido contendo repetições tipo CRISPR ao buscar autonomamente um banco de dados massivo de sequências de DNA, marcando a primeira demonstração concreta de um modelo de fronteira descobrindo um sistema biológico que havia escapado à atenção humana. A descoberta, chamada array-associated reverse transcriptases (ART), emergiu após agentes Claude gastarem 21 horas vasculhando dados genômicos usando aproximadamente 950 instâncias paralelas e 210 milhões de tokens para reduzir 200.000 reverse transcriptases a candidatos dignos de investigação.
O sistema que Claude encontrou consiste em três partes: uma enzima reverse transcriptase (uma proteína que copia RNA em DNA), um gene parceiro e um array de sequências de repetição de DNA espaçadas uniformemente. De acordo com o relato da Anthropic, a própria reverse transcriptase subjacente havia sido identificada em estudos anteriores em um jumbo phage, mas Claude parece ser o primeiro a reconhecer a característica definidora—o array associado de sequências de DNA não-codificantes e uma proteína acessória adicional de função desconhecida. O padrão de repetição se assemelha a um array CRISPR em estrutura, razão pela qual a Anthropic nomeou o sistema ART. Experimentos iniciais mostram que o array ART é expresso como um conjunto de RNAs curtos distintos, sugerindo uma função programável similar aos sistemas CRISPR, embora o mecanismo real permaneça desconhecido.
O fluxo de trabalho da Anthropic demonstra como o modelo foi implantado para essa tarefa. Agentes Claude leram literatura relevante, reproduziram resultados estabelecidos de dados públicos para validar seus métodos, depois buscaram membros da família ou vizinhos genômicos que não se encaixassem em nenhum sistema descrito. O modelo escreveu relatórios legíveis para humanos para cada candidato propondo uma função e descrevendo evidências de apoio. A maioria dos candidatos foi eliminada em análise de acompanhamento onde Claude avaliou criticamente a evidência. Quando um candidato sobreviveu à revisão humana, cientistas da Anthropic o testaram em laboratório, expressando a proteína em cepas padrão e a caracterizando bioquímica e estruturalmente, com Claude ajudando a interpretar os dados.
A escala da busca revela tanto a capacidade quanto o custo computacional. Agentes Claude reuniram mais de 200.000 reverse transcriptases, identificaram 3.500 novos sistemas candidatos e reduziram aqueles a 20 candidatos mais convincentes para análise detalhada. A Anthropic observa que para um cientista humano especialista, esse tipo de análise pode levar semanas a meses de trabalho. A descoberta em si veio quando um agente Claude, ao examinar uma família RT incomum em detalhe, detectou um array de repetição em tandem na sequência de DNA bruta e a sinalizou como potencialmente nova. O agente então contou repetições, mediu espaçamento, comparou o layout com sistemas RT conhecidos e buscou na literatura qualquer relato anterior—tudo sem instrução explícita para fazer isso.
Feng Zhang, um pioneiro de CRISPR no MIT e no Broad Institute, revisou o pré-print e disse que a identificação de arrays de repetição de RNA associados a reverse transcriptases é "genuinamente intrigante e merece investigação adicional". A Anthropic lançou um pré-print técnico com mais detalhes e está compartilhando os achados antecipadamente para demonstrar as capacidades de Claude e dar à comunidade científica mais ampla insight sobre o trabalho.
A parte difícil é o que vem a seguir. A equipe da Anthropic ainda está trabalhando para entender a função primária de ARTs. A descoberta mostra que Claude pode autonomamente detectar anomalias e gerar hipóteses em escala, mas o papel do modelo permanece limitado: cientistas humanos realizaram todo o trabalho de laboratório, interpretaram resultados e fizeram o julgamento final sobre quais candidatos valiam a pena testar. O sistema funciona porque a Anthropic construiu um laboratório dedicado e uma única equipe trabalhando em tudo, desde treinar Claude em biologia até executar experimentos, significando que o loop de feedback entre saída do modelo e validação experimental é apertado e imediato. Para equipes avaliando modelos de fronteira em tarefas específicas de domínio, o aprendizado é que descoberta autônoma requer não apenas um modelo capaz, mas um loop fechado onde expertise humana valida e direciona a saída do modelo em cada estágio.