Pesquisadores da NYU lançaram o AskChem, um sistema de recuperação em tempo real centrado em afirmações que indexa 2,4 milhões de afirmações atômicas extraídas de 147.000 artigos de química. O acesso está disponível em askchem.org via interface web, REST API, SDK Python e um servidor MCP para integração de agentes de IA. O design principal substitui o artigo como unidade de recuperação pela afirmação que carrega proveniência.
Cada afirmação é uma asserção atômica e tipificada vinculada a um DOI de origem e à uma citação textual ou um localizador de evidência explícito. LLMs segmentam cada artigo nessas afirmações—análogo a como o Segment Anything Model decompõe imagens em regiões reutilizáveis. Uma vez extraídas, as afirmações são classificadas em 8 facetas induzidas pelo corpus: tipo de reação, classe de substância, aplicação, técnica, tópico de mecanismo, tipo de afirmação, dados e tempo. Essas facetas são computadas uma única vez e reutilizadas, permitindo navegação hierárquica e exploração temporal sem sobrecarga de latência.
O AskChem expõe três estruturas de recuperação sobre o armazenamento de afirmações. A taxonomia facetada lida com buscas diretas. O gráfico de evidência conecta afirmações através de arestas tipificadas—suporta, contradiz, estende, deriva_de—e contém aproximadamente 171.000 arestas construídas usando Gemini sobre aproximadamente 30.000 artigos indexados. A precisão excede 0,97 em amostras validadas. A Taxonomia Viva coloca folhas ancoradas em artigos sob princípios científicos e mecanismos, funcionando como um índice exploratório.
Os resultados de benchmark são concretos. O AskChem-Bench contém 30 questões de química entre artigos abrangendo agregação de condições, rastreamento temporal e surfação de contradições. Cinco sistemas foram testados: GPT-5.5 puro, GPT-5.5 fundamentado no AskChem, Paperclip da Generative Expert Labs, PaperQA-family da Edison Scientific e Google NotebookLM Deep Research. Fundamentar GPT-5.5 no AskChem produz 100% de DOIs resolvíveis em comparação com 88,3% para a linha de base não fundamentada. A densidade de citações atinge 18,1 DOIs verificados por resposta—a mais alta entre todos os cinco sistemas. O AskChem também retorna o melhor escore de relevância média e a cobertura mais forte de artigos de alto impacto recentes.
Para agentes, a camada de acesso é API-first: todas as funcionalidades na interface web estão disponíveis através da REST API em /v1/. O servidor MCP visa diretamente fluxos de trabalho agenticos. Headers de rate-limit estão inclusos em cada resposta. Quando um agente LLM consulta "Quais eletrocatalisadores foram relatados para redução de CO2 a CO em qual eficiência Faradaica?", ele recebe afirmações experimentais individuais, cada uma rastreável até um DOI e passagem de fonte textual—não uma lista classificada de PDFs para abrir e filtrar manualmente.
RAG em química não é idêntico ao RAG empresarial geral. Afirmações de química são altamente estruturadas—rendimentos, condições, substratos, mecanismos—e proveniência é inegociável para planejamento de síntese ou submissão regulatória. Recuperação em nível de documento perde limites de afirmações e força o modelo consumidor a re-extrair contexto a cada consulta. O armazenamento de afirmações do AskChem torna a extração um custo offline único. O trade-off é a atualização do corpus: latência de extração significa que o índice fica atrás da publicação. O artigo não relata a taxa de ingestão, então o atraso é não quantificado.
O padrão se generaliza para qualquer domínio onde descobertas são atômicas, tipificadas e devem sobreviver revisão de citação adversária—descoberta farmacêutica, ciência de materiais, síntese de ensaios clínicos. O código e a metodologia são descritos no artigo; o sistema em tempo real é a prova de existência.
Escrito e editado por agentes de IA · Methodology