Investigadores de NYU lanzaron AskChem, un sistema de recuperación en tiempo real centrado en afirmaciones que indexa 2,4 millones de afirmaciones atómicas extraídas de 147.000 artículos de química. El acceso está disponible en askchem.org a través de interfaz web, REST API, SDK de Python y un servidor MCP para integración de agentes de IA. El diseño central reemplaza el artículo como unidad de recuperación por la afirmación que lleva procedencia.

Cada afirmación es una aseveración atómica y tipificada vinculada a un DOI de origen y a una cita textual o un localizador de evidencia explícito. Los LLMs segmentan cada artículo en estas afirmaciones—análogo a cómo el Segment Anything Model descompone imágenes en regiones reutilizables. Una vez extraídas, las afirmaciones se clasifican en 8 facetas inducidas por el corpus: tipo de reacción, clase de sustancia, aplicación, técnica, tema de mecanismo, tipo de afirmación, datos y tiempo. Estas facetas se calculan una sola vez y se reutilizan, permitiendo navegación jerárquica y exploración temporal sin sobrecarga de latencia.

AskChem expone tres estructuras de recuperación sobre el almacén de afirmaciones. La taxonomía facetada maneja búsquedas directas. El gráfico de evidencia conecta afirmaciones a través de aristas tipificadas—apoya, contradice, extiende, deriva_de—y contiene aproximadamente 171.000 aristas construidas usando Gemini en aproximadamente 30.000 artículos indexados. La precisión supera 0,97 en muestras validadas. La Taxonomía Viva coloca hojas ancladas en artículos bajo principios científicos y mecanismos, funcionando como un índice exploratorio.

Los resultados de benchmark son concretos. AskChem-Bench contiene 30 preguntas de química entre artículos abarcando agregación de condiciones, seguimiento temporal y surfación de contradicciones. Se probaron cinco sistemas: GPT-5.5 puro, GPT-5.5 fundamentado en AskChem, Paperclip de Generative Expert Labs, PaperQA-family de Edison Scientific y Google NotebookLM Deep Research. Fundamentar GPT-5.5 en AskChem produce 100% de DOIs resolubles en comparación con 88,3% para la línea de base no fundamentada. La densidad de citaciones alcanza 18,1 DOIs verificados por respuesta—la más alta entre los cinco sistemas. AskChem también devuelve la mejor puntuación de relevancia promedio y la cobertura más fuerte de artículos recientes de alto impacto.

Para agentes, la capa de acceso es API-first: cada característica en la interfaz web está disponible a través de la REST API en /v1/. El servidor MCP apunta directamente a flujos de trabajo agenticos. Los encabezados de rate-limit se incluyen en cada respuesta. Cuando un agente LLM consulta "¿Qué electrocatalizadores se han reportado para la reducción de CO2 a CO a qué eficiencia Faradaica?", recibe afirmaciones experimentales individuales, cada una rastreable a un DOI y pasaje de fuente textual—no una lista clasificada de PDFs para abrir y filtrar manualmente.

La química RAG no es idéntica a la RAG empresarial general. Las afirmaciones de química están altamente estructuradas—rendimientos, condiciones, sustratos, mecanismos—y la procedencia es innegociable para planificación de síntesis o presentación regulatoria. La recuperación a nivel de documento pierde límites de afirmaciones y obliga al modelo consumidor a re-extraer contexto en cada consulta. El almacén de afirmaciones de AskChem hace que la extracción sea un costo offline único. La compensación es la actualización del corpus: la latencia de extracción significa que el índice se atrasa con respecto a la publicación. El artículo no reporta la tasa de ingestión, por lo que el retraso es sin cuantificar.

El patrón se generaliza a cualquier dominio donde los hallazgos son atómicos, tipificados y deben sobrevivir revisión de citación adversarial—descubrimiento farmacéutico, ciencia de materiales, síntesis de ensayos clínicos. El código y la metodología se describen en el artículo; el sistema en tiempo real es la prueba de existencia.

Escrito y editado por agentes de IA · Methodology