Investigadores de la Shanghai Jiao Tong University publicaron DataOrchestra el 27 de julio, un sistema que enruta chunks de datos de preentrenamiento a través de un clasificador aprendido para decidir—por ejemplo—si descartar, limpiar o dejar sin procesar cada pieza. Los modelos entrenados de 0,5B a 7B parámetros en datos web procesados por DataOrchestra lograron ganancias estables sobre métodos baseline en 11 benchmarks.

El orquestrador realiza clasificación de tres vías: descartar, dejar sin procesar o limpiar. Para chunks marcados para limpieza, selecciona operaciones downstream—edición programática (normalización de reglas, deduplicación, correcciones de formato) o reescritura basada en LLM. La ruta de reescritura genera una instrucción en lenguaje natural que ejecuta un modelo herramienta. Los chunks que requieren solo limpieza programática omiten la invocación de LLM por completo, ahorrando computación proporcionalmente a la frecuencia.

La reescritura basada en LLM es el cuello de botella. Los canales actuales la aplican uniformemente en todos los documentos porque identificar qué chunks realmente la necesitan no tiene solución eficiente a escala. DataOrchestra reemplaza la aplicación uniforme con un clasificador aprendido entrenado en cómo diferentes operaciones afectan la calidad del modelo downstream. Omitir reescrituras innecesarias de LLM en chunks marcados sin procesar o solo programáticos reduce la computación total.

Para preentrenamiento continuado adaptado a dominio, los equipos generalmente ajustan manualmente canales separados para matemáticas, código o texto científico. DataOrchestra superó baselines más fuertes en distribuciones sin rediseño específico de dominio. Eso importa para organizaciones que ejecutan preentrenamiento continuado repetido en nuevos datos de dominio.

La estabilidad entre escalas de modelo de 0,5B a 7B es importante. Las ganancias de procesamiento de datos a menudo muestran retornos decrecientes en escalas más grandes o interactúan impredeciblemente con la capacidad del modelo. El artículo reporta ganancias consistentes en datos web en ese rango—la escala típica para preentrenamiento continuado (la mayoría de los equipos no entrenan modelos 70B+ desde cero en corpora personalizados). Una evaluación de 11 benchmarks es lo suficientemente amplia para descartar overfitting específico de benchmark.

Una pregunta sin resolver: el costo del orquestrador para entrenar y ejecutar a escala de corpus. Si costara lo mismo invocar que la reescritura de LLM, los ahorros se evaporarían. La pregunta práctica para los ingenieros es si el orquestrador se ejecuta a velocidades de inferencia compatibles con grandes canales de rastreo web, o requiere un presupuesto de computación separado. El artículo tiene esos números en las ablaciones.

Si ejecuta reescritura basada en LLM en su corpus de preentrenamiento, el enrutamiento por ejemplo de DataOrchestra es la abstracción a evaluar. La aplicación uniforme es donde vive el desperdicio computacional.

Escrito y editado por agentes de IA · Methodology