Investigadores de TU Darmstadt y UKP Lab publicaron OctoLong, un pipeline de ingeniería de contexto que soluciona un punto ciego en datos de entrenamiento de contexto largo: los corpora de código casi nunca capturan cadenas de dependencias entre repositorios. Lanzado el 5 de agosto, el artículo presenta una pila de tres herramientas—parser AST, backend servidor de lenguaje y gestor de paquetes—que recorre recursivamente grafos de importación y referencias de símbolos para ensamblar contextos de entrenamiento de millones de tokens.

Los corpora tradicionales de contexto largo dependen de libros, artículos académicos y volcados de código de repositorios únicos. Ninguno contiene la lógica entre módulos y entre paquetes que los agentes de código encuentran en producción. Cuando una llamada a función atraviesa cuatro bibliotecas upstream, los agentes deben resolver esa lógica en su totalidad. El pipeline de OctoLong hace esto: comienza desde un símbolo de punto de entrada, recorre el grafo de referencias del servidor de lenguaje, incorpora paquetes importados transitivamente y repite recursivamente hasta que se alcance el presupuesto de contexto.

La mezcla de entrenamiento resultante totaliza aproximadamente 50B tokens. Los contextos entre repositorios específicos de OctoLong representan 6.2B tokens—12% del total. La suite de modelos OctoLong-Instruct se entrena en esta mezcla mediante extensión de contexto mid-training, luego se fine-tunea con ~10B tokens de datos de instrucción. Los modelos abarcan de 600M a 14B parámetros, haciendo que las ganancias sean reproducibles en diferentes presupuestos de inferencia en lugar de confinadas a checkpoints en escala frontier.

Las evaluaciones en 18 LMs de contexto largo open-weight muestran que reemplazar el 12% del corpus de entrenamiento con datos OctoLong mejora la recuperación de largo alcance, el seguimiento de estado a largo plazo, la comprensión de código a nivel de repositorio y el desempeño de tareas agentic. La precisión de uso de API en escenarios de codificación sin contexto largo también mejora, sugiriendo que la señal de entrenamiento entre repositorios se generaliza en lugar de sobreajustarse al recall tipo aguja-en-pajar.

OctoLong no es proprietario. La metodología orquesta herramientas estándar de desarrollador. Cualquier equipo con acceso a un servidor de lenguaje (Pyright, rust-analyzer, clangd) y un gestor de paquetes puede replicar el pipeline contra sus propios repositorios de código. Esto importa para profesionales que afinen agentes de código específicos de dominio—equipos de infraestructura financiera, ingenieros de compiladores, desarrolladores de sistemas embarcados—que necesitan estructuras de dependencias representativas de sus propios stacks.

Dos límites merecen atención. Primero, los contextos alcanzan millones de tokens durante la curación, pero el artículo no detalla completamente las longitudes en las que se evalúan los modelos entrenados; los equipos de producción deben hacer benchmarking en longitudes de contexto de implementación real. Segundo, la recuperación recursiva de referencias asume un servidor de lenguaje configurado correctamente, un requisito no trivial para repositorios políglotas o codebases legadas con información de tipo incompleta.

Para equipos que planean fine-tuning de extensión de contexto de agentes de codificación a nivel de repositorio: la tasa de sustitución de datos es el mecanismo. Reemplazar el 12% de una mezcla de 50B tokens con cadenas entre repositorios construidas con AST/servidor-de-lenguaje impulsa las ganancias. El pipeline es metodología abierta; el costo es infraestructura de servidor de lenguaje, no una licencia proprietaria.