RESEARCHPOR AI|EXPERT SCOUT· martes, 21 de julio de 2026· 4 MIN DE LECTURA
SWE-Pruner Pro Reduce 39% de Uso de Tokens en Agentes de Codificación
SWE-Pruner Pro permite que los agentes de codificación realicen el podado de contexto de forma autónoma, abordando el problema de desbordamiento de contexto que lleva a una mayor latencia y costos en la generación de código de producción y corrección de errores.
Generative Imagery
El podado de tokens reduce la grasa de inferencia de LLM.FIG. 01
SWE-Pruner Pro, un desarrollo que involucra a investigadores de Xiaomi y se detalla en un documento de arXiv, reduce el volumen de tokens de indicación y finalización en hasta un 39% en trayectorias de agentes de codificación de varias vueltas. Reemplaza el middleware de podado de contexto externo con una pequeña cabeza entrenable que lee los estados ocultos propias del marco, eliminando la necesidad de un modelo de puntuación separado y consultas de sugerencias de objetivos por turno.
SWE-Pruner Pro se integra dentro del marco, añadiendo una cabeza de clasificación ligera en los estados ocultos del modelo y una incrustación consciente de la longitud, vinculada al número de líneas de cada herramienta de salida. Este arreglo elimina el modelo auxiliar y la latencia de una pasada adicional a través de un clasificador externo. El enfoque se validó en dos modelos de peso abierto, Qwen3-Coder-Next y el MiMo-V2-Flash de Xiaomi con 309 mil millones de parámetros, en cuatro puntos de referencia de varias vueltas, incluyendo SWE-Bench Verificado y el conjunto Oolong de contexto largo.
Operativamente, en MiMo-V2-Flash, que tiene una línea base del 73.4% en SWE-Bench Verificado y opera a aproximadamente $0.10 por millón de tokens de entrada con una tasa de transferencia de 150 tokens por segundo, SWE-Pruner Pro incrementó la tasa de resolución verificada en 3.8 puntos porcentuales mientras lograba la reducción de tokens. También mejoró la precisión de contexto largo de Oolong en 2.2 puntos. En Qwen3-Coder-Next, SWE-Pruner Pro es el único método que mantiene la calidad mientras reduce los tokens. El documento señala que el overhead de inferencia de la cabeza añadida está limitado pero no proporciona retrocesiones de latencia por llamada en milisegundos. MiMo-V2-Flash ya utiliza una relación de ventana deslizante a atención global de 5:1, reduciendo su caché KV aproximadamente seis veces; SWE-Pruner Pro añade la reducción de tokens sobre esta geometría.
Sin embargo, el método requiere acceso a ganchos de estados ocultos, lo que limita su uso a implementaciones de peso abierto y lo hace incompatible con APIs cerradas sin exposición de estados ocultos del proveedor. Adoptar un nuevo marco también requiere el reentrenamiento de la cabeza por modelo. Si bien el proceso se describe como agnóstico del lenguaje, los puntos de referencia son centrada en Python, con Oolong proporcionando solo una verificación de dominio fuera del lenguaje natural, dejando la generalización entre lenguas sin probar. El SWE-Pruner original demostró una compresión más fuerte en una sola vuelta, hasta 14.84× en LongCodeQA, mientras que los beneficios informados de SWE-Pruner Pro se centran en trayectorias de varias vueltas, dejando en abierto la eficacia en una sola vuelta.
Para los arquitectos que mantienen pipelines de código agente de peso abierto, el mensaje a llevarse es entrenar una pequeña cabeza en los estados ocultos del marco para puntuar la relevancia a nivel de línea, intercambiando un pequeño costo de reentrenamiento por la eliminación de la latencia del middleware y el costo de servicio del modelo.