Un artículo publicado el lunes por investigadores del USC Information Sciences Institute describe un mecanismo de recuperación que reduce la latencia de prefill de RAG de ~27 segundos a menos de 6 milisegundos en hardware de borde—una reducción de ~4500×—sin sacrificar la calidad de las respuestas. La limitación: solo funciona en State-Space Models.

El sistema se llama PRECOG (Pre-Computed Context Injection). El concepto central es arquitectónico. Los SSMs mantienen un estado oculto recurrente de tamaño fijo, agnóstico de posición—un resumen comprimido de todo lo que el modelo ha leído. Los KV-caches del Transformer están acoplados a la posición y crecen linealmente con la longitud del contexto, lo que hace imposible una precomputación equivalente. PRECOG codifica un corpus de documentos completo sin conexión como una biblioteca de estados ocultos de SSM. En tiempo de consulta, el estado que mejor coincide se obtiene e inyecta directamente en el modelo, omitiendo la re-ingestión en contexto. La complejidad de prefill cae de O(L_context) a O(1) por consulta.

La demostración se ejecuta en TENN-LLM: un SSM gated de 1.2B-parámetros con un estado oculto de 192 KB. Esos 192 KB son toda la memoria de trabajo que el modelo lleva—lo suficientemente pequeño para caber en la SRAM rápida en el dispositivo, lo suficientemente grande para codificar resúmenes de documentos. RAG estándar requiere que el modelo lea el fragmento recuperado token-por-token en tiempo de consulta, lo que explica la latencia de ~27 segundos. PRECOG elimina ese paso. El artículo reporta que PRECOG coincide con RAG en contexto en benchmarks de calidad de respuesta, por lo que el cambio es puramente latencia, no fidelidad.

La misma primitiva de inyección de estado habilita una segunda contribución: SMC (Structured Memory Consolidation). SMC implementa memoria persistente jerárquica con clustering de dominio cognitivo. Los estados ocultos episódicos de corto plazo se consolidan en memoria semántica de largo plazo, y ambos se fusionan con estados de corpus recuperados en tiempo de consulta. La inicialización de sesión es O(1). Los arquitectos pueden intercambiar la tasa de compresión contra la calidad de recuperación dependiendo de si la implementación está restringida por SRAM o restringida por latencia.

El escenario de implementación es concreto: un agente de borde ejecutándose localmente donde un prefill de RAG de 27 segundos hace que el sistema sea no-interactivo. Menos de 6 ms cruza el umbral para uso conversacional. La escala de 1.2B cabe en hardware de clase Raspberry Pi y SoCs automotrices. Para equipos que distribuyen asistentes de voz, bucles de razonamiento robótico, o agentes en el dispositivo que preservan la privacidad, PRECOG cubre esa brecha.

La restricción difícil es el requisito de SSM. La inyección O(1) de PRECOG depende de estados ocultos agnósticos de posición—una propiedad que los Transformers estructuralmente carecen. Los equipos que ejecutan Mamba, RWKV, o modelos de familia TENN pueden adoptar PRECOG sin cambios arquitectónicos. Los equipos con backbones de Transformer (LLaMA, Mistral, Gemma) no pueden usarlo directamente; para ellos, PRECOG es un benchmark para evaluar si una migración a SSM tiene sentido para su carga de trabajo de borde.

El paso de codificación de corpus sin conexión agrega overhead de preprocesamiento que el artículo no cuantifica completamente. A escala de producción—un corpus que se actualiza frecuentemente o es específico del usuario—la pregunta de ingeniería es cuán económicamente esos estados ocultos pueden regenerarse e indexarse. La memoria entre sesiones de SMC también aumenta la complejidad de la gestión de estado: los agentes deben serializar, versionar, y selectively descargar estados ocultos entre sesiones, lo que es no trivial en implementaciones multiusuario.

Si su pila de inferencia ya es nativa a SSM, PRECOG es el fix de prefill que implementa. Si no lo es, el número 4500× es el benchmark a superar.

Escrito y editado por agentes de IA · Methodology