GravityOCR, un modelo de difusión AR-block con parámetros compartidos de Trillion Labs y Korea University, logra una aceleración de decodificación de 3.94× en regiones de documentos y una aceleración de procesamiento de página de 1.32× de extremo a extremo al separar la generación paralela de tokens de la verificación causal, según un preprint de arXiv. El modelo genera un promedio de 9.7 tokens de salida por pasada hacia adelante en servicio SGLang mientras mantiene 99.7% de la precisión del modelo GLM-OCR original en OmniDocBench v1.6.

El problema central que GravityOCR resuelve es un modo de fallo en la decodificación de difusión paralela directa: cuando múltiples tokens se predicen simultáneamente desde un bloque parcialmente enmascarado, cada token se predice antes de que los otros sean conocidos, y comprometerse con ellos directamente puede introducir errores estructurales—omisiones, repeticiones o marcado malformado. El artículo ilustra esto con un decodificador paralelo basado en confianza que genera "commercial" y "enter" mientras la posición intermedia permanece sin resolver, finalmente omitiendo "vehicles" de la salida.

GravityOCR adapta un modelo OCR AR causal preentrenado (GLM-OCR) en una arquitectura con parámetros compartidos que soporta tanto generación de difusión en bloques como verificación AR causal. El modelo añade solo una incrustación aprendida para un token de máscara; no se requiere red de generación separada ni cabeza auxiliar. Durante el entrenamiento conjunto, una única pasada hacia adelante procesa tres flujos de respuesta condicionados en la misma imagen y prompt: un flujo limpio para supervisión de siguiente token causal, y dos flujos corruptos complementarios con ratios de enmascaramiento t y 1−t para supervisión de denoising. Esto asegura que cada token de respuesta reciba supervisión de denoising en exactamente un flujo corrupto mientras los tokens de imagen y prompt nunca se enmascaran.

En inferencia, la decodificación auto-especulativa funciona en rondas. Cada ronda comienza desde el último token generado, seguido de 32 tokens de máscara. El decodificador compartido produce el siguiente token AR causal y 32 tokens de generación paralela en una única pasada hacia adelante. Una pasada de verificación luego alimenta el token causal más los tokens de generación a través del modelo bajo atención causal a nivel de token, produciendo predicciones AR. El decodificador acepta el prefijo de generación más largo que coincida con las predicciones AR, generando esos tokens más el siguiente token AR. Este diseño preserva la salida AR causal greedy exacta mientras permite que generaciones exitosas avancen la generación por múltiples tokens.

El artículo reporta resultados en OmniDocBench v1.6, un benchmark de 1,651 páginas. GravityOCR logra una puntuación General de 95.16, comparado con 95.48 para el GLM-OCR original, manteniendo calidad dentro de 0.32 puntos. En servicio SGLang en una H100, la decodificación auto-especulativa alcanza 1,047 tok/s de rendimiento de decodificación y 844 tok/s de rendimiento de extremo a extremo incluyendo codificación de visión y prefill de prompt, comparado con 794 tok/s y 486 tok/s para decodificación AR causal—una aceleración de procesamiento de página de 1.32× de extremo a extremo. El modelo logra 0.730 páginas/s, superando MinerU2.5-Pro en 0.399 páginas/s y HunyuanOCR-1.5 con DFlash en 0.579 páginas/s.

El artículo optimiza además el modelo entrenado conjuntamente usando GRPO aplicado solo a través de la ruta AR causal, con recompensas OCR conscientes de la tarea: similitud de edición normalizada para texto plano, TEDS consciente de estructura combinado con similitud de contenido de celda para tablas, y similitud de edición LaTeX canonicalizada para fórmulas. GRPO mejora la puntuación General de OmniDocBench de 94.92 a 95.16 mientras tokens por pasada hacia adelante permanecen esencialmente sin cambios en 9.61 y 9.68, indicando que el acuerdo generador-verificador se preserva. La pérdida AR en sí es crítica: removerla reduce la puntuación General de 95.02 a 93.64 mientras TPF permanece similar, mostrando que el objetivo AR preserva la precisión del verificador con poco cambio en la eficiencia de generación.

La aceleración varía por tipo de contenido. Las regiones de tabla aceptan 25.0 de los 32 tokens generados por ronda y logran aceleración de 3.36×, comparado con regiones de texto aceptando 15.0 tokens y logrando aceleración de 1.54×. Esto refleja restricciones sintácticas más fuertes en salidas estructuradas. En tamaños de lote más altos, la ventaja se reduce: la decodificación auto-especulativa lidera por 1.85× en tamaño de lote uno pero solo 1.13× en tamaño de lote 64, ya que el lote expone más trabajo paralelo del decodificador AR y mejora la utilización de GPU.

La idea arquitectónica clave—difusión AR-block con parámetros compartidos y verificación causal—evita la pérdida de precisión del compromiso paralelo directo sin requerir una red de generación separada. Para equipos desplegando modelos de visión-lenguaje en tareas de salida estructurada, este patrón ofrece una forma desplegable de extraer paralelismo de generación fundamentada sin sacrificar calidad.