GravityOCR, um modelo de difusão AR-block com parâmetros compartilhados da Trillion Labs e Korea University, alcança 3.94× de aceleração apenas em decodificação em recortes de regiões de documentos e 1.32× de aceleração end-to-end no processamento de páginas ao separar o drafting paralelo de tokens da verificação causal, segundo um preprint no arXiv. O modelo commita uma média de 9.7 tokens de saída por forward pass em servimento SGLang enquanto mantém 99.7% da precisão do modelo GLM-OCR original no OmniDocBench v1.6.

O problema central que GravityOCR resolve é um modo de falha na decodificação de difusão paralela direta: quando múltiplos tokens são preditos simultaneamente a partir de um bloco parcialmente mascarado, cada token é predito antes dos outros serem conhecidos, e commitar diretamente pode introduzir erros estruturais—omissões, repetições ou markup malformado. O paper ilustra isso com um decodificador paralelo baseado em confiança que commita "commercial" e "enter" enquanto a posição intermediária permanece não resolvida, omitindo "vehicles" da saída.

GravityOCR adapta um modelo OCR AR causal pré-treinado (GLM-OCR) em uma arquitetura com parâmetros compartilhados que suporta tanto drafting de difusão em bloco quanto verificação AR causal. O modelo adiciona apenas um embedding aprendido para um token de máscara; nenhuma rede de drafting separada ou cabeça auxiliar é necessária. Durante treinamento conjunto, um único forward pass processa três fluxos de resposta condicionados na mesma imagem e prompt: um fluxo limpo para supervisão causal de próximo token, e dois fluxos corrompidos complementares com razões de mascaramento t e 1−t para supervisão de denoising. Isso garante que cada token de resposta receba supervisão de denoising em exatamente um fluxo corrompido enquanto tokens de imagem e prompt nunca são mascarados.

Em inferência, a decodificação auto-especulativa funciona em rodadas. Cada rodada começa a partir do último token commited, seguido por 32 tokens de máscara. O decodificador compartilhado produz o próximo token AR causal e 32 tokens draft paralelos em um único forward pass. Um pass de verificação então alimenta o token causal mais os tokens draft através do modelo sob atenção causal em nível de token, produzindo predições AR. O decodificador aceita o prefixo draft mais longo que corresponde às predições AR, commiting esses tokens mais o próximo token AR. Este design preserva a saída AR causal greedy exata enquanto permite que drafts bem-sucedidos avancem a geração por múltiplos tokens.

O paper relata resultados no OmniDocBench v1.6, um benchmark de 1,651 páginas. GravityOCR alcança um score Overall de 95.16, comparado com 95.48 para o GLM-OCR original, mantendo qualidade dentro de 0.32 pontos. Em servimento SGLang em um único H100, a decodificação auto-especulativa atinge 1,047 tok/s de throughput apenas em decodificação e 844 tok/s de throughput end-to-end incluindo codificação de visão e prefill de prompt, comparado com 794 tok/s e 486 tok/s para decodificação AR causal—uma aceleração de 1.32× no processamento end-to-end de páginas. O modelo alcança 0.730 páginas/s, superando MinerU2.5-Pro em 0.399 páginas/s e HunyuanOCR-1.5 com DFlash em 0.579 páginas/s.

O paper otimiza ainda mais o modelo treinado conjuntamente usando GRPO aplicado apenas através do caminho AR causal, com recompensas OCR cientes da tarefa: similaridade de edição normalizada para texto simples, TEDS ciente de estrutura combinado com similaridade de conteúdo de célula para tabelas, e similaridade de edição LaTeX canonicalizada para fórmulas. GRPO melhora o score Overall do OmniDocBench de 94.92 para 95.16 enquanto tokens por forward permanecem essencialmente inalterados em 9.61 e 9.68, indicando que o acordo drafter-verifier é preservado. A perda AR em si é crítica: removê-la reduz o score Overall de 95.02 para 93.64 enquanto TPF permanece similar, mostrando que o objetivo AR preserva a precisão do verifier com pouca mudança na eficiência de drafting.

A aceleração varia por tipo de conteúdo. Regiões de tabela aceitam 25.0 dos 32 tokens drafted por rodada e alcançam 3.36× de aceleração, comparado com regiões de texto aceitando 15.0 tokens e alcançando 1.54× de aceleração. Isso reflete restrições sintáticas mais fortes em saídas estruturadas. Em tamanhos de batch maiores, a vantagem se estreita: a decodificação auto-especulativa lidera por 1.85× em tamanho de batch um mas apenas 1.13× em tamanho de batch 64, já que batching expõe mais trabalho paralelo do decodificador AR e melhora a utilização de GPU.

O insight arquitetônico chave—AR com parâmetros compartilhados e difusão em bloco com verificação causal—contorna a perda de precisão do commitment paralelo direto sem exigir uma rede de drafting separada. Para equipes implantando modelos vision-language em tarefas de saída estruturada, este padrão oferece uma forma implantável de extrair paralelismo de geração fundamentada sem sacrificar qualidade.