Pesquisadores da NYU e Meta-FAIR demonstraram que políticas robôs baseadas em transformadores utilizando tokens de patch DINOv2 densos superam modelos de visão-língua-ação de bilhões de parâmetros em 18%, utilizando apenas 0,7% da contagem de parâmetros do OpenVLA-OFT. Este método fornece uma solução viável para o controle de manipulação de alta frequência sem a necessidade de um VLM completo.

A arquitetura dos pesquisadores, chamada de Patch Policy, é uma extensão mínima a políticas de transformadores padrão. Em vez de comprimir cada quadro da câmera em um único recurso agrupado ou token CLS, o sistema extrai a grade completa de recursos de patch de um backbone DINOv2 congelado e alimenta a representação espacial densa em um cabeçalho de política leve. Este método foi testado com VQ-BeT e Diffusion Policy, sem alterar os pesos do backbone visual. O mecanismo crítico é uma máscara de atenção causal de bloco, que impõe causalidade temporal entre quadros de observação enquanto permite atenção espacial total em todos os patches dentro de qualquer quadro único, preservando detalhes finos geométricos sem aumentar o cálculo para atenção de sequência de vídeo completa.

A pilha elimina o backbone de linguagem de parâmetros bilionários. Enquanto o OpenVLA-OFT carrega o custo total de inferência de um VLM gerativo, o Patch Policy trata o ViT pre-treinado como um extrator de recursos congelado e treina apenas o cabeçalho de política. Em quatro benchmarks simulados — Push-T, Libero Goal, BlockPush e Cube — e três conjuntos de tarefas do mundo real, incluindo inserção de cabo, coleta de caneta e pendurar ferramentas, o método alcançou uma melhoria de 40% em relação às políticas agrupadas globais de ponta e superou o OpenVLA-OFT sintonizado em 18% no artigo arXiv, o principal resultado citável, enquanto a página do projeto lista 21%, provavelmente refletindo uma atualização de avaliação pós-envio.

Operacionalmente, a vantagem reside no que o design elimina. O artigo enquadra a arquitetura como direcionando a "velocidade de inferência necessária para controle reativo de alta frequência", embora não quantifique a latência por inferência, frequência de controle ou throughput. Ao remover a camada de serviço VLM e evitar a geração auto-regressiva por etapa, o Patch Policy evita o overhead de inferência de um modelo de linguagem gerativo, ainda que as horas de GPU exatas, os requisitos de memória do dispositivo de borda para o ViT congelado mais cabeçalho de política e a latência do relógio de parede permaneçam não relatadas.

A avaliação do mundo real permanece estreita — três primitivas de manipulação contra fundos de laboratório — e o repositório de código ainda está marcado como em breve, então não há evidência de produção ainda fora dos ambientes controlados do artigo. Integrar grades densas de patches também aumenta o comprimento da sequência de atenção em relação a linhas de base de token único; enquanto muito mais barato do que um VLM de parâmetros bilionários, esse custo quadratico ainda pode apertar em hardware de borda com recursos limitados se o empilhamento de quadros for profundo. Além disso, congelar o ViT assume que a distribuição de pré-treinamento do DINOv2 corresponde ao domínio de implantação — sintonizar o backbone não faz parte da receita e o artigo não caracteriza a regressão quando a aparência visual divergir significativamente.

Escrito e editado por agentes de IA · Methodology