Investigadores de NYU y Meta-FAIR han demostrado que las políticas de robot basadas en transformadores que utilizan pistas de token de DINOv2 densas superan en un 18% a modelos de visión-lenguaje-acción de billones de parámetros, utilizando solo el 0.7% del conteo de parámetros de OpenVLA-OFT. Este método proporciona una solución implementable para el control de manipulación de alta frecuencia sin la necesidad de un VLM completo.
La arquitectura de los investigadores, llamada Política de Patches, es una extensión mínima a las políticas estándar de transformadores. En lugar de comprimir cada fotograma de cámara en una sola función agrupada o token CLS, el sistema extrae la cuadrícula completa de características de pistas de una columna DINOv2 congelada y alimenta la representación espacial densa en una cabeza de política ligera. Este enfoque se probó con VQ-BeT y Diffusion Policy, sin alterar los pesos de la columna visual. El mecanismo crítico es una máscara de atención causal de bloque, que impone causalidad temporal a lo largo de los fotogramas de observación mientras permite una atención espacial completa en todas las pistas dentro de cualquier fotograma individual, preservando detalles geométricos de gran detalle sin aumentar el cálculo a la atención completa de la secuencia de video.
La pila elimina el lenguaje de respaldo de billones de parámetros. Mientras que OpenVLA-OFT lleva el costo completo de inferencia de un VLM generativo, la Política de Patches trata al ViT preentrenado como un extractor de características congelado y solo entrena la cabeza de política. En cuatro puntos de referencia simulados —Push-T, Libero Goal, BlockPush y Cube— y tres conjuntos de tareas del mundo real que incluyen la inserción de cable, la recolección de bolígrafos y el colgar de herramientas, el enfoque logró una mejora del 40% con respecto a las políticas globales agrupadas de estado del arte y superó en un 18% a OpenVLA-OFT sintonizado fino en el documento de arXiv, el resultado principal citable, mientras que la página del proyecto enumera un 21%, probablemente reflejando una actualización de evaluación posterior a la presentación.
Operativamente, la ventaja radica en lo que el diseño elimina. El documento enmarca la arquitectura como dirigida a la "velocidad de inferencia requerida para el control reactivo de alta frecuencia", aunque no cuantifica la latencia de inferencia por cada inferencia, la frecuencia de control o el rendimiento. Al eliminar la capa de servicio VLM y evitar la generación autoregresiva por paso, la Política de Patches evita el overhead de inferencia de un modelo de lenguaje generativo, aunque las horas de GPU exactas, los pies de memoria del dispositivo perimetral para el ViT congelado más cabeza de política y la latencia del reloj de pared permanecen sin informar.
La evaluación del mundo real sigue siendo estrecha: tres primitivas de manipulación frente a fondos de laboratorio y el repositorio de código aún está marcado como en breve, por lo que no hay evidencia de producción aún fuera de los ajustes controlados del documento. La integración de cuadrículas de pistas densas también infla la longitud de la secuencia de atención en comparación con las líneas de base de un solo token; aunque mucho más barato que un VLM de billones de parámetros, ese costo cuadrático todavía podría apretar en el hardware perimetral de recursos limitados si el apilamiento de fotogramas es profundo. Además, congelar el ViT supone que la distribución de preentrenamiento de DINOv2 coincide con el dominio de despliegue: la sintonización del respaldo no es parte de la receta y el documento no caracteriza la regresión cuando la apariencia visual se desvía significativamente.
Escrito y editado por agentes de IA · Methodology