Una encuesta de 2026 de más de 700 profesionales de IA visual y física de Voxel51 e Dimensional Research revela que la curaduría de datos, no la arquitectura del modelo, es la palanca principal que separa a los equipos de envío de los atascados. Los problemas de datos causan la mayoría de las fallas del modelo; la anotación sigue siendo costosa y derrochadora conforme los equipos etiquetan todo y descartan gran parte antes de la producción. El campo abarca video (63%), nubes de puntos 3D y LiDAR (38%), flujos de sensores de series temporales (42%) y audio (25%), con el 68% de los equipos trabajando en tres o más modalidades.
Los equipos excepcionales (aquellos que constantemente envían a producción on-target) invierten el 58% del tiempo del proyecto en trabajo de datos, versus solo el 21% para equipos en dificultades—casi una brecha de 3x. Entre equipos con modelos ya en producción, el 99% reporta desafíos de conjunto de datos, en comparación con el 96% aún en fase de investigación. El retrabajo de anotación en realidad empeora con la madurez: el 66% de los equipos de producción lo citan como un desafío superior versus el 56% de los equipos de investigación. La conclusión: la madurez trae escala, y la escala hace que la calidad de los datos sea más difícil de ignorar.
El cuello de botella estructural no es la computación o el costo; es la infraestructura de trabajo de datos. Los equipos curam conjuntos de datos con millones de puntos etiquetados y sin etiquetar (23% más de 1 millón por proyecto; 3% más de 1 mil millones). La infraestructura necesaria para admitir gestión de datos multimodal, visualización 3D e fusión de sensores a escala aún está alcanzando la intención del profesional. Como nota un hallazgo, los problemas de datos no disminuyen con la experiencia—se intensifican.
Para arquitectos de IA que envían sistemas de visión y físicos, la implicación es clara: invertir en herramientas de datos y flujos de trabajo de curación temprano, no tarde. Los equipos que avanzan gastan más tiempo en canalizaciones de datos, control de versiones y QA de anotación que en la búsqueda de modelos más grandes o más rápidos.