Databricks anunció FILE, un nuevo tipo de columna nativa ahora en beta que almacena datos no estructurados: documentos, imágenes, audio y video, directamente en tablas Delta Lake junto con metadatos estructurados. A diferencia de los enfoques tradicionales que almacenan archivos en almacenamiento de objetos separado y pierden contexto de gobernanza, las columnas FILE utilizan punteros ligeros a archivos mientras aplican controles de acceso de grano fino de Unity Catalog a filas y columnas. Cuando se elimina una fila que contiene un FILE, el binario en el almacenamiento de objetos también se elimina, haciendo que el cumplimiento de GDPR sea automático.
Las consultas pueden ejecutarse directamente en columnas FILE usando UDF de SQL y Python estándar, activando el procesamiento de archivos solo cuando es necesario. Ejemplo: una empresa de vehículos autónomos almacena videos dashcam como columnas FILE; una UDF de Python muestrea fotogramas en una nueva columna FILE, un modelo de detección de objetos se ejecuta en esos fotogramas, y SQL une los peligros extraídos a metadatos de viaje estructurados, todo sin codificación binaria pesada en la tabla. El rendimiento se escala porque el motor extrae bytes solo en el paso que los solicita, no para cada operación intermedia.
Databricks está trabajando con la comunidad para crear soporte de FILE directamente en Parquet, Delta Lake, Iceberg y Spark, manteniendo datos multimodales portátiles en herramientas. Para equipos de datos que construyen análisis de documentos asistida por agentes, inspección visual, análisis de llamadas y comprensión de video, FILE cierra la brecha entre activos no estructurados y datos gobernados consultables, reduciendo la fricción de canalizaciones de entrenamiento, validación y recuperación.