RESEARCHPOR AI|EXPERT SCOUT· viernes, 31 de julio de 2026· 4 MIN DE LECTURA
Primer benchmark de oficina para preciar el trabajo de agentes revela brecha de productividad
100 tareas de suite office (correo, hoja de cálculo, calendario) con rastreo explícito de costos. Evalúa si los agentes pueden completar flujos de trabajo realistas dentro de presupuestos de token—vincula capacidad y economía operativa.
Generative Imagery
La paradoja de la productividad: los agentes vencen a los humanos en costo, se quedan atrás en calidad.FIG. 01
El Agent Frontier Team de Baidu lanzó OmegaUse-OfficeVal el 29 de julio—un benchmark de 100 tareas que ancla la capacidad de agentes en trabajo de oficina real y costos reales. Cada tarea viene con dos señales: tiempo de trabajo humano y un proxy de precio de mercado. Este emparejamiento permite que los líderes de plataforma hagan la pregunta que realmente les importa: ¿puede un LLM completar un flujo de trabajo realista más barato y rápido que un humano, y cuánta calidad sacrificas?
Las 100 tareas abarcan procesamiento de textos, hojas de cálculo, presentaciones y flujos de trabajo entre archivos. Cada una surgió de solicitudes auténticas de profesionales, luego pasó por un pipeline de preservación de privacidad que mantenía la intención y restricciones mientras eliminaba detalles sensibles. Crucialmente, las tareas se enmarcan de la forma que un usuario real las enmarcaría—no como secuencias de API de bajo nivel. Un anotador humano dedica en promedio 2,32 horas por tarea.
La señal económica es la innovación principal. La puntuación ponderada por valor pondera las tasas de finalización de tareas por la importancia económica, en lugar de tratar cada tarea como igual. La evaluación utiliza verificadores determinísticos basados en código, no un juez LLM, lo que significa que el benchmark evita introducir el sesgo de un segundo modelo en la señal. El código completo y el conjunto de datos son de código abierto.
Los resultados muestran un patrón consistente: los LLMs de frontera son sustancialmente más baratos y rápidos que los anotadores humanos, pero ninguno alcanza la calidad de salida a nivel humano. Las ganancias en costo y latencia son reales. La brecha de calidad persiste—la salida aún no coincide con lo que el proxy de precio implica que entregaría un trabajador.
OmegaUse-OfficeVal llena brechas en trabajos existentes. Benchmarks como GDPVal y OSWorld 2.0 o cimentan tareas en categorías ocupacionales amplias, se enfocan en flujos de trabajo sintéticos, o evalúan interacciones a nivel de proceso en lugar de usabilidad del entregable final. Ninguno adjunta anotaciones económicas a nivel de tarea.
Para los líderes de plataforma, la señal práctica es clara: los LLMs ganan en rendimiento y costo por token. Pierden en si la salida puede llegar a los usuarios sin una pasada de revisión humana. Hasta que se cierre esa brecha, los arquitectos que implementan estos agentes necesitan presupuestar gastos generales de revisión. La puntuación ponderada por valor de OmegaUse-OfficeVal cuantifica qué categorías de tarefas hacen que ese overhead valga la pena absorber.