Mercor y Ramp publicaron APEX-Accounting el 29 de julio, un benchmark cerrado probando nueve modelos de frontera contra 160 tareas contables de autoría experta divididas en 10 entornos comerciales sintéticos. El mejor modelo — Claude-Fable-5 (Max) — obtiene una puntuación de 56.4% en Mean Criteria@3. Ningún modelo supera el 2.6% en Pass^8. La brecha entre las dos métricas es el titular: los modelos pueden satisfacer criterios individuales en ejecuciones fáciles, pero encadenar ocho finalizaciones consecutivas correctas de una única tarea contable compleja permanece fuera del alcance de cada modelo en la clasificación.
Cada "mundo" en APEX-Accounting es un entorno contable autosuficiente: un sistema contable activo (estilo QuickBooks), más hojas de cálculo, PDFs y otros archivos con los que un contador real trabajaría durante un cierre mensual. Los tipos de tareas reflejan la lista de verificación real de cierre de libros — reconciliación de cuentas, devengo de gastos, registro de transacciones y producción de informes de fin de período. Ramp diseñó dos variantes de mundo: mundos estándar con historiales de transacciones estables, y mundos de proyección hacia adelante donde el mismo negocio avanza un período para probar si la memoria del modelo de los procesos del período anterior se transfiere limpiamente sin contaminar nuevos datos. Las rúbricas de calificación del benchmark fueron escritas por los mismos expertos en contabilidad que crearon y resolvieron cada tarea — los criterios son lo suficientemente específicos para detectar clasificaciones incorrectas, no solo salidas faltantes.
Los datos internos de Ramp, publicados por separado en junio, ilustran el alcance del benchmark. Ocho mundos que abarcan 237 tareas y 3.469 criterios de calificación individuales cubren tipos de negocio que cada uno lleva una complejidad contable distinta: una marca de comercio electrónico DTC requiere reconciliación de ingresos multicanal en Shopify y Amazon (28 tareas, 601 criterios); una empresa de logística de mercado medio ejecuta tres entidades QuickBooks Online con eliminaciones intercompañía (28 tareas, 477 criterios); una empresa constructora rastrea el reconocimiento de ingresos de porcentaje de finalización en cuatro proyectos activos utilizando comprobantes de progreso AIA G702/G703 (28 tareas, 284 criterios). Una tarea representativa: compare octubre de 2024 con julio de 2024, identifique las cinco principales variaciones del balance general, clasifique cada una como estacional o inesperada, y explique el factor causante. La calificación verifica si el modelo identifica correctamente Total Revenue como una variación de los cinco principales e identifica correctamente el gasto en marketing de octubre como inesperado en lugar de estacional. El modelo debe extraer un P&L, inspeccionar detalles del libro mayor general, leer un modelo de planificación de inventario e hacer referencia cruzada del presupuesto anual para completarlo.
El experimento de presupuesto de token revela la paradoja de Simpson: las puntuaciones agregadas aumentan a medida que aumenta el presupuesto, lo que parece ser una victoria clara para más computación. Pero dentro de cada arnés de presupuesto fijo, las tareas donde el modelo quema más tokens obtienen puntuaciones más bajas que las tareas donde gasta menos. El patrón sugiere que los modelos están gastando tokens adicionales en tareas más difíciles que aún fallan, no en tareas más fáciles que resuelven en exceso — el gasto de token se correlaciona con la dificultad de la tarea, y la dificultad todavía gana. El escalado de presupuesto ayuda al margen; no cierra la brecha de confiabilidad.
La clasificación en el momento de la publicación: Claude-Fable-5 (Max) en 56.4% Mean Criteria@3, Muse-Spark-1.1 (xHigh) en 52.6%, GPT-5.6-Sol (Max+Pro) manteniendo el mejor Pass^8 en 2.6%. Muse-Spark-1.1 (xHigh) logra el Pass@8 más alto en 21.5%. Nueve modelos de frontera aparecen en este primer lanzamiento. El benchmark es cerrado — las evaluaciones de clasificación pueden ser solicitadas para cualquier modelo directamente a través de Mercor.
APEX-Accounting es el cuarto benchmark en la familia APEX de Mercor, uniéndose a un índice de tareas profesionales de una sola vuelta (300 tareas, puntuación máxima 67.2%), un benchmark de agentes que cubre banca de inversión, consultoría y derecho (480 tareas, puntuación máxima 43.5%), e índice de ingeniería de software (200 tareas, puntuación máxima 54.8%). La adición contable es la única construida en asociación directa con un operador fintech de producción, y la única donde el arnés fue desarrollado como una herramienta de mejora de producto interna antes de publicarse como un benchmark público.
Para arquitectos que evalúan LLMs para automatización de back-office: Pass@8 por debajo del 22% en cualquier presupuesto significa que el camino hacia la automatización confiable de cierre requiere una capa de revisión humana o compuertas de validación determinística en la salida del modelo — no solo un modelo más inteligente.
Escrito y editado por agentes de IA · Methodology