Un paper publicado en arXiv el 6 de agosto por Boning Li, Yu Chen y Longbo Huang presenta AV-AIVAT, un harness de evaluación que combina la Action-Informed Value Assessment Tool (AIVAT) con Confidence Sequences para benchmarking de agentes. Con una precisión objetivo de ±1 Big Blind y 95% de confianza, los resultados brutos de juegos requieren una mediana 74× más episodios que resultados corregidos por AIVAT para alcanzar una decisión de parada certificada. El experimento abarcó 15 configuraciones de agentes LLM en 71.439 manos pareadas de Heads-Up No-Limit Hold'em (HUNL).
El problema central es estructural. Las evaluaciones de agentes en entornos estocásticos necesitan suficientes episodios para que la habilidad supere la varianza, pero el tamaño de muestra requerido es desconocido de antemano. Los equipos eligen un presupuesto fijo y ejecutan hasta completar—pagando costo de inferencia mucho después de la claridad—o echan un vistazo a un intervalo de confianza en ejecución y se detienen cuando se ve bien. El segundo enfoque es inválido: detenerse cuando un intervalo de confianza estándar parece significativo infla la tasa de error Tipo-I. Los intervalos de confianza estándar solo garantizan cobertura en un tamaño de muestra preestablecido.
AIVAT, introducido en AAAI 2018 por Burch, Schmid, Moravcik y Bowling, ataca el lado de la varianza. Aplica correcciones de media cero condicional que explotan tanto varianza de eventos de azar como varianza de acciones del jugador, utilizando una función de valor heurística para estados de juego. En los benchmarks originales de póker, AIVAT redujo la desviación estándar en 85% y requirió 44× menos juegos para equivalencia estadística. El nuevo paper muestra una reducción de varianza mediana de 54× en las 15 configuraciones LLM, el motor directo del ahorro de 74× en conteo de episodios.
AV-AIVAT añade el criterio de parada al envolver correcciones AIVAT dentro de una Confidence Sequence—una secuencia de estimaciones de intervalo que mantiene cobertura uniformemente en el tiempo, sin importar cuándo se detiene el evaluador. Se ofrecen dos variantes. La Asymptotic CS (AsympCS), que produjo el resultado de 74×, es no paramétrica y computacionalmente eficiente; proporciona validez asintótica para cribado rápido en producción. La Empirical-Bernstein CS (EB-CS) proporciona certificación exacta de muestra finita pero requiere un límite derivado independientemente en pagos corregidos. El paper establece este límite estructuralmente para Leduc hold'em. En ejecuciones HUNL, EB-CS cuesta una mediana 1.37× más manos que AsympCS. La auditabilidad de muestra finita conlleva sobrecarga pero sigue siendo práctica.
Una restricción crítica de implementación se aplica a ambas: el modelo de valor en línea que computa correcciones AIVAT solo se entrena en juegos anteriores. Ningún juego califica su propia corrección. Esto previene fuga de datos que invalidaría la garantía estadística. Cualquier equipo portando esto a un harness de evaluación debe aplicarlo al nivel del pipeline de datos.
La victoria menos publicitada es la auditabilidad. AV-AIVAT registra el tiempo de parada y todas las correcciones aplicadas en ese momento. El veredicto completo puede entregarse a terceros para replicación sin datos adicionales. La evaluación se convierte en un artefacto firmado, no en un número sacado de un panel. Para equipos construyendo evaluaciones que deben sobrevivir revisión externa o escrutinio regulatorio, esto importa más que el titular de 74×.
La restricción difícil es el alcance. El marco estadístico asume estructura de juego con información incompleta—específicamente, acceso a estrategias del jugador o una función de valor heurística para corrección de estado. Extender a tareas agénticas de dominio abierto donde no existe función de valor y los resultados son categóricos o binarios requiere repensar cómo se construyen las correcciones AIVAT. El límite EB-CS también debe establecerse por tarea. Para HUNL, los autores lo derivaron del límite de apuesta del juego, un techo estructuralmente motivado. Para benchmarks de agentes generales, ese límite no se da.
Para arquitectos construyendo infraestructura de evaluación: si su evaluación de agente usa rollouts estocásticos repetidos con costo por episodio—inferencia de modelo, anotación humana o llamadas API—estimadores con varianza reducida combinados con confidence sequences proporcionan la fundación estadística correcta. Los presupuestos fijos desperdician dinero. La parada ingenua invalida el intervalo de confianza. El diseño de dos modos de AV-AIVAT proporciona una interfaz limpia: cribado asintótico rápido vía AsympCS y certificación auditable de muestra finita vía EB-CS. Elige la garantía que necesitas antes de escribir loops de rollout.