Um paper publicado no arXiv em 6 de agosto por Boning Li, Yu Chen e Longbo Huang apresenta AV-AIVAT, um harness de avaliação que combina a Action-Informed Value Assessment Tool (AIVAT) com Confidence Sequences para benchmarking de agentes. Com uma precisão alvo de ±1 Big Blind e 95% de confiança, resultados brutos de jogos exigem uma mediana 74× mais episódios do que resultados corrigidos por AIVAT para atingir uma decisão de parada certificada. O experimento abrangeu 15 configurações de agentes LLM em 71.439 mãos pareadas de Heads-Up No-Limit Hold'em (HUNL).

O problema central é estrutural. Avaliações de agentes em ambientes estocásticos precisam de episódios suficientes para que a habilidade ultrapasse a variância, mas o tamanho de amostra necessário é desconhecido antecipadamente. Os times escolhem um orçamento fixo e executam até a conclusão—pagando custo de inferência muito depois de clareza—ou observam um intervalo de confiança em execução e param quando parece bom. A segunda abordagem é inválida: parar quando um intervalo de confiança padrão aparenta significância infla a taxa de erro Tipo-I. Intervalos de confiança padrão garantem cobertura apenas em um tamanho de amostra pré-especificado.

AIVAT, introduzido em AAAI 2018 por Burch, Schmid, Moravcik e Bowling, ataca o lado da variância. Aplica correções de média zero condicional que exploram tanto variância de eventos de acaso quanto variância de ações do jogador, usando uma função de valor heurística para estados de jogo. Nos benchmarks originais de poker, AIVAT reduziu desvio padrão em 85% e exigiu 44× menos jogos para equivalência estatística. O novo paper mostra uma redução mediana de variância de 54× nas 15 configurações LLM, o driver direto da economia de 74× em contagem de episódios.

AV-AIVAT adiciona o critério de parada ao envolver correções AIVAT dentro de uma Confidence Sequence—uma sequência de estimativas de intervalo que mantém cobertura uniformemente ao longo do tempo, independentemente de quando o avaliador para. Duas variantes são oferecidas. A Asymptotic CS (AsympCS), que produziu o resultado de 74×, é não-paramétrica e computacionalmente eficiente; fornece validade assintótica para triagem rápida em produção. A Empirical-Bernstein CS (EB-CS) fornece certificação exata de amostra finita, mas exige um limite derivado independentemente em payoffs corrigidos. O paper estabelece esse limite estruturalmente para Leduc hold'em. Em execuções HUNL, EB-CS custa uma mediana 1.37× mais mãos que AsympCS. Auditabilidade de amostra finita carrega sobrecarga mas permanece prática.

Uma restrição crítica de implementação se aplica a ambas: o modelo de valor online que computa correções AIVAT treina apenas em jogos anteriores. Nenhum jogo avalia sua própria correção. Isso evita vazamento de dados que invalidaria a garantia estatística. Qualquer time portando isso para um harness de avaliação deve impor isso no nível do pipeline de dados.

A vitória menos publicizada é auditabilidade. AV-AIVAT registra o tempo de parada e todas as correções aplicadas naquele momento. O veredicto completo pode ser entregue a terceiros para replicação sem dados adicionais. A avaliação se torna um artefato assinado, não um número puxado de um dashboard. Para times construindo avaliações que devem sobreviver revisão externa ou escrutínio regulatório, isso importa mais que a manchete de 74×.

A restrição dura é escopo. O framework estatístico assume estrutura de jogo com informação incompleta—especificamente, acesso a estratégias do jogador ou uma função de valor heurística para correção de estado. Estender para tarefas agênticas de domínio aberto onde nenhuma função de valor existe e resultados são categóricos ou binários exige repensar como correções AIVAT são construídas. O limite EB-CS também deve ser estabelecido por tarefa. Para HUNL, os autores derivaram do limite de aposta do jogo, um teto estruturalmente motivado. Para benchmarks de agentes gerais, esse limite não é dado.

Para arquitetos construindo infraestrutura de avaliação: se sua avaliação de agente usa rollouts estocásticos repetidos com custo por episódio—inferência de modelo, anotação humana ou chamadas API—estimadores com variância reduzida combinados com confidence sequences fornecem a fundação estatística correta. Orçamentos fixos desperdiçam dinheiro. Parada ingênua invalida o intervalo de confiança. O design de dois modos de AV-AIVAT fornece uma interface limpa: triagem assintótica rápida via AsympCS e certificação auditável de amostra finita via EB-CS. Escolha a garantia que você precisa antes de escrever loops de rollout.