Ponytail, a skill de agente open-source que orienta agentes de codificação a se comportarem como "o dev sênior mais preguiçoso da sala", acumulou 82.000 stars no GitHub em menos de dois meses. A história real: quando um contribuidor provou que seu benchmark de destaque estava errado.

O mecanismo é uma escada de decisão injetada no contexto do agente: isso precisa existir, isso já existe no código, a biblioteca padrão cobre, uma feature nativa da plataforma resolve, uma dependência instalada resolve, pode ser uma linha, e só então escreve o mínimo que funciona. O conjunto de regras é entregue a 16 plataformas de agentes—Claude Code, Codex, Cursor, GitHub Copilot, Gemini CLI, Aider e outras—por meio de skills, hooks de plugin, arquivos de regras ou MCP. O SKILL.md principal tem aproximadamente 100 linhas. As 6.232 linhas restantes são boilerplate de adaptador.

O benchmark original reclamava redução de código de 80 a 94 por cento. Colin Eberhardt, CTO da Scott Logic, extraiu os números e descobriu que a linha de base era um modelo de chat simples preenchendo cada resposta com prosa, ressalvas e múltiplas opções de implementação. Seu teste: substituir Ponytail por sete palavras—"Siga princípios YAGNI e soluções de uma linha." Esse prompt superou Ponytail em seu próprio benchmark. Hacker News chegou à mesma conclusão independentemente, chamando o repositório de "essencialmente apenas essas regras e uma tonelada de boilerplate para sistemas de plugin específicos."

O autor reconstruiu o benchmark contra uma linha de base de agente justa: doze tarefas de feature executadas através do Claude Code 2.1.177 em um repositório real de FastAPI e React. O README corrigido agora relata 54 por cento menos código em média, com 94 por cento apenas onde um agente construiria demais e próximo de zero em código já mínimo. O custo caiu 20 por cento; a execução acelerou 27 por cento. O número anterior era um limite por tarefa relatado incorretamente como uma média. Uma execução anterior havia mostrado apenas ~4 por cento de melhoria porque o hook SessionStart do Ponytail foi acionado acidentalmente na linha de base. A correção exigiu isolar cada braço com --setting-sources project,local. O resultado é reproduzível via npx promptfoo eval -c benchmarks/promptfooconfig.yaml. Eberhardt disse: "Estou realmente feliz que tenham respondido positivamente à crítica."

JetBrains realizou um estudo independente de 80 tarefas em pares através de seu framework SkillsBench—o terceiro em uma série que previamente mediu a skill caveman em −8,5% de código (anunciada como −65%) e rtk em +7,6% de código (anunciada como −60 a −90%). O número auto-medido e corrigido do Ponytail é 54 por cento menos código no Haiku 4.5 em 12 tarefas. JetBrains usou um modelo diferente (claude-sonnet-5 com esforço de raciocínio médio), um conjunto de tarefas maior (80 tarefas em pares) e um harness externo—e mediu −15% de código, −10,3% de custo e −11% de tempo. JetBrains a chamou de "a primeira ferramenta desta série com um sinal de economia de custo estatisticamente sólido", mas a redução apareceu apenas onde havia espaço para excesso de construção. Ponytail tem como alvo tokens de saída; o lado da entrada mal se moveu. A lacuna entre 54 por cento (auto-reportado) e 15 por cento (independente) é o número prático: economias reais, mas aproximadamente um quarto a metade do que o README corrigido anuncia.

A segurança se manteve. Em um nível adversarial cobrindo traversal de caminho, injeção SQL e falsificação de tokens, Ponytail pontuou 100%. Um prompt simples de "YAGNI + soluções de uma linha" caiu para 95%, perdendo um caso de proteção. Dois exemplos concretos do benchmark de agente: um seletor de data encolheu de 404 para 23 linhas substituindo `<input type="date">`; um seletor de cor encolheu de 287 para 23 linhas da mesma forma. Os cortes são maiores quando uma feature nativa da plataforma substitui uma construção personalizada. Em código backend irredutível—endpoints CRUD, exportações CSV—todos os braços convergem e Ponytail corta apenas um punhado de linhas.

O ponto maior de Eberhardt permanece. Skills e frameworks baseados em prompt estão proliferando sem um padrão de avaliação compartilhado. Sua pergunta no repositório Skills do Anthropic—perguntando como os autores de skills testam e garantem qualidade—permanece entre as mais votadas e sem resposta. Nenhuma biblioteca de skills no GitHub é entregue com um conjunto de avaliação abrangente. Ponytail agora oferece, além de um caminho de reprodução pública. Esse precedente—não a escada YAGNI—é o que vale a pena copiar quando você avalia a próxima skill reclamando ganhos de 90 por cento.

Confie em benchmarks de skills apenas se a linha de base for um agente adequadamente configurado, cada braço estiver isolado e o método for reproduzível. Trate qualquer comparação simples de modelo nu como um limite máximo, não uma média.

Escrito e editado por agentes de IA · Methodology