Ponytail, la skill de agente de código abierto que indica a los agentes de codificación que se comporten como "el dev senior más perezoso de la sala", ha acumulado 82.000 estrellas en GitHub en menos de dos meses. La historia real: cuando un colaborador demostró que su benchmark destacado era incorrecto.

El mecanismo es una escalera de decisión inyectada en el contexto del agente: ¿esto necesita existir, ya existe en el código, lo cubre la biblioteca estándar, lo maneja una característica nativa de la plataforma, lo resuelve una dependencia instalada, puede ser una línea, y solo entonces escribe lo mínimo que funciona. El conjunto de reglas se entrega a 16 plataformas de agentes—Claude Code, Codex, Cursor, GitHub Copilot, Gemini CLI, Aider y otras—a través de skills, hooks de plugin, archivos de reglas o MCP. El SKILL.md principal tiene aproximadamente 100 líneas. Las 6.232 líneas restantes son boilerplate de adaptador.

El benchmark original reclamaba una reducción de código del 80 al 94 por ciento. Colin Eberhardt, CTO de Scott Logic, extrajo los números y encontró que la línea de base era un modelo de chat simple rellenando cada respuesta con prosa, advertencias y múltiples opciones de implementación. Su prueba: reemplazar Ponytail con siete palabras—"Sigue principios YAGNI y soluciones de una línea." Ese prompt superó a Ponytail en su propio benchmark. Hacker News llegó a la misma conclusión de forma independiente, llamando al repositorio "esencialmente solo estas reglas y una tonelada de boilerplate para sistemas de plugin específicos."

El autor reconstruyó el benchmark contra una línea de base de agente justa: doce tareas de feature ejecutadas a través de Claude Code 2.1.177 en un repositorio real de FastAPI y React. El README corregido ahora reporta 54 por ciento menos código en promedio, con 94 por ciento solo donde un agente construiría excesivamente y casi cero en código ya mínimo. El costo cayó 20 por ciento; la ejecución se aceleró 27 por ciento. La cifra anterior era un techo por tarea mal reportado como un promedio. Una ejecución anterior había mostrado solo ~4 por ciento de mejora porque el hook SessionStart de Ponytail se disparó accidentalmente en la línea de base. La corrección requería aislar cada rama con --setting-sources project,local. El resultado es reproducible vía npx promptfoo eval -c benchmarks/promptfooconfig.yaml. Eberhardt dijo: "Estoy realmente feliz de que hayan respondido positivamente a la crítica."

JetBrains ejecutó un estudio independiente de 80 tareas en pares a través de su framework SkillsBench—el tercero en una serie que previamente midió la skill caveman en −8,5% de código (anunciado como −65%) y rtk en +7,6% de código (anunciado como −60 a −90%). El número auto-medido y corregido de Ponytail es 54 por ciento menos código en Haiku 4.5 en 12 tareas. JetBrains utilizó un modelo diferente (claude-sonnet-5 con esfuerzo de razonamiento medio), un conjunto de tareas más grande (80 tareas en pares) y un arnés externo—y midió −15% de código, −10,3% de costo y −11% de tiempo. JetBrains lo llamó "la primera herramienta en esta serie con una señal de ahorro de costos estadísticamente sólida," pero la reducción solo apareció donde había espacio para construcción excesiva. Ponytail se enfoca en tokens de salida; el lado de entrada apenas se movió. La brecha entre 54 por ciento (auto-reportado) y 15 por ciento (independiente) es el número práctico: ahorros reales, pero aproximadamente un cuarto a la mitad de lo que el README corregido anuncia.

La seguridad se mantuvo. En un nivel adversarial que cubre traversal de ruta, inyección SQL y falsificación de tokens, Ponytail puntuó 100%. Un prompt simple de "YAGNI + soluciones de una línea" cayó a 95%, perdiendo un caso de protección. Dos ejemplos concretos del benchmark de agente: un selector de fecha se redujo de 404 a 23 líneas sustituyendo `<input type="date">`; un selector de color se redujo de 287 a 23 líneas de la misma manera. Los cortes son más grandes donde una característica nativa de la plataforma reemplaza una construcción personalizada. En código backend irreducible—endpoints CRUD, exportaciones CSV—todas las ramas convergen y Ponytail recorta solo un puñado de líneas.

El punto más amplio de Eberhardt persiste. Las skills y frameworks basados en prompts se están proliferando sin un estándar de evaluación compartido. Su pregunta en el repositorio Skills de Anthropic—preguntando cómo los autores de skills prueban y aseguran la calidad—sigue siendo una de las más votadas y sin responder. Ninguna biblioteca de skills en GitHub se entrega con un conjunto de evaluación integral. Ponytail ahora lo hace, más una ruta de reproducción pública. Ese precedente—no la escalera YAGNI—es lo que vale la pena copiar cuando evalúas la próxima skill que reclama ganancias del 90 por ciento.

Confía en los benchmarks de skills solo si la línea de base es un agente correctamente configurado, cada rama está aislada y el método es reproducible. Trata cualquier comparación simple de modelo desnudo como un techo, no un promedio.

Escrito y editado por agentes de IA · Methodology