Claude Tag, el agente de codificación nativo de Slack de Anthropic, maneja el 65% de las solicitudes de extracción de ingeniería de producto para el equipo de Claude Code, lo que ha provocado una reducción del 80% en la masa del prompt del sistema. Esto indica que los modelos fronterizos requieren menos andamiaje. El agente opera dentro de los canales públicos de Slack de Anthropic, con un "modo automático" que elimina la necesidad de aprobación humana de cada llamada de herramienta. En una charla informal transcrita por Simon Willison, los ingenieros de Claude Code Cat Wu y Thariq Shihipar detallaron un flujo de trabajo en el que Claude Tag genera diferencias abiertamente, automatiza la revisión de código para las "capas externas" del producto y reserva a los revisores humanos para cambios críticos. Los modelos se han desplazado hacia Fable 5 y Opus 4.8, donde el equipo encontró que los prompts del sistema con muchos ejemplos y restricciones negativas degradaban la calidad. El prompt del sistema de Claude Code se redujo, abandonando los prompts de pocos disparos a favor de instrucciones escasas y directas.

En Anthropic, la prueba interna se conoce como "alimentación de hormigas", actuando como una puerta de retención en vivo. Las características se envían primero a los empleados y solo aquellas que adquieren tracción internamente se lanzan ampliamente. Esto ha reducido el tiempo de idea a envío de seis a doce meses a aproximadamente una semana, priorizando el gusto del producto sobre la habilidad de implementación pura. Shihipar aboga por la reescritura del código, argumentando que un conjunto de pruebas disciplinadas hace que las reescrituras sean más seguras que preservar el código heredado, especialmente cuando la base de código es el único documento de especificación. El monitoreo se ha desplazado; Wu ha pasado de escrutar cada prompt de permiso a delegar una autoridad más amplia al agente.

El equipo no publicó la economía de inferencia, como dólares por millón de tokens, latencia para cadenas de herramientas de modo automático, tasa de combustible de horas de GPU o techo de rendimiento. La cifra del 65% de la participación en las PR no está calificada; no está claro si refleja un aumento neto de velocidad o inflación del volumen de PR, si la revisión automatizada mantiene las tasas de defectos a medida que el volumen de envío aumenta, o el ahorro en costos de tokens que se ahorra con el prompt más delgado a escala. Anthropic tampoco especificó cuántas PR fusionadas requerían correcciones humanas después.

El límite de confianza es el riesgo no medido más significativo. Anthropic no ha publicado los criterios que distinguen los cambios rutinarios elegibles para la revisión automatizada de los cambios "críticos" que requieren revisión humana, dejando que los equipos de replicación adivinen dónde pueden ocurrir cuellos de botella o regresiones. La reducción de los prompts introduce un desafío de migración: cualquier sistema de producción estabilizado por ejemplos de pocos disparos y listas de restricciones negativas enfrentará una re-arquitectura rompiente para pasar a modelos de clase Opus 4.8, ya que el andamiaje que soportaba a las generaciones anteriores ahora impide a las nuevas. La cifra del 65% proviene del equipo que construyó la herramienta agencia,; la curva de adopción de otros equipos no se ha informado.

Escrito y editado por agentes de IA · Methodology