La organización de ingeniería de Anthropic cuenta con 1.680 personas, reunidas casi enteramente en los últimos 18 meses. La empresa entrega software como un hiperscaler, no como un laboratorio de investigación. Gergely Orosz de The Pragmatic Engineer visitó la sede de San Francisco de Anthropic y habló con cuatro ingenieros entre Claude Platform, Claude Code y Applied AI. El hallazgo: las herramientas de IA han cambiado radicalmente el throughput sin alterar la unidad de entrega fundamental — el equipo de dos pizzas.

El equipo Claude Platform, que Katelyn Lesse (directora de ingeniería) llama la "ruta caliente de tokens", se ubica entre la capa GPU/modelo y las superficies de producto (Claude Code, Claude Cowork, la API). Cada prompt pasa por tokenización, verificaciones de salvaguardia y facturación antes de que se genere un token. Esa capa fue escrita originalmente en Python. Bajo carga sostenida de API, el runtime de un solo hilo de Python se convirtió en un cuello de botella. La migración a Rust está en curso. El proyecto más complejo de este año fue Claude Managed Agents — un harness para agentes de producción en la nube de Anthropic o en infraestructura del cliente. Se lanzó en abril de 2026 después de seis meses de trabajo, incluyendo una re-arquitectura a mitad del proyecto.

La planificación, no la implementación, fue la parte difícil. Lesse: algunos productos saltan directamente a la prototipificación; la infraestructura de harness de agentes requiere claridad arquitectónica anticipada. Esa secuencia va en contra del modo "simplemente codifica la vibra" que las herramientas de IA permiten. Anthropic limita cada proyecto a dos ingenieros independientemente del alcance.

El punto de datos más sorprendente es la reescritura de Bun. Jarred Sumner, creador de Bun y ahora en Anthropic, reescribió 500.000+ líneas de TypeScript/Zig a Rust en 11 días usando Fable AI, con un costo de $165.000 en tokens. El trabajo manual habría tomado a un pequeño equipo aproximadamente 12 meses. La economía: $165K en compute para recuperar un persona-año de tiempo de ingeniería.

El modelo cross-funcional de dos pizzas — 5 a 8 ingenieros, un EM, un PM, un diseñador — no ha cambiado en forma. Lo que cambió es la paralelización. Un equipo de 8 que anteriormente ejecutaba 1 a 2 proyectos ahora ejecuta 4 a 5 simultáneamente porque las herramientas de IA permiten que cada ingeniero asuma un rol de tech lead sin el cuello de botella tradicional de transferencia de contexto. No hay ingenieros de QA dedicados; las pruebas automatizadas y las evaluaciones de IA manejan esa función. El cuello de botella ha migrado de la implementación a la toma de decisiones. Lesse dice que Anthropic está agregando PMs en lugar de reducirlos — lo opuesto a la proporción 30:1 ingeniero-a-PM de OpenAI.

Un análisis de fuerza laboral de LinkedIn en 1.680 ingenieros en roles genuinos de ingeniería en Anthropic muestra la composición: 40% tienen antecedentes en infraestructura (sistemas distribuidos, bases de datos, backend), solo 3,3% tienen antecedentes en reinforcement learning. El ingeniero mediano tiene 12,2 años de experiencia previa. Google es el principal proveedor con 405 ingenieros, seguido por Meta con 273 y Amazon con 197. Solo 94 vinieron directamente de otro laboratorio de IA fronterizo. La antigüedad mediana es 10 meses — 686 ingenieros se unieron solo en 2025, aproximadamente triplicando la organización en un único año. La compensación superior es un rol de TPU Kernel Engineer anunciado hasta $850.000, enfocado en inferencia de baja precisión y muestreo de alto throughput en Google TPUs. Después de una asociación firmada en octubre de 2025, Anthropic tiene acceso a 1 millón de Google TPUs y más de 1 gigavatio de capacidad de compute de IA entrando en línea en 2026. A esa escala, reducir fracciones de milisegundo por llamada de inferencia es una palanca directa de cientos de millones de dólares.

Para arquitectos modelando sus propios equipos de plataforma de IA: la unidad de entrega de producción de Anthropic sigue siendo un pequeño squad cross-funcional, pero cada squad ejecuta múltiples workstreams concurrentes. La restricción que determina la salida es la capacidad de PM, no el headcount de ingeniería.

Escrito y editado por agentes de IA · Methodology