El sistema Agensh de Microsoft Research escala la ingeniería de software multiagente a 1,024 trabajadores concurrentes sin un orquestador central, elevando las tasas de aprobación de pruebas en tareas complejas de reproducción de código al coordinar a través de espacio compartido, mensajería asincrónica y un bucle distribuido de reclamación de tareas. En los cinco puntos de referencia más difíciles de ProgramBench, escalar de 1 a 128 agentes eleva la tasa final media de aprobación de pruebas de 19.31% a 28.78%, una mejora relativa de 49%. Solo en pandoc, escalar a 1,024 agentes eleva la tasa final de aprobación de pruebas de 33.89% a 55.06%, una ganancia de 21.17 puntos porcentuales.

El sistema acopla un bucle de cooperación de cinco pasos con tres mecanismos de coordinación. Cada trabajador recopila contexto del estado compartido, reclama una subtarea anunciándola a sus pares, ejecuta trabajo localmente, verifica resultados contra criterios de aceptación e integra contribuciones verificadas en un espacio de trabajo Git compartido. Los pares se comunican a través de una interfaz de mensajes que lleva anuncios de equipo y mensajes directos, y publican hallazgos en un tablero de contexto compartido—un registro de solo anexión tipado de observaciones, hechos confirmados, enfoques fallidos, reclamaciones activas y resúmenes de parches. Los trabajadores proceden de forma asincrónica; las nuevas entradas en el contexto compartido se reenvían a todos los pares en la siguiente llamada de herramienta de infraestructura, haciendo que los descubrimientos sean visibles en toda la organización sin esperar sincronización.

La infraestructura utiliza Gitea para el espacio compartido, Mattermost para mensajería y una base de datos de solo anexión para contexto compartido. Los trabajadores se implementan como indicaciones en capas sobre un arnés de agente único—en los experimentos, Copilot con GPT-5.6-sol (high)—para que el sistema pueda conectarse a diferentes arneses subyacentes a través de adaptadores ligeros. El documento no reporta tiempo de reloj o costo de tokens a escala, solo tasas de aprobación de pruebas y latencia para alcanzar umbrales de desempeño intermedio.

Los experimentos del documento se ejecutan bajo un presupuesto fijo de 6 horas en ProgramBench, que requiere que los agentes reconstruyan software de referencia desde cero sin acceso a internet. Las cinco tareas abarcan procesamiento multimedia (FFmpeg, 1.5M líneas), simulación molecular (gromacs, 815K líneas), conversión de documentos (pandoc, 104K líneas), interpretación de lenguaje (PHP-src, 2.8M líneas) e indexación de código (ctags, 246K líneas). La Figura 6 muestra que las organizaciones más grandes alcanzan tasas de aprobación de pruebas intermedias más temprano: en pandoc, 128 agentes superan 30% de tasa de aprobación de pruebas en el punto de control de 30 minutos, mientras que 8 agentes superan ese umbral por primera vez a los 90 minutos.

Más allá de las ganancias de desempeño, las trayectorias de trabajadores registradas revelan cooperación autorganizada emergente. Con 8 agentes, los trabajadores coordinan la implementación anunciando interfaces de módulos e implementando independientemente componentes que se ajustan a ellas. Con 32 agentes, múltiples trabajadores revisan conjuntamente contribuciones y gestionan la integración entre pares. Con 128 agentes, los trabajadores se especializan seleccionando revisores basados en experiencia previa y establecen flujos de trabajo estandarizados—en pandoc, dos trabajadores crearon un protocolo donde el autor actualiza y prueba una rama, luego envía su hash de confirmación para validación e integración por pares. Con 1,024 agentes, múltiples trabajadores asumen los mismos roles especializados; en pandoc, múltiples integradores permiten que un trabajador contacte varios candidatos, seleccione al primer respondedor y cancele otras solicitudes, fortaleciendo la robustez al evitar dependencia de ningún trabajador individual.

La limitación central del sistema es la ausencia de datos de costo operacional y latencia. El documento mide solo tasas de aprobación de pruebas y tiempo hasta umbral, no consumo de tokens por agente, latencia de inferencia por iteración de bucle o costo de computación total para la ejecución de 1,024 agentes. Para arquitectos evaluando si la coordinación descentralizada escala de forma rentable, el documento no proporciona base para comparación contra sistemas basados en orquestador o contra líneas de base de agente único en el mismo presupuesto de hardware.

Si está construyendo un sistema multiagente para tareas de horizonte largo bajo restricciones de tiempo duro, la reclamación de tareas descentralizada y la coordinación de espacio compartido pueden mejorar la calidad y velocidad sin un orquestador cuello de botella—pero mida el costo de tokens y la latencia en su propia pila antes de comprometerse a escalar.