O sistema Agensh do Microsoft Research escala engenharia de software multi-agente para 1.024 trabalhadores simultâneos sem um orquestrador central, elevando as taxas de aprovação em testes em tarefas complexas de reprodução de código ao coordenar através de espaço compartilhado, mensagens assíncronas e um loop distribuído de reivindicação de tarefas. Nos cinco benchmarks mais difíceis do ProgramBench, escalar de 1 para 128 agentes eleva a taxa média final de aprovação em testes de 19.31% para 28.78%, uma melhoria relativa de 49%. Apenas no pandoc, escalar para 1.024 agentes eleva a taxa final de aprovação em testes de 33.89% para 55.06%, um ganho de 21.17 pontos percentuais.

O sistema acopla um loop de cooperação de cinco etapas com três mecanismos de coordenação. Cada trabalhador coleta contexto do estado compartilhado, reivindica uma sub-tarefa anunciando-a aos pares, executa trabalho localmente, verifica resultados contra critérios de aceitação e mescla contribuições verificadas de volta ao espaço compartilhado do Git. Os pares se comunicam através de uma interface de mensagens que carrega anúncios de equipe e mensagens diretas, e publicam descobertas em um quadro de contexto compartilhado—um log append-only tipado de observações, fatos confirmados, abordagens falhadas, reivindicações ativas e resumos de patches. Os trabalhadores procedem de forma assíncrona; novas entradas no contexto compartilhado são encaminhadas a todos os pares na próxima chamada de ferramenta de infraestrutura, tornando descobertas visíveis em toda a organização sem esperar por sincronização.

A infraestrutura usa Gitea para o espaço compartilhado, Mattermost para mensagens e um banco de dados append-only para contexto compartilhado. Os trabalhadores são implementados como prompts em camadas acima de um harness de agente único—nos experimentos, Copilot com GPT-5.6-sol (high)—para que o sistema possa se conectar a diferentes harnesses subjacentes através de adaptadores leves. O artigo não relata tempo de execução ou custo de tokens em escala, apenas taxas de aprovação em testes e latência para atingir limiares de desempenho intermediário.

Os experimentos do artigo são executados sob um orçamento fixo de 6 horas no ProgramBench, que exige que agentes reconstruam software de referência do zero sem acesso à internet. As cinco tarefas abrangem processamento multimídia (FFmpeg, 1.5M linhas), simulação molecular (gromacs, 815K linhas), conversão de documentos (pandoc, 104K linhas), interpretação de linguagem (PHP-src, 2.8M linhas) e indexação de código (ctags, 246K linhas). A Figura 6 mostra que organizações maiores atingem taxas intermediárias de aprovação em testes mais cedo: no pandoc, 128 agentes excedem 30% de taxa de aprovação em testes no checkpoint de 30 minutos, enquanto 8 agentes primeiro excedem esse limiar em 90 minutos.

Além dos ganhos de desempenho, as trajetórias registradas dos trabalhadores revelam cooperação auto-organizada emergente. Com 8 agentes, os trabalhadores coordenam a implementação anunciando interfaces de módulo e implementando independentemente componentes que estão em conformidade com elas. Com 32 agentes, múltiplos trabalhadores revisam conjuntamente contribuições e gerenciam integração entre pares. Com 128 agentes, os trabalhadores se especializam selecionando revisores com base em experiência anterior e estabelecem fluxos de trabalho padronizados—no pandoc, dois trabalhadores criaram um protocolo onde o autor atualiza e testa um branch, depois envia seu hash de commit para validação e mesclagem por pares. Com 1.024 agentes, múltiplos trabalhadores assumem os mesmos papéis especializados; no pandoc, múltiplos integradores permitem que um trabalhador entre em contato com vários candidatos, selecione o primeiro respondente e cancele outras solicitações, fortalecendo a robustez ao evitar dependência de qualquer trabalhador individual.

A limitação central do sistema é a ausência de dados de custo operacional e latência. O artigo mede apenas taxas de aprovação em testes e tempo até limiar, não consumo de tokens por agente, latência de inferência por iteração de loop ou custo total de computação para a execução com 1.024 agentes. Para arquitetos avaliando se a coordenação descentralizada escala de forma econômica, o artigo não fornece base para comparação contra sistemas baseados em orquestrador ou contra baselines de agente único no mesmo orçamento de hardware.

Se você está construindo um sistema multi-agente para tarefas de horizonte longo sob restrições de tempo rígidas, reivindicação de tarefas descentralizada e coordenação de espaço compartilhado podem melhorar qualidade e velocidade sem um orquestrador gargalo—mas meça custo de tokens e latência em sua própria stack antes de se comprometer com escala.