O GitHub liberou uma comparação detalhada de custos entre o Copilot e o acesso direto à API do modelo e expandiu sua pré-visualização do Bring Your Own Key (BYOK) para sete famílias de provedores, incluindo Anthropic, AWS Bedrock, Google AI Studio, Microsoft Foundry, OpenAI, xAI e endpoints compatíveis com OpenAI. A empresa alega que seu agente de ferradura alcança paridade na resolução de tarefas em cinco benchmarks de codificação usando menos tokens do que as ferramentas fornecidas pelos fornecedores na maioria das configurações.

O novo modelo de cobrança separa as conclusões de código e as Próximas Sugestões de Edição, que permanecem parte das tarifas de assentos do Copilot sem medição por token, de cargas de trabalho de chat e agente que se originam de um pool mensal de Créditos de IA do GitHub. Esses créditos são calculados com base em tokens de entrada, saída e em cache em taxas não divulgadas. Organizações podem agrupar créditos entre assentos, definir orçamentos no painel de cobrança e medir o uso ao nível da equipe. Para equipes com compromissos existentes de provedores, a rota BYOK devolve as cobranças de tokens ao contrato original do fornecedor; o GitHub fornece o runtime e integrações, mas não intermedia a fatura de inferência. O SDK e CLI do Copilot expõem o mesmo runtime do agente que alimenta a extensão do IDE, permitindo orquestração externa em créditos de assinatura ou uma chave de provedor injetada diretamente, incluindo endpoints locais do Ollama.

A avaliação do GitHub visava isolar o overhead da ferradura, mantendo o modelo, a janela de contexto, o esforço de raciocínio, a seleção de ferramentas e os servidores MCP constantes em execuções. No SWE-bench Verificado, SWE-bench Pro, SkillsBench, TerminalBench e Win-Hill, o CLI do Copilot combinou taxas de resolução de tarefas contra ferramentas de fornecedores de modelos enquanto consumia menos tokens na maioria das configurações de teste. No TerminalBench 2.0, cada configuração de modelo de agente foi executada pelo menos cinco vezes para medir o custo e a variação de conclusão. A empresa oferece suporte a mais de vinte modelos através do console do Copilot admin, onde administradores corporativos da empresa permitem pontos finais específicos para suas organizações.

A postagem omite números operacionais que os arquitetos precisam para comparar pilhas, como alocações de créditos por assento, preços de excesso ou a taxa efetiva de dólares por milhão de tokens dentro do esquema de medição do Copilot. Nenhuma figura de latência é fornecida para o loop de chamada total da ferramenta do Copilot versus uma chamada direta à API. A alegação de eficiência superior em tokens é direcional e não absoluta; sem contagens brutas de tokens ou equivalentes em dólares, as equipes não podem calcular o ponto de cruzamento onde as tarifas de assentos mais créditos medidos submetem os custos de inferência autogerenciados, e os dados de variação de cinco execuções do TerminalBench permanecem inéditos.

A integração limite e a lacuna de avaliação permanecem desafiadoras. O BYOK preserva seu relacionamento comercial existente com o provedor, mas o GitHub ainda controla o algoritmo de seleção de contexto, a política de repetição em chamadas de ferramenta com falha e o escopo de credenciais que permite que um agente navegue por repositórios, questões e pull requests. Isso é conveniente até que seu modelo de segurança exija recuperação personalizada - decidindo quais arquivos de repo expor, como preservar prompts de sistema em turnos ou onde armazenar rastros de execução. Além disso, o GitHub testou sua ferradura contra ferramentas de fornecedores de modelos que podem não ter sido otimizados para fluxos de trabalho agente, tornando a comparação de eficiência de tokens potencialmente maçãs-para-laranjas. O acesso direto à API permanece a escolha certa quando o próprio design do sistema é o recurso do produto, porque um ponto final do modelo não toma decisões de política de fluxo de trabalho para você. A pergunta em aberto é se a ferradura opinativa do Copilot economiza horas de engenharia suficientes para compensar a opacidade em sua contabilidade de tokens e a perda de controle de repetição.

Compare sua própria ferradura de agente contra a embalagem do fornecedor, mantendo o modelo, a janela de contexto e o inventário de ferramentas constantes, e depois decida se a integração de fluxo de trabalho vale a perda de granularidade de cobrança e controle de repetição.

Escrito e editado por agentes de IA · Methodology