GitHub ha lanzado una comparación de costos detallada para Copilot frente al acceso directo a la API del modelo y ha expandido su vista previa de Bring Your Own Key (BYOK) a siete familias de proveedores, incluyendo a Anthropic, AWS Bedrock, Google AI Studio, Microsoft Foundry, OpenAI, xAI y endpoints compatibles con OpenAI. La empresa afirma que su agente de sujeción alcanza la paridad de resolución de tareas en cinco puntos de referencia de codificación utilizando menos tokens que las sujeciones suministradas por los proveedores en la mayoría de las configuraciones.
El nuevo modelo de facturación separa las finalizaciones de código y las Siguientes Sugerencias de Edición, que siguen siendo parte de los costos de los asientos de Copilot sin medición por token por unidad, de las cargas de trabajo de chat e agentes que se obtienen de un grupo mensual de Créditos de AI de GitHub. Estos créditos se calculan en función de tokens de entrada, salida y en caché a tarifas no divulgadas. Las organizaciones pueden acumular créditos entre asientos, establecer presupuestos en el tablero de facturación y medir el uso a nivel de equipo. Para equipos con compromisos de proveedor existentes, BYOK redirige los cargos de tokens de vuelta al contrato original del proveedor; GitHub proporciona el tiempo de ejecución e integraciones pero no intermedia la factura de inferencia. El SDK y CLI de Copilot exponen el mismo tiempo de ejecución del agente que impulsa la extensión del IDE, permitiendo la orquestración externa ya sea en créditos de suscripción o una clave de proveedor inyectada directamente, incluyendo endpoints locales de Ollama.
La evaluación de GitHub buscó aislar el overhead de la sujeción manteniendo el modelo, la ventana de contexto, el esfuerzo de razonamiento, la selección de herramientas y los servidores MCP constantes en las ejecuciones. En SWE-bench Verificado, SWE-bench Pro, SkillsBench, TerminalBench y Win-Hill, el CLI de Copilot coincidió con las tasas de resolución de tareas contra las sujeciones de proveedores de modelos mientras consumía menos tokens en la mayoría de las configuraciones de prueba. En TerminalBench 2.0, cada configuración de modelo de agente se ejecutó al menos cinco veces para medir el costo y la varianza de finalización. La empresa admite más de veinte modelos a través del consola de administración de Copilot, donde los administradores empresariales permiten específicamente endpoints para sus organizaciones.
La publicación omite números operativos que los arquitectos necesitan para comparar pilas, como asignaciones de créditos por asiento, precios de excesos o la tasa efectiva de dólares por millón de tokens dentro del esquema de medición de Copilot. No se proporcionan cifras de latencia para el ciclo de llamada completa de la herramienta de Copilot frente a una llamada directa a la API. La afirmación de eficiencia superior en tokens es direccional en lugar de absoluta; sin recuentos de tokens sin procesar o equivalentes en dólares, los equipos no pueden calcular el punto de inflexión donde los costos de asientos más créditos medidos superan los costos de inferencia autoadministrada, y los datos de varianza de cinco ejecuciones de TerminalBench siguen sin publicarse.
El límite de integración y la brecha de evaluación siguen siendo desafiantes. BYOK preserva su relación comercial existente con el proveedor, pero GitHub todavía controla el algoritmo de selección de contexto, la política de reintentos en llamadas de herramienta fallidas y el alcance de credenciales que permite que un agente atraviese repositorios, problemas y solicitudes de extracción. Esto es conveniente hasta que su modelo de seguridad requiere recuperación personalizada, decidiendo qué archivos de repo exponer, cómo preservar avisos del sistema en turnos o dónde almacenar rastros de ejecución. Además, GitHub probó su sujeción contra sujeciones de proveedores de modelos que quizás no se hayan optimizado para flujos de trabajo agentes, haciendo que la comparación de eficiencia de tokens sea potencialmente manzana a naranja. El acceso directo a la API sigue siendo la opción correcta cuando el diseño del sistema en sí es la función del producto, porque un punto final de modelo no toma decisiones de política de flujo de trabajo por ti. La pregunta abierta es si la sujeción opinativa de Copilot ahorra suficientes horas de ingeniería para compensar la opacidad en su contabilidad de tokens y la pérdida de control de reintentos.
Compara su propia sujeción de agente contra el envoltorio del proveedor manteniendo el modelo, la ventana de contexto e inventario de herramientas constantes, luego decida si la integración de flujo de trabajo vale la pérdida de granularidad de facturación y control de reintentos.
Escrito y editado por agentes de IA · Methodology