Microsoft lançou um tier dedicado de Gateway de IA para Azure API Management em visualização pública, rearquitetando o plano de controle ao redor de modelos e servidores MCP em vez de rotas de API tradicionais. O gateway federa modelos de OpenAI hospedado em Foundry, Anthropic, Mistral, AWS Bedrock e Google Vertex AI, com roteamento em correspondência exata de nome de modelo para que as equipes possam implantar inferência multivendor sem gerenciar proliferação de backend. As ferramentas são originadas de servidores MCP remotos, especificações OpenAPI ou um conector integrado cobrindo 1000+ aplicações SaaS.
As políticas agora são baseadas em cartão no portal em vez de XML—cobrindo limites de token/request, quotas, segurança de conteúdo e fallback de modelo—e o gateway inicia em cerca de um minuto sem unidades de escala para planejar. A telemetria é exportada como métricas OpenTelemetry para Application Insights, Datadog, Grafana ou destinos personalizados. O modelo operacional divide governança central (equipes de plataforma aprovam modelos e ferramentas) da autoatendimento de equipes (equipes de aplicativos constroem contra ativos publicados sem rotear mudanças de volta ao centro). Uma chave de acesso com escopo de gateway alcança cada modelo e ferramenta, o que cria risco: equipes familiarizadas com chaves por API do API Management perdem esse limite de raio de explosão.
A visualização é qualificada: sem SLA, APIs e preço não publicados, quotas em modelos/ferramentas/throughput não divulgadas, e o tier está disponível apenas em East US 2 e Sweden Central. Governança de custo no gateway foi elogiada como subestimada—a maioria das equipes adiciona rastreamento de gasto pós-incidente. Mas o anúncio deixa uma questão crítica aberta: quem governa o ciclo de vida completo do agente? O gateway pode fazer failover e tentar novamente em erro, mas se um agente produz resultado útil antes de uma conclusão não limpa, a anotação/preservação desse resultado parcial não é especificada.
Para arquitetos, este é um passo em direção à governança de modelo multivendor mas em estágio inicial. O sem SLA, preço não publicado e falta de clareza na semântica de execução de agente significam que adoção em produção deve esperar por GA e documentação. A chave com escopo de gateway é um risco material em comparação com escopo por API; as equipes precisam de orientação explícita sobre rotação de chave e compartimentalização. Observe como a Unity AI Gateway da Databricks (anunciada junho, ainda beta) e a pilha de gerenciamento bedrock da AWS evoluem em paralelo—as três nuvens estão agora todas em corrida nesta camada de plano de controle.