Baseten, uma plataforma de infraestrutura de IA para inferençia serverless e treinamento, lançou como um Inference Provider suportado no Hugging Face Hub em 6 de agosto de 2026. A integração permite que desenvolvedores acessem e implantem modelos hospedados na Baseten diretamente através das páginas de modelo do Hugging Face, SDKs de cliente (Python e JavaScript), e Agent Harnesses integradas (Pi, OpenCode, Hermes, OpenClaw). O suporte inicial cobre tarefas conversacionais e geração de texto com LLMs de peso aberto populares incluindo DeepSeek V4 Flash, GLM-5.2, Kimi K3, e outros, com suporte para tarefas adicionais sendo lançado em breve.
Baseten está disponível através de dois modos de inferençia: chave API customizada (requisições diretas cobradas na conta Baseten) e roteadas por HF (requisições roteadas através do Hugging Face com cobranças aplicadas à conta HF, não requer token de provedor). Os usuários podem definir preferências em configurações de conta HF para ordenar provedores por escolha e rotear requisições através de infraestrutura preferida. A integração está ao vivo no SDK Python huggingface_hub (>= 1.26.1) e SDK JavaScript @huggingface/inference, permitindo integração perfeita em Agent Harnesses existentes sem código de cola adicional. Usuários HF PRO recebem $2 mensais em créditos de Inferençia, usáveis entre provedores; usuários livres obter cota livre limitada com opção de fazer upgrade.
Baseten junta-se DeepInfra e Scaleway como Inference Providers suportados em HF, expandindo o roster de opções de inferençia de terceiros do HF. Este movimento espelha a consolidação mais ampla da infraestrutura de IA, onde plataformas de inferençia especializadas se integram upstream em hubs de modelo e plataformas de desenvolvedor para reduzir fricção de implantação. HF continua se posicionando como um roteador e agregador central de inferençia de modelo através de múltiplos provedores em vez de um único serviço monolítico de inferençia.
Para arquitetos: este é um ponto de consolidação prático. Anteriormente, desenvolvedores escolhendo Baseten sobre HF's native Inference Endpoints requeriam integrações separadas e código específico de vendedor. Agora, descoberta de modelo, preferência de vendedor, agregação de faturamento, e implantação tudo flui através de uma única interface UI/SDK. O modo faturamento roteado-por-HF remove fricção de bloqueio de vendedor. Espere que outros provedores de inferençia especializados (Fireworks, Together AI, Replicate) sigam. Isto estabelece HF como a camada de roteamento de inferençia de facto para modelos abertos, reduzindo fricção de implantação e bloqueio de API para times gerenciando pilhas multi-provedor.