Baseado no ecossistema Hugging Face: o que significa
A plataforma Baseten tornou-se oficialmente um dos fornecedores de inferência sobre Hugging Face Hub. Este é um passo importante para todos que trabalham com modelos abertos: agora você pode lançá-los diretamente da página do modelo sem implantar sua própria infraestrutura. Anteriormente, você tinha que ir para serviços de terceiros, copiar chaves e configurar manualmente o ambiente — agora o processo é reduzido a alguns cliques.

A Baseten não é só a anfitriã dos LLMs. A plataforma oferece inferência sem servidor, treinamento de modelos e um catálogo de redes neurais prontas — desde grandes modelos de linguagem até sistemas de síntese de fala. Na fase inicial, a integração do Hugging Face abrange tarefas para assistentes conversacionais e geração de texto. Os modelos de peso aberto disponíveis incluem Kimi K3, DeepSeek V4 Flash, GLM-5.2 e outros. A lista de cenários suportados deverá expandir-se mais tarde.
Como configurar a implantação do modelo
Os usuários têm duas maneiras de acessar o provedor. O primeiro é especificar sua própria chave de API Baseten em suas configurações de conta no Hugging Face. Em seguida, pedidos de páginas modelo ir diretamente para o serviço, e você paga por eles de acordo com o seu plano. O segundo modo é rotear através da infraestrutura Hugging Face. Neste caso, uma chave Baseten separada não é necessária: a autenticação acontece através do seu token Hugging Face, e todos os encargos são cobrados na sua conta de plataforma.
Escolher um provedor é fácil de controlar: você pode definir a ordem de preferências em suas configurações pessoais. Se um modelo estiver disponível em vários serviços de terceiros, o Hugging Face irá mostrá-los automaticamente na página do modelo, ordenada de acordo com suas configurações. Isto é conveniente quando você deseja comparar a velocidade ou o custo de diferentes infraestruturas.

Bibliotecas de clientes e frameworks de agentes
Os desenvolvedores não terão que escrever uma placa adicional. Baseten já está disponível através de SDKs oficiais: huggingface_hub biblioteca versão 1.26.1 e acima para Python, bem como o @huggingface/inference pacote para JavaScript. Basta autenticar com seu token Hugging Face — e os pedidos de modelos hospedados no Baseten serão encaminhados automaticamente.
Também há boas notícias para os sistemas de agentes de construção. Os fornecedores de inferência estão integrados com arreios de agentes populares, incluindo Pi, OpenCode, Agentes Hermes, e OpenClaw. Isto significa que um modelo no Baseten pode ser usado em tais ferramentas sem escrever módulos adaptadores - a conexão acontece através dos meios padrão do framework.
Custo e limites livres
A questão do dinheiro é resolvida de forma diferente dependendo do modo escolhido. Se você usar sua própria chave de provedor, faturamento está inteiramente no lado Baseten. Ao rotear através do Hugging Face, as taxas padrão do provedor se aplicam sem qualquer marcação da plataforma. Acordos de partilha de receitas podem ser possíveis no futuro, mas, por enquanto, é um esquema normal de pagamento.
Usuários ativos recebem bons bônus. Os assinantes do Hugging Face PRO recebem $2 por mês em créditos de inferência — eles trabalham em diferentes fornecedores. E usuários gratuitos registrados recebem uma pequena quantidade de inferência sem custo, para que você possa tentar a nova integração sem qualquer investimento inicial.
O aparecimento de Baseten na lista de Provedores de Inferências torna o ecossistema Hugging Face ainda mais flexível. Os usuários têm mais escolha e os desenvolvedores têm menos rotina. Para implantar LLMs abertos, você não precisa mais ser um especialista em DevOps: algumas configurações são suficientes, e o modelo está funcionando.



