Baseten стал новым поставщиком инференса на Hugging Face: запускайте открытые LLM без серверов

21 августа 202619 просмотров

Платформа Baseten теперь работает как один из Inference Providers в экосистеме Hugging Face: через страницы моделей и клиентские SDK можно вызывать открытые модели, включая Kimi K3, DeepSeek V4 Flash и GLM-5.2, для диалогов и генерации текста. Пользователи могут выбрать оплату через собственный API-ключ Baseten или через баланс Hugging Face, причём тарифы остаются стандартными, а для PRO-аккаунтов предусмотрены ежемесячные кредиты.

Baseten стал новым поставщиком инференса на Hugging Face: запускайте открытые LLM без серверов

Baseten в экосистеме Hugging Face: что это значит

Платформа Baseten официально вошла в число поставщиков инференса на Hugging Face Hub. Это важный шаг для всех, кто работает с открытыми моделями: теперь запускать их можно прямо со страницы модели, не разворачивая собственную инфраструктуру. Раньше для этого приходилось идти на сторонние сервисы, копировать ключи и вручную настраивать окружение — теперь процесс сведён к нескольким кликам.

Baseten — это не просто хостинг для LLM. Платформа предлагает serverless-инференс, обучение моделей и каталог готовых нейросетей — от больших языковых моделей до систем синтеза речи. На начальном этапе интеграция с Hugging Face покрывает задачи диалоговых ассистентов и генерации текста. Среди доступных open-weight моделей значатся Kimi K3, DeepSeek V4 Flash, GLM-5.2 и другие. Позже обещают расширить список поддерживаемых сценариев.

Как настроить запуск моделей

У пользователей есть два способа обращаться к провайдеру. Первый — указать собственный API-ключ Baseten в настройках аккаунта на Hugging Face. Тогда запросы со страниц моделей идут напрямую в сервис, а платите вы за них по своему тарифу. Второй режим — маршрутизация через инфраструктуру Hugging Face. В этом случае отдельный ключ от Baseten не нужен: аутентификация происходит через токен Hugging Face, а все начисления списываются на ваш аккаунт платформы.

Выбор провайдера легко контролировать: в личных настройках можно задать порядок предпочтений. Если модель доступна у нескольких сторонних сервисов, Hugging Face автоматически покажет их на странице модели, отсортировав по вашим настройкам. Это удобно, когда хочется сравнивать скорость или стоимость разных инфраструктур.

Клиентские библиотеки и агентские фреймворки

Разработчикам не придётся писать дополнительную обвязку. Baseten уже доступен через официальные SDK: библиотеку huggingface_hub версии 1.26.1 и выше для Python, а также пакет @huggingface/inference для JavaScript. Достаточно авторизоваться токеном Hugging Face — и запросы к моделям, размещённым у Baseten, будут направляться автоматически.

Хорошая новость и для тех, кто строит агентные системы. Провайдеры инференса интегрированы с популярными харнессами для агентов, включая Pi, OpenCode, Hermes Agents и OpenClaw. Это значит, что модель на Baseten можно использовать в таких инструментах без написания переходных модулей — подключение происходит стандартными средствами фреймворка.

Стоимость и бесплатные лимиты

Вопрос денег решается по-разному в зависимости от выбранного режима. Если вы используете собственный ключ провайдера, биллинг полностью на стороне Baseten. При маршрутизации через Hugging Face действуют стандартные тарифы провайдера без каких-либо наценок со стороны платформы. В будущем возможны соглашения о разделении дохода, но сейчас это обычная схема оплаты по факту использования.

Для активных пользователей предусмотрены приятные бонусы. Обладатели PRO-подписки Hugging Face получают $2 в месяц в виде кредитов на инференс — они действуют у разных провайдеров. А зарегистрированным бесплатным пользователям полагается небольшой объём инференса без оплаты, так что попробовать новую интеграцию можно без первоначальных вложений.

Появление Baseten в списке Inference Providers делает экосистему Hugging Face ещё более гибкой. Пользователи получают больше выбора, а разработчики — меньше рутины. Для запуска открытых LLM теперь не нужно быть экспертом в DevOps: достаточно пары настроек, и модель работает.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Baseten в Hugging Face: обзор интеграции и возможностей