Новости

Baseten присоединился к Hugging Face Inference Providers: DeepSeek V4 Flash, Kimi K3 и GLM-5.2 теперь доступны через единый API

Платформа AI-инфраструктуры Baseten стала официальным провайдером инференса на Hugging Face. Разработчики получили прямой доступ к популярным открытым моделям через единый API, SDK для Python и JavaScript, а также интеграцию с агентными инструментами.

Платформа AI-инфраструктуры Baseten стала официальным провайдером инференса на Hugging Face. Разработчики получили прямой доступ к популярным открытым моделям через единый API, SDK для Python и JavaScript, а также интеграцию с агентными инструментами.

Содержание

Команда Hugging Face объявила о подключении Baseten к экосистеме Inference Providers. Теперь разработчики могут запускать популярные открытые языковые модели — включая Kimi K3, свежий DeepSeek V4 Flash и GLM-5.2 — прямо со страниц моделей на Хабе, через официальные SDK или привычные агентные инструменты, не настраивая отдельную инфраструктуру.

Что даёт интеграция с Baseten

Baseten — это платформа AI-инфраструктуры, которая специализируется на serverless-инференсе, обучении моделей и смежных задачах. В каталоге сервиса представлено множество фронтирных моделей, а разработчики могут встроить самые разные AI-возможности в свои приложения с минимальной настройкой. Платформа поддерживает широкий спектр типов моделей — от больших языковых до систем преобразования текста в речь.

На старте интеграции Baseten обеспечивает поддержку диалоговых задач и генерации текста на Hugging Face. Это открывает доступ к востребованным open-weight моделям: Kimi K3, последней версии DeepSeek V4 Flash, GLM-5.2 и ряду других. Поддержка дополнительных типов задач появится в ближайшее время — команда обещает постепенно расширять список.

Для российских разработчиков это заметное упрощение рабочих процессов. Вместо того чтобы разворачивать собственные GPU-мощности или подписываться на несколько облачных сервисов, можно работать с актуальными моделями через единую точку входа. Полный перечень моделей, доступных через Baseten, опубликован на странице провайдера, а саму компанию можно отслеживать на Хабе по адресу huggingface.co/baseten.

Два режима работы: свой ключ или маршрутизация через Hugging Face

В настройках пользовательского аккаунта Hugging Face можно указать собственные API-ключи для провайдеров, с которыми вы зарегистрированы. Если персональный ключ не задан, запросы автоматически маршрутизируются через инфраструктуру Hugging Face. Там же можно упорядочить провайдеров по приоритету — эта настройка влияет на виджеты и фрагменты кода, отображаемые на страницах моделей.

Таким образом, существует два режима вызова Inference Providers. Первый — с собственным ключом: запросы идут напрямую к провайдеру, и оплата происходит по вашему аккаунту у соответствующего сервиса. Второй — маршрутизация через Hugging Face: токен провайдера не нужен вовсе, а списания происходят с аккаунта Hugging Face, а не со счёта провайдера.

Страницы моделей теперь показывают сторонних провайдеров инференса, совместимых с конкретной моделью, с сортировкой по пользовательским предпочтениям. Это делает выбор способа запуска максимально прозрачным: вы сразу видите, какие варианты доступны, и можете переключаться между ними без правки кода.

Вызов моделей из Python и JavaScript

Baseten доступен через официальные SDK Hugging Face — библиотеку huggingface_hub версии 1.26.1 и выше для Python, а также пакет @huggingface/inference для JavaScript. Для аутентификации достаточно токена Hugging Face — запрос будет автоматически направлен в Baseten.

Пример на Python с использованием OpenAI-совместимого клиента:

import os
from openai import OpenAI client = OpenAI( base_url="https://router.huggingface.co/v1", api_key=os.environ["HF_TOKEN"],
) completion = client.chat.completions.create( model="deepseek-ai/DeepSeek-V4-Flash-0731:baseten", messages=[ { "role": "user", "content": "Write a Python function that returns the nth Fibonacci number using memoization." } ],
) print(completion.choices[0].message)

Аналогичный пример на JavaScript:

import { OpenAI } from "openai"; const client = new OpenAI({ baseURL: "https://router.huggingface.co/v1", apiKey: process.env.HF_TOKEN,
}); const chatCompletion = await client.chat.completions.create({ model: "deepseek-ai/DeepSeek-V4-Flash-0731:baseten", messages: [ { role: "user", content: "Write a Python function that returns the nth Fibonacci number using memoization.", }, ],
}); console.log(chatCompletion.choices[0].message);

Обратите внимание на формат идентификатора модели: после названия через двоеточие указывается провайдер — в данном случае baseten. Такой подход позволяет явно задавать, через какую инфраструктуру выполнять запрос.

Поддержка агентных фреймворков

Inference Providers интегрированы в большинство популярных агентных инструментов — включая Pi, OpenCode, Hermes Agents, OpenClaw и другие. Это означает, что модели, размещённые у Baseten, можно подключать напрямую к привычным рабочим инструментам без написания дополнительного связующего кода.

Для команд, которые строят AI-агентов и автоматизированные пайплайны, это существенная экономия времени. Полный список интеграций доступен в документации Hugging Face.

Тарификация и бонусы для подписчиков

При прямых запросах — когда используется ключ самого провайдера инференса — оплату выставляет соответствующий сервис. Например, при использовании API-ключа Baseten списания происходят с вашего аккаунта Baseten.

При маршрутизируемых запросах, когда аутентификация проходит через Hugging Face Hub, действуют стандартные тарифы API провайдера. Hugging Face подчёркивает, что не добавляет никакой наценки — стоимость провайдера просто передаётся напрямую. В будущем компания допускает заключение соглашений о разделе выручки с партнёрами-провайдерами.

Подписчики PRO ежемесячно получают кредиты на инференс в размере 2 долларов, которые можно тратить у любых провайдеров. Подписка PRO также открывает доступ к ZeroGPU, режиму разработки Spaces Dev Mode, двадцатикратно увеличенным лимитам и другим преимуществам. Авторизованным пользователям бесплатного тарифа доступна небольшая бесплатная квота на инференс, однако команда настоятельно рекомендует переходить на PRO тем, кто пользуется платформой активно.

Команда Hugging Face просит пользователей делиться отзывами и предложениями по работе нового провайдера в специальной ветке обсуждений на платформе. Учитывая темпы развития экосистемы Inference Providers — в этом году к ней уже присоединились DeepInfra, Scaleway и другие игроки — можно ожидать, что список поддерживаемых задач и моделей у Baseten будет расти достаточно быстро.

Источник: HF