Selectel Foundation Models Catalog — приватный доступ, ru-6 и новые модели
Selectel Foundation Models Catalog — приватный доступ, ru-6 и новые модели
24 августа 2026 года было объявлено о расширении Foundation Models Catalog (FMC) — сервиса Selectel для запуска преднастроенных AI-моделей в виде отдельных inference-сервисов.
Основные изменения:
- приватный доступ к моделям без выхода запросов в интернет;
- новый отказоустойчивый регион
ru-6на базе трёх независимых зон доступности; - возможность разнести одинаковые inference-сервисы по разным зонам;
- новые модели в квантизации NVFP4;
- модели семейства Qwen с контекстом до 262 тысяч токенов;
- дальнейшее расширение моделей в FP8 и NVFP4 для доступных в
ru-6GPU.
Новость передана CNews представителем Selectel. При этом часть возможностей появилась раньше и уже отражена в официальной документации: public preview начался в апреле, модели NVFP4 добавлялись в июне, а приватное подключение — в июле. Поэтому 24 августа корректнее считать датой публичного объявления комплексного обновления, а не датой запуска каждой функции.
Что такое Foundation Models Catalog
Foundation Models Catalog — каталог преднастроенных ML-моделей с готовым API. Каждая выбранная модель разворачивается как изолированный inference-сервис с выделенными ресурсами:
- GPU;
- vCPU;
- RAM;
- диск;
- отдельный endpoint;
- индивидуальные API-ключи.
Запросы к LLM выполняются через endpoint, совместимый с OpenAI API. Это упрощает перенос приложения, которое уже использует OpenAI-compatible SDK или клиентскую библиотеку.
Пример общей схемы:
приложение
↓
OpenAI-compatible client
↓
выделенный endpoint FMC
↓
изолированный inference-сервис
↓
GPU / vCPU / RAM / disk Selectel
Модель не вызывается как общий serverless API с оплатой за каждый токен. Пользователь разворачивает собственный inference-сервис и оплачивает выделенные облачные ресурсы.
Текущая стадия продукта
На момент проверки 25 августа 2026 года официальная документация всё ещё помечает Foundation Models Catalog как public preview.
Это важная оговорка:
- нельзя автоматически считать продукт зрелым GA-сервисом;
- условия, набор моделей и тарификация могут меняться;
- перед production нужно проверить SLA и поддержку конкретной конфигурации;
- желательно иметь резервный endpoint или возможность развернуть модель самостоятельно.
Public preview не означает бесплатную инфраструктуру. Inference-сервис оплачивается по модели pay-as-you-go за фактически выделенные ресурсы облачной платформы.
Публичное и приватное подключение
При создании inference-сервиса можно выбрать тип доступа.
Публичный endpoint
Endpoint доступен через интернет. Для него автоматически создаётся доменное имя, а доступ защищается индивидуальными API-ключами.
Подходит для:
- быстрого теста;
- приложений за пределами Selectel;
- интеграции из другой облачной платформы;
- сценариев, где интернет-трафик допустим политиками безопасности.
Приватный endpoint
Endpoint доступен только из приватной сети пользователя. Запросы к модели не должны выходить в публичный интернет.
Подходит для:
- внутренних корпоративных систем;
- RAG по закрытым документам;
- финансовых, медицинских и государственных сценариев;
- приложений, уже размещённых в приватной сети Selectel;
- гибридной инфраструктуры с подключением собственного ЦОД через Direct Connect.
Приватный endpoint сам по себе не решает все вопросы безопасности. Всё равно нужно проверить:
- маршруты и security groups;
- хранение API-ключей;
- роли пользователей и проектов;
- аудит действий;
- логирование prompts и ответов;
- передачу персональных и конфиденциальных данных;
- договорные условия конкретной услуги.
Регион ru-6 и отказоустойчивость
В объявлении 24 августа ru-6 описан как новый отказоустойчивый регион на базе трёх независимых зон доступности.
Пользователь может развернуть одинаковые inference-сервисы в разных зонах и построить схему с резервированием:
приложение
↓
собственный router / health checks
├── inference-service A, ru-6a
└── inference-service B, ru-6b или ru-6c
Наличие трёх зон не создаёт автоматический failover приложения. Нужно отдельно реализовать:
- health checks endpoint;
- тайм-ауты;
- retry только для безопасных запросов;
- circuit breaker;
- переключение между endpoints;
- синхронизацию конфигурации и версий модели;
- мониторинг качества ответа после переключения;
- контроль двойной стоимости резервных ресурсов.
При развёртывании двух inference-сервисов оплачиваются ресурсы обоих. Георезервирование повышает доступность, но может заметно увеличить постоянные расходы.
Новые модели и NVFP4
В официальных release notes за июнь уже перечислены модели:
unsloth/Qwen3.6-35B-A3B-NVFP4;unsloth/Qwen3.6-27B-NVFP4;google/gemma-4-12B.
В объявлении 24 августа отдельно подчёркивается квантизация NVFP4, оптимизированная под GPU поколения Blackwell, и модели Qwen с максимальным контекстом до 262 тысяч токенов.
Большой context window полезен для:
- анализа длинных документов;
- работы с крупными техническими спецификациями;
- длительных агентских сценариев;
- обработки нескольких связанных материалов одним запросом;
- больших RAG-context bundles.
Но максимальный размер контекста не означает, что всегда нужно отправлять 262 тысячи токенов. Перед production необходимо измерить:
- latency;
- качество на длинном контексте;
- расход GPU-памяти;
- throughput;
- поведение при параллельных запросах;
- качество поиска нужного фрагмента внутри большого prompt;
- стоимость выделенной конфигурации.
Часто RAG с хорошим retrieval и меньшим контекстом быстрее и устойчивее, чем передача всей базы документов в один запрос.
OpenAI-compatible API
Совместимость с OpenAI API уменьшает объём изменений в приложении. Обычно достаточно заменить:
base_url;- API key;
- имя модели;
- параметры, которые поддерживает конкретный endpoint.
Условный Python-пример:
from openai import OpenAI
client = OpenAI(
base_url="https://<foundation-models-endpoint>/v1",
api_key="<inference-service-api-key>",
)
response = client.chat.completions.create(
model="<model-name>",
messages=[
{"role": "user", "content": "Кратко перескажи документ"},
],
timeout=60,
)
print(response.choices[0].message.content)
Точный endpoint и model identifier нужно брать из панели конкретного inference-сервиса. Нельзя копировать значения из чужого примера.
Совместимость API не гарантирует идентичность поведения моделей. После миграции нужно повторить evals, проверить structured output, tool calling, streaming, stop sequences и обработку ошибок.
Масштабирование и оплата
Foundation Models Catalog использует pay-as-you-go: средства списываются каждый час за ресурсы облачной платформы.
Стоимость зависит от выбранной конфигурации:
- GPU;
- vCPU;
- RAM;
- диск;
- количество inference-инстансов.
На время public preview официальная документация указывает:
- количество токенов не включается в стоимость;
- для публичного доступа предоставляется бесплатное доменное имя.
Это не означает «безлимитную дешёвую LLM». Стоимость выделенного GPU может быть выше токенной оплаты внешнего API при небольшой или нерегулярной нагрузке.
Выделенный inference-сервис логичнее рассматривать, когда важны:
- предсказуемая постоянная нагрузка;
- изоляция ресурсов;
- приватная сеть;
- контроль инфраструктуры;
- высокий throughput;
- отсутствие оплаты за каждый отдельный токен.
Для редких запросов сначала нужно сравнить итоговую месячную цену с внешним API.
Ограничения public preview
По официальной документации Foundation Models Catalog пока не поддерживает:
- асинхронный режим на стороне сервера;
- загрузку собственных моделей в каталог;
- развёртывание моделей из каталога on-premise;
- развёртывание в А-ЦОД;
- развёртывание на выделенных серверах;
- развёртывание в аттестованном облаке.
На стороне клиента можно отправлять запросы асинхронно, но серверный inference обрабатывает их в синхронном режиме.
Особенно важно не смешивать утверждения:
данные хранятся в российской инфраструктуре
и
конкретный inference-сервис подходит для регулируемой системы
Для второго вывода нужны документы, архитектура, договор и проверка конкретного продукта.
Что проверить перед production
- Доступна ли нужная модель и конфигурация в выбранной зоне
ru-6. - Какая стадия готовности и SLA действуют на дату запуска.
- Публичный или приватный endpoint требуется приложению.
- Работает ли связность через приватную сеть и Direct Connect.
- Как хранятся и ротируются API-ключи.
- Какой throughput даёт одна inference-инстанция.
- Как меняются latency и качество на длинном контексте.
- Что происходит при масштабировании и уменьшении числа инстансов.
- Как приложение переключается между зонами.
- Совпадает ли OpenAI-compatible поведение с ожиданиями SDK.
- Какие данные попадают в логи и метрики.
- Можно ли быстро развернуть резервную модель у другого провайдера.
Влияние на оценку Selectel
Обновление расширяет AI-возможности Selectel и делает сервис интереснее для приватного inference и геораспределённых схем.
Категорию провайдера в каталоге менять не требуется: Selectel остаётся в «Рекомендую». Foundation Models Catalog всё ещё находится в public preview и должен оцениваться отдельно от уже проверенного VDS и основной облачной платформы.
Источники
- CNews: Selectel усиливает AI-платформу новой функциональностью в каталоге моделей, 24 августа 2026 года
- Документация Selectel: описание Foundation Models Catalog
- Документация Selectel: release notes Foundation Models Catalog
- Документация Selectel: модель оплаты и цены Foundation Models Catalog
- Страница Foundation Models Catalog
