В Рег.облаке запустили инференс ИИ-моделей на NVIDIA B300

Рег.облако расширил GPU-инфраструктуру ускорителями NVIDIA B200 и B300. Новые мощности уже доступны клиентам для собственных AI/ML-задач, а часть систем на базе B300 используется внутри собственной ИИ-платформы.
На этих ускорителях запущен инференс моделей, которые размещены непосредственно в инфраструктуре Рег.облака. Ранее некоторые модели на платформе предоставлялись через внешних поставщиков, однако теперь отдельные варианты работают полностью во внутреннем контуре.
Обработка запросов внутри инфраструктуры
При работе с моделями, размещёнными в Рег.облаке, запросы не передаются сторонним AI-провайдерам и не покидают инфраструктуру компании. Кроме того, такие обращения не логируются.
Это позволяет использовать модели без виртуальной частной сети компании и без трансграничной передачи данных. Оплата рассчитывается в рублях исходя из фактического количества использованных токенов.
Возможности NVIDIA B300
NVIDIA B300 относится к поколению Blackwell Ultra и рассчитана, в том числе, на инференс reasoning- и agentic-моделей. В конфигурации HGX B300 восемь ускорителей объединяют более 2 ТБ памяти HBM3E. Такой объём позволяет размещать крупные модели и выполнять более тяжёлые inference-нагрузки.
Через единый интерфейс и API ИИ-платформы сейчас доступно почти 40 моделей. По данным Рег.облака, платформой уже воспользовались более тысячи клиентов. Каталог моделей, работающих непосредственно на собственной инфраструктуре, планируют расширять по мере ввода новых GPU-мощностей.
Ускорители NVIDIA B200 и B300 также можно использовать для собственных задач клиентов: инференса и тестирования моделей, а также других ресурсоёмких вычислений. Перечень доступных моделей опубликован в каталоге Рег.облака.


