Что нового в mClouds в сентябре: GPU, Veeam и инструменты для ИИ

Сентябрьские обновления mClouds были посвящены инфраструктуре для искусственного интеллекта и практическим сценариям его использования. Компания расширила линейку GPU-конфигураций, обновила сервис резервного копирования и подготовила материалы о запуске локальных языковых моделей, корпоративных базах знаний и серверных технологиях.
Виртуальная машина с двумя NVIDIA L4
В mClouds появилась конфигурация с двумя ускорителями NVIDIA L4. Она рассчитана на ситуации, когда одной L4 уже недостаточно, а переход к более производительной NVIDIA L40S оказывается избыточным по сложности или стоимости. Два ускорителя дают суммарно 48 ГБ видеопамяти.
В конфигурацию входят две NVIDIA L4 по 24 ГБ, 16 высокочастотных vCPU на базе AMD EPYC 9555, 64 ГБ оперативной памяти DDR5 и 300 ГБ NVMe-накопителя. Такой сервер можно использовать для запуска LLM и ИИ-помощников, экспериментов с дообучением моделей, генерации изображений и обработки видео.
Обновление BaaS до Veeam 13
Сервис резервного копирования mClouds обновили до 13-й версии Veeam. Основной акцент в релизе сделан на безопасности: в продукте исправлены критические уязвимости, появился ИИ-анализ подозрительной активности и добавилось двойное подтверждение для критически важных действий.
Кроме того, обновление принесло поддержку единого входа, ускоренное восстановление и расширенные возможности Continuous Data Protection для физических и виртуальных Linux- и Windows-нагрузок. Это позволяет защищать данные с минимальной точкой восстановления.
Материалы о безопасности и серверных технологиях
В сентябре mClouds выпустила инструкции по настройке CrowdSec на Linux. В материале разобраны обнаружение подозрительной активности, блокировка перебора паролей по SSH и проверка веб-запросов.
Отдельное направление публикаций связано с аппаратной инфраструктурой. Компания рассказала о графическом процессоре NVIDIA RTX PRO 5500 Blackwell, технологии CXL для расширения серверной памяти и применении LPDDR5X в дата-центрах. В статьях на Хабре также разобраны повторное использование модулей DDR4, ограничения по скорости и совместимости CXL, а также особенности съемного формата памяти SOCAMM2 и его влияние на энергопотребление серверов.
Запуск локальных LLM и использование RAG
В блоге mClouds объяснили, как оценивать необходимый объем VRAM для языковой модели. Одного размера весов недостаточно: дополнительную память занимают длинный контекст и одновременные запросы. Поэтому модели объемом около 14 ГБ может оказаться тесно даже на видеокарте с 16 ГБ памяти.
Еще один материал посвящен запуску локальной LLM с RAG-системой. Такой подход позволяет подключить к помощнику документы компании и искать ответы в инструкциях, регламентах и внутренней базе знаний. В руководстве описаны развертывание модели на GPU-сервере mClouds, подключение документов и настройка веб-интерфейса.
В рамках практического сравнения mClouds протестировала Qwen3.5-9B и Gemma 4 E4B на NVIDIA L4 с 24 ГБ видеопамяти. Модели отвечали на один и тот же вопрос на русском языке — с подключенной базой знаний и без нее. При оценке учитывались качество и характер ответов, скорость генерации и расход VRAM. Gemma показала около 45 токенов в секунду, а Qwen — около 28. При этом Gemma отвечала короче и более по существу, тогда как Qwen давала более подробные ответы.


