ГигаЧат научился создавать видео со звуком в Full HD

Сбер добавил в ГигаЧат модель Kandinsky 6.0 Video, которая умеет создавать короткие видеоролики одновременно с аудиодорожкой. Пользователь может описать сцену текстом или загрузить первый кадр, а затем указать, какие реплики, музыку и звуки должны появиться в ролике.
Генерация доступна бесплатно. Максимальное качество видео — Full HD, а продолжительность ролика со звуком ограничена пятью секундами. По заявлению компании, в дальнейшем длительность планируют увеличить, однако конкретные сроки не называются.
Какие звуки создает модель
Kandinsky 6.0 Video способна объединять в одной сцене несколько типов аудио: речь персонажей и диалоги, фоновую музыку, звуки окружающей среды и отдельные эффекты. Например, в ролике могут одновременно звучать шаги, ветер, шум автомобиля и реплика героя. При необходимости видео можно сгенерировать без озвучки.
Сбер также заявляет, что новая версия лучше передает физику реального мира. Движения людей, животных и объектов должны выглядеть естественнее, особенно в сценах с быстрым перемещением или сменой ракурса. Звуковая дорожка создается с частотой 44 кГц; разработчики отмечают отсутствие шипения и заметной потери качества.
Как создать ролик в ГигаЧате
Для работы с моделью не требуются специальные навыки. В разделе «Видео» нужно нажать «Создать», выбрать готовый пример или загрузить собственное изображение. Затем можно описать сценарий и отдельно указать нужную речь, музыку, звуки окружения или эффекты.
Перед запуском генерации пользователь выбирает качество: SD подойдет для более быстрого результата, HD даст более четкое изображение, а Full HD — максимальную детализацию. Создание ролика занимает около восьми минут.
Модель может использоваться для коротких рекламных материалов, тестирования творческих идей и подготовки публикаций для соцсетей. Авторы контента смогут делать ролики с репликами персонажей и фоновой музыкой, дизайнеры — собирать черновые презентации, а обычные пользователи — создавать видеооткрытки, оживлять фотографии и экспериментировать с ASMR-сценами.
Обучение и результаты сравнения
Kandinsky 6.0 Video состоит из двух связанных модулей — видео и звука. Аудиомодуль обучали более чем на 20 млн видеороликов. Для датасета отбирали материалы с качественным звуком, а также крупные планы говорящих людей, чтобы улучшить синхронизацию речи и мимики.
По оценке Сбера, версия Kandinsky 6.0 Video Pro в среднем превосходит Kandinsky 5.0 в 71% случаев по совокупности критериев и опережает открытую модель LTX 2.5. В задаче оживления изображений разработчик также заявляет преимущество над Veo 3.1 Fast по визуальному качеству, соответствию исходной картинке и движению камеры. Подробная методика этих сравнений не раскрыта.
Доступ для разработчиков
Kandinsky 6.0 Video распространяется под лицензией MIT. Это позволяет бесплатно интегрировать модель в собственные продукты. Сбер также заявил о поддержке инструментов FAL, Diffusers, FastVideo, ComfyUI, SGLang и vLLM-omni, благодаря чему разработчики смогут подключать модель к существующим пайплайнам без создания интеграции с нуля.

