В ГигаЧате появилась генерация видео со звуком на основе Kandinsky 6.0 Video

В мессенджере ГигаЧат теперь доступна бесплатная генерация видеороликов с синхронным звуком в качестве до Full HD. Эта функция реализована на базе новой мультимодальной модели Kandinsky 6.0 Video, которая одновременно создает изображение и аудиодорожку. Об этом сообщает Наша Газета Крым.

Для получения готового ролика достаточно описать сцену текстом или загрузить первый кадр и добавить описание звукового ряда. Максимальная длительность такого видео составляет пять секунд, однако в будущем разработчики намерены увеличить этот показатель.

Старший вице-президент и руководитель блока «Развитие генеративного ИИ» Сбербанка Антон Фролов отметил, что цель компании — сделать генеративный ИИ естественным инструментом для креаторов. По его словам, данная модель позволяет любому человеку создавать более выразительные личные видео, а для профессионального контента это ускоряет и удешевляет процесс производства. Kandinsky 6.0 Video передается разработчикам бесплатно и без ограничений.

Модель способна генерировать звук в широком диапазоне: от диалогов и цифровых эффектов до шагов, шума ветра или проезжающей машины. В одном ролике можно объединить речь, музыку и звуки окружения, при этом аудио создается в формате 44 кГц без потери качества. Если звук не требуется, нейросеть может создать видео без него.

Kandinsky стал первой российской нейросетью, способной создавать видео с синхронным звуком. Модель также улучшила передачу физики реального мира: движения людей, животных и техники выглядят более естественно. Для разработчиков Kandinsky 6.0 Video доступна в опенсорсе под лицензией MIT, что позволяет интегрировать ее в существующие продукты без необходимости написания интеграции с нуля.