11:17 Сегодня
Пользователи ГигаЧата теперь могут бесплатно создавать видео со звуком в Full HD
Kandinsky 6.0 Video генерирует ролики с речью, музыкой и окружающими звуками продолжительностью до пяти секунд
Пользователям ГигаЧата стала доступна генерация видео с синхронным звуком. Создавать такие ролики позволяет новая модель Сбера Kandinsky 6.0 Video. Специальные навыки для работы с ней не требуются.
Чтобы получить готовое видео с озвучкой, достаточно описать нужную сцену текстом. Другой вариант — загрузить первый кадр и добавить описание звукового сопровождения. Пока максимальная продолжительность ролика со звуком составляет пять секунд, но в дальнейшем разработчики планируют её увеличить.
Видео можно создавать в разрешении до Full HD. Перед отправкой запроса пользователи ГигаЧата смогут самостоятельно выбрать качество:
— SD — для более быстрой генерации;
— HD — для более чёткой картинки;
— Full HD — для наиболее детализированного изображения.
Kandinsky 6.0 Video стала первой российской нейросетью, способной создавать видео с синхронным звуком. Модель одновременно работает с изображением и аудио, благодаря чему речь, звуковые эффекты и музыка соответствуют происходящему в кадре. При генерации диалогов движения губ персонажей синхронизируются с речью.
Кроме того, разработчики улучшили передачу физики реального мира. Движения людей, животных, техники и других объектов стали естественнее, а сами сцены — реалистичнее. Особенно это заметно в динамичных роликах, где быстро меняются движение или ракурс.
Нейросеть способна генерировать широкий спектр звуков — человеческую речь, шаги, шум ветра, звук проезжающего автомобиля, цифровые эффекты и музыку. В одном видео можно совместить диалог, окружающие звуки и музыкальное сопровождение. Звук создаётся с частотой 44 кГц. При необходимости пользователь может попросить модель сделать ролик без аудио.
Старший вице-президент, руководитель блока «Развитие генеративного ИИ» Сбербанка Антон Фролов рассказал, что генеративный искусственный интеллект должен стать привычным инструментом для создания контента.
«Мы хотим, чтобы генеративный ИИ стал таким же естественным инструментом креатора, как сегодня текстовый редактор или камера телефона. Любой человек получает возможность снимать более выразительные личные видео. А для профессионального контента это означает более быстрое и выгодное производство. Модель Kandinsky 6.0 Video мы отдаём разработчикам бесплатно и без ограничений — строить на ней свои сервисы может каждый», — отметил Антон Фролов.
В Сбере считают, что возможности модели пригодятся как для личных, так и для профессиональных задач. С помощью Kandinsky 6.0 Video можно оживить семейную фотографию, подготовить видеооткрытку с речью или музыкой, создать ASMR-ролик со звуками шелеста бумаги, потрескивания дров или скрипа снега, а также анимировать старый мем или кадр из фильма.
Авторы контента смогут создавать короткие видео с озвученными репликами и фоновыми звуками без актёров, микрофонов и отдельного монтажа аудио. Малому бизнесу модель позволит готовить рекламные ролики о товарах и услугах без съёмочной группы. Маркетологи и SMM-специалисты смогут делать тестовые видео с диалогами, музыкой и звуками окружения, преподаватели — оживлять архивные фотографии и портреты исторических личностей, а дизайнеры — собирать черновые ролики со звуком для презентации своих идей.
Если модель не знает, как выглядит указанный в запросе объект, например недавно появившийся персонаж поп-культуры, она может найти референсы и использовать их при генерации. Это позволяет создавать объекты, появившиеся уже после завершения обучения нейросети.
Для разработчиков Kandinsky 6.0 Video распространяется в открытом исходном коде под лицензией MIT. Модель можно бесплатно интегрировать в собственные продукты. Она также будет доступна в FAL, Diffusers, FastVideo, ComfyUI, SGLang и vLLM-omni, поэтому подключить её можно будет к уже существующим сервисам без необходимости создавать интеграцию с нуля.
Kandinsky 6.0 Video состоит из двух связанных модулей, отвечающих за генерацию изображения и звука. Аудиомодуль обучали более чем на 20 млн различных видео. Для этого команда отбирала ролики с чистым и качественным звуком. Отдельно использовались видео с говорящими людьми крупным планом, чтобы повысить точность синхронизации речи и мимики.
В версии Kandinsky 6.0 Video Pro разработчики также улучшили общее визуальное качество, следование текстовому запросу и движение камеры. По представленным Сбером данным, новая модель превосходит Kandinsky 5.0 в среднем в 71% случаев по совокупности критериев и опережает открытую LTX 2.5. В задаче оживления изображения заявлено преимущество над Veo 3.1 Fast по визуальному качеству, соответствию исходному изображению и движению камеры.