13:55 Сегодня
Сбер представил нейросеть Kandinsky WM для обучения роботов законам физики
Новая разработка Сбера позволит быстрее обучать беспилотный транспорт и промышленных роботов, создавая реалистичные видеосценарии даже для редких и опасных ситуаций.
Сбер представил семейство генеративных моделей Kandinsky WM 1.0, способных создавать видео с более точным соблюдением законов физики. Новинка разработана на базе Kandinsky 5.0 Video Lite, которую дополнительно обучили на записях с камер роботов, беспилотных автомобилей и различных промышленных процессов.
Модели предназначены для развития систем Physical AI — искусственного интеллекта, работающего с реальным физическим миром. Они позволяют генерировать видеосценарии для обучения роботов и беспилотного транспорта, в том числе в случаях, когда получить реальные записи невозможно, слишком дорого или небезопасно. Код и веса нейросетей опубликованы под лицензией MIT и бесплатно доступны разработчикам по всему миру.
Physical AI отличается от языковых моделей тем, что ему требуются огромные массивы видеоданных о происходящем в реальном мире. Получить такой объем информации крайне сложно. Так, один автомобиль с камерами и датчиками собирает около 5 тысяч часов записей в год, тогда как для обучения современных моделей необходимы миллионы часов. При этом некоторые ситуации — аварии, экстремальные погодные условия или отказы оборудования — невозможно специально воспроизвести.
По мнению лауреата премии Тьюринга Яна Лекуна, следующий этап развития искусственного интеллекта связан именно с обучением на видео. Он отмечал, что четырехлетний ребенок только благодаря зрению получает больше информации, чем содержится во всех текстах, использованных для обучения крупнейших языковых моделей.
Kandinsky WM 1.0 создает ролики продолжительностью около пяти секунд, воспроизводя отдельные действия и ситуации:
– взаимодействие с предметами — например, взять, положить или разрезать объект;
– дорожные сценарии — перестроение, проезд перекрестков и другие маневры;
– отдельные этапы производственных процессов.
Именно из таких небольших сцен формируются обучающие наборы данных для автономных систем. Разработчики отмечают, что в дальнейшем подобные модели могут стать основой полноценных цифровых симуляторов, позволяющих обучать и тестировать роботов в виртуальной среде.
Для повышения реалистичности Kandinsky 5.0 Video Lite дополнительно обучили на нескольких миллионах реальных видеосцен с автомобилями, роботами, промышленным оборудованием и сложными движениями объектов. Для автомобильных сюжетов также применялось обучение с подкреплением. Специальные алгоритмы оценивали сохранение формы объектов, правильность геометрии и естественность движения, после чего модель совершенствовала качество генерации.
Kandinsky WM 1.0 стала первым открытым российским семейством моделей, предназначенных для генерации физически достоверных видеоданных. Разработка будет полезна создателям беспилотных автомобилей, роботакси, грузового транспорта, производителям промышленных, сервисных и антропоморфных роботов, компаниям, внедряющим системы компьютерного зрения, а также научным коллективам, университетам и стартапам.
Новые модели уже используются Центром робототехники Сбера для обучения собственных роботов, а также институтом AIRI при разработке дорожного симулятора.
CTO Kandinsky, управляющий директор по исследованию данных Сбера Денис Димитров пояснил, что разработка подобных моделей приближает появление систем, способных понимать законы физического мира и самостоятельно принимать решения в реальных условиях. Он отметил, что многие процессы невозможно точно описать математическими формулами, поэтому обучение на видеоданных становится наиболее эффективным способом накопления такого опыта.
«Чтобы просчитать, как поведёт себя коробка на мокром конвейере, нужно знать огромное количество параметров, которых у нас нет. Есть кейсы, которые вообще не описывается уравнениями, например, поведение пешехода перед беспилотным автомобилем», — рассказал Денис Димитров.
По его словам, человек решает подобные задачи благодаря накопленному жизненному опыту, а не только вычислениям.
«Наши модели учатся так же — на видео реального мира — и позволяют “прожить” виртуально даже те сценарии, которые опасно или невозможно воспроизвести. Это шаг к моделям мира — системам, которые понимают физическую реальность, предсказывают, что произойдёт дальше, и могут действовать в ней самостоятельно», — подчеркнул Денис Димитров.