• Электровелосипед Ariel Rider MUDD 72V может разгоняться до 105 км/ч (3 фото)

    Компания Ariel Rider открыла предзаказ на новый электробайк MUDD 72V. По своим возможностям он больше напоминает электрические мотоциклы начального уровня, чем классический велосипед.
    Читать дальше
  • Ровер Curiosity обнаружил на Марсе огромное поле из неправильных сот (3 фото)

    Марсоход NASA Curiosity обнаружил в кратере Гейла обширный участок поверхности, покрытый небольшими многоугольными структурами, напоминающими пчелиные соты. Ранее ровер находил подобные образования, но новая находка по масштабам затмила все предыдущее такие открытия.
    Читать дальше
  • Илон Маск запустил платёжный сервис X Money

    Платёжная служба Илона Маска X Money заработала для пользователей X Premium и Premium Plus. Им стали доступны основные финансовые сервисы платформы.
    Читать дальше
  • Стартап Chip Motors показал универсальный электромобиль за $15 000 (4 фото)

    Американский стартап Chip Motors представил компактный электрокар Chip. Сам производитель называет его универсальным автомобилем для активного образа жизни. Машина рассчитана на короткие ежедневные поездки и относится к категории низкоскоростных транспортных средств.
    Читать дальше
  • Самый быстрый радиоуправляемый автомобиль обгоняет настоящие болиды (видео)

    Британский инженер Стивен Уоллис доказал, что радиоуправляемые машинки могут быть невероятно быстрыми. Его Mach Reaper установил мировой рекорд скорости и превзошёл показатели многих настоящих гоночных автомобилей.
    Читать дальше

Китайцы представили нейросеть EMO — она оживляет портреты, заставляя их разговаривать и даже петь (видео)

1 марта 2024 | Просмотров: 17 463 | Новости IT

Исследователи из Института интеллектуальных вычислений Alibaba разработали (PDF) систему искусственного интеллекта EMO (Emote Portrait Alive), которая анимирует статическое изображение человека, заставляя его реалистично говорить или петь.

Система изображает реалистичную мимику и движения головы, точно соответствующие эмоциональным оттенкам звукового ряда, на основе которого генерируется анимация. «Традиционные методы зачастую неспособны передать полный спектр человеческих выражений лица и уникальность отдельных его стилей. Для решения этих проблемы мы предлагаем EMO — новый фреймворк, использующий подход прямого синтеза из аудио в видео, минуя потребность в промежуточных 3D-моделях или лицевых опорных точках», — пояснил глава группы разработчиков Линьжуй Тянь (Linrui Tian).


В основе системы EMO лежит диффузионная модель ИИ, зарекомендовавшая себя как способная генерировать реалистичные изображения. Исследователи обучили её на массиве данных, включающем более 250 часов видеозаписей «говорящей головы»: выступлений, фрагментов фильмов, телешоу и вокальных выступлений. В отличие от предыдущих методов, предполагающих создание трёхмерной модели или механизмов имитации человеческой мимики, EMO предполагает прямое преобразование звука в видеоряд. Это позволяет системе передавать мельчайшие движения и связанные с естественной речью особенности личности.

Авторы проекта утверждают, что EMO превосходит существующие методы по показателям качества видео, сохранения идентичности и выразительности. Исследователи опросили фокус-группу, и та показала, что созданные EMO видеоролики более естественны и эмоциональны, чем произведения других систем. Система создаёт анимацию не только на основе речи, но и с использованием звукового ряда с вокалом — она учитывает форму рта человека на оригинальном изображении, добавляет соответствующую мимику и синхронизирует движения с вокальной партией. Единственной связанной с EMO проблемой является вероятность злоупотребления этой технологией. Исследователи сообщают, что планируют изучить методы выявления созданных ИИ видеороликов.

Комментарии: 0

В Вашем браузере отключен JavaScript. Для корректной работы сайта настоятельно рекомендуется его включить.