Представлена нейросеть OmniHuman-1: создает максимально живые видео по фотографиям
Баку, 5 февраля, АЗЕРТАДЖ
В Китае компания ByteDance разработала систему искусственного интеллекта, которая преобразует фотографии в максимально реалистичные видеоролики.
Как передает АЗЕРТАДЖ со ссылкой на китайские медиа, новая система под названием OmniHuman-1 генерирует видеоролики в полный рост, на которых люди жестикулируют и двигаются в соответствии с речью, превосходя предыдущие модели искусственного интеллекта, которые могли анимировать только лица или верхнюю часть тела.
«В последние годы сквозная человеческая анимация претерпела заметные улучшения. Однако существующие методы по-прежнему с трудом масштабируются в качестве больших общих моделей генерации видео, что ограничивает их потенциал в реальных приложениях», - заявили в ByteDance.
Команда обучила OmniHuman-1 на более чем 18 700 часах человеческих видеоданных, используя новый подход, который объединяет несколько типов входных данных - текст, аудио и движения тела. Эта стратегия обучения «всеобщих условий» позволяет ИИ обучаться на гораздо более крупных и разнообразных наборах данных, чем предыдущие методы.
«Наша главная идея заключается в том, что включение в процесс обучения множественных кондиционирующих сигналов, таких как текст, аудио и поза, может значительно сократить потери данных», - пояснила исследовательская группа.
В ходе тестирования OmniHuman-1 превзошла существующие системы сразу по нескольким показателям качества.