Как оживить историческую личность с помощью нейросетей?
Ivan OrloveПривет!
Давайте поговорим о нейросетях. В последние два года среди обывателей укрепилось мнение: «Нейросети скоро заменят всех!» Например, вместо недель работы моушн-дизайнеров — пара промптов в Runway или Sora, и готово.
Но так ли это на самом деле? Действительно ли нейросети — волшебная палочка, способная решить любую задачу?
Ответ: Да, нейросети мощные, но «магом» становится не каждый. Для сложных проектов их часто приходится комбинировать, а результат — дорабатывать в классических редакторах.
Чтобы показать это на практике, разберём реальный кейс — оживление портрета Виктора Муравленко для открытия выставки нефтяной и газовой промышленности.
Задача:
- Анимировать исторического персонажа, чтобы он «произнёс» речь.
- Синтезировать голос, похожий на оригинальный.
- Формат: вертикальное видео 2160×3840, хронометраж — 1 минута.
Исходник
«Ну че? Закидывай фото в Runway или Sora — и готово!» 😄
Не всё так просто.
Этап 1: Синтез голоса
Потребовалось решить две ключевые проблемы:
- Добиться схожести голоса с оригиналом.
- Создать естественную анимацию лица.
Сначала мы попробовали работать с диктором-пародистом, но результат оказался недостаточно убедительным.
Решение: нейросети для синтеза речи.
«Говорят, это делается за пять минут?»
На деле процесс занял два дня. Мы протестировали два подхода:
- Локальная нейросеть на базе open-source библиотек.
- Платный сервис с аналогичной технологией.
Оба метода требовали образец голоса — нам предоставили архивную запись выступления Муравленко на радио.
Процесс:
- Нейросеть обучалась на записи (от 2 до 24 часов).
- Затем мы записали речь с нужной интонацией.
Важно: нейросеть не исправляет ударения или дефекты речи. Если человек картавил, в записи это нужно имитировать — иначе сходство будет потеряно.
После долгих экспериментов получили два варианта голоса:
Локальное решение показало не самый достойный результат, поэтому выбор пал на платный сервис — он справился чуть лучше.
Примечание: из-за шумов в исходной записи пришлось сохранить лёгкий фон. Очистка лишала голос «живости».
Этап 2: Анимация портрета
Сначала заменили фон — поместили Муравленко в кабинет в советском стиле.
Затем протестировали два подхода к анимации:
1. Генерация видео + LipSync
- Нейросеть создавала кадры по фото, которые затем склеивались.
Проблемы:
- Долгая генерация.
- Заметные стыки между кадрами.
- Нереалистичная прорисовка деталей (например, зубов).
2. LipSync на основе фотографии
- Технология анимировала лицо напрямую, без генерации «из ничего».
Плюсы:
- Полный контроль над результатом.
- Сохранение исходного разрешения (4K).
Минус:
- Требуется много дублей для идеального попадания в голос.
Итог
В финальном проекте мы объединили четыре нейросети и доработали результат вручную.
Вывод: нейросети — мощный инструмент, но без человеческого контроля и доработок они пока не справляются с профессиональными задачами «под ключ».
P.s.
Текст для данной статьи был оформлен и полностью отредактирован нейросетью DeepSeek