OmniVoiceStudio: локальная озвучка и клонирование голоса на 646 языках

Смотреть урок

Дополнительные файлы из урока

Показываю приложение OmniVoiceStudio, которое ставится прямо на компьютер и заменяет часть платных подписок на озвучку — с русским интерфейсом и без сложной настройки. В уроке клонирую свой голос по mp3-файлу, синтезирую текст про историю пирамид, а потом собираю голос вручную через голосовой дизайн: выбираю пол, возраст, тон и акцент и сохраняю получившийся профиль. Материал пригодится тем, кто хочет озвучивать видео, ролики на разные языки или аудиокниги без ежемесячной подписки на облачные нейросети.

Оглавление с таймкодами:

0:00–0:56 Автор показывает OmniVoiceStudio — локальное приложение с русским интерфейсом: клонирование голоса, голосовой дизайн, дубляж видео и озвучка аудиокниг на 646 языках.
0:56–1:41 Смотрит на API-интерфейс приложения (в перспективе можно будет запускать локально) и переходит к клонированию голоса — загружает готовый mp3-файл со своим голосом.
1:41–2:31 Вводит текст об истории пирамид для синтеза речи своим клонированным голосом, показывает настройки и доступные эффекты вроде смеха и плача.
2:31–3:21 Запускает синтезацию — генерация занимает около 10 секунд, при этом первый запуск после загрузки клона может подвиснуть из-за построения новой голосовой модели. Прослушивает результат.
3:21–4:13 Переходит в раздел «Голосовой дизайн» и озвучивает тот же текст синтетическим голосом с выбором роли — ведущий, рассказчик и так далее.
4:13–5:00 Вручную настраивает голос: пол, возраст, тон, акцент — и сохраняет получившуюся комбинацию как профиль «рассказчик».
5:00–5:21 Заново синтезирует и прослушивает финальный текст про пирамиды с настроенным голосом.

Топ-инсайты:

OmniVoiceStudio — локальное приложение с русским интерфейсом, устанавливается на компьютер и не требует подписки на облачные нейросети.

Поддерживает озвучку на 646 языках, а также клонирование голоса, голосовой дизайн, дубляж видео и начитку аудиокниг.

Для клонирования голоса лучше загружать готовый mp3-файл с образцом голоса, а не записывать его прямо в приложении.

Первая генерация после загрузки клона голоса может занять много времени, потому что нейросеть строит новую голосовую модель.

Обычная генерация речи занимает около 10 секунд.

В приложении есть API-интерфейс, который в перспективе позволяет запускать модель на локальном сервере.

Голосовой…

🔒

Этот материал доступен участникам Клуба. Войдите или оформите доступ, чтобы читать целиком, открывать видео и комментировать.

Войти Вступить / купить доступ