Я показываю нейросеть Qwen3 TTS Demo, которая появилась недавно и бесплатно доступна на Hugging Face. Разбираю, как задать голосу конкретную эмоцию текстовым описанием — без опорного аудиофайла — и сравниваю результат на русском и английском языке. На примере короткой фразы «всем привет, подписывайтесь на мой YouTube канал» показываю, как звучит нейтральная генерация и что меняется, когда в описании голоса указана эмоция вроде испуга или грусти. Материал будет полезен тем, кто озвучивает короткие анимешные ролики или диалоги персонажей и хочет разнообразить интонации без студийной записи.
0:00–0:25 Знакомство с нейросетью Qwen3 TTS Demo на Hugging Face: бесплатный сервис с клонированием голосов для коротких анимешных роликов. 0:25–0:59 Ввод тестового текста на русском языке и выбор русского языка в интерфейсе. 0:59–1:46 Заполнение поля Voice Description на английском языке с описанием эмоции голоса — «с недоверием, но с ноткой паники» — и запуск генерации. 1:46–1:57 Прослушивание результата на русском: голос звучит похоже на известного блогера, но выраженной эмоции не слышно. 1:57–2:16 Перевод фразы на английский через переводчик и смена описания голоса на «грустный, со слезами». 2:16–2:40 Повторная генерация и прослушивание озвучки с эмоцией на английском, вывод о применимости приёма для анимешных диалогов.