audio.cpp
локальный C++ движок инференса для TTS, ASR, VAD и генерации музыки без Python
Что это
audio.cpp — открытый C++ фреймворк для локального инференса аудио-моделей на базе ggml. Заменяет связку из Conda-окружений и Python-зависимостей единым нативным рантаймом. Поддерживает более 20 семейств моделей: TTS с клонированием голоса (Qwen3, VibeVoice, VoxCPM2, Chatterbox), распознавание речи (Qwen3-ASR, Citrinet), голосовую конверсию, разделение источников, детекцию активности голоса (VAD), диаризацию и генерацию музыки (ACE-Step, Stable Audio 3). Работает через CLI (audiocpp_cli) или REST-сервер с эндпоинтами синтеза и транскрипции, с бэкендами CUDA, Vulkan, Metal и CPU.
Для участника клуба это способ поднять голосовые фичи (озвучка, транскрибация звонков, генерация подкастов, клонирование голоса для контента) на своём железе без облачных API и без Python-окружения, что упрощает встраивание в автоматизации на n8n или в собственные CLI/серверные пайплайны. Разработчики заявляют ускорение TTS-путей в 1.8-5.0 раз и снижение задержки на 45-80% по сравнению с эталонными Python-реализациями, что важно при обработке больших объёмов контента.
Возможности
- TTS с клонированием голоса на моделях Qwen3, PocketTTS, VibeVoice, VoxCPM2, Chatterbox
- Автоматическое распознавание речи (ASR) через Qwen3-ASR и Citrinet
- Генерация музыки моделями ACE-Step, HeartMuLa, Stable Audio 3
- Голосовая конверсия, разделение источников, диаризация и выравнивание речи
- Детекция активности голоса (VAD)
- CLI-инструмент audiocpp_cli с выбором задачи, модели и бэкенда
- REST-сервер на порту 8080 с эндпоинтами синтеза речи и транскрипции
- Бэкенды CUDA, Vulkan, Metal, CPU без зависимости от Python в рантайме
Цена: открытый исходный код на GitHub, бесплатное локальное использование, требуется свой компьютер/сервер с поддерживаемым бэкендом (CUDA/Vulkan/Metal/CPU)