Sonata

Voice-Pro: открытый веб-инструмент для распознавания речи, перевода и дубляжа

image source

Voice-Pro — веб-приложение с открытым исходным кодом для распознавания речи, перевода и дубляжа. Оно объединяет скачивание видео с YouTube, разделение голоса, транскрипцию и синтез речи в одном инструменте для авторов и исследователей.

В основе — распознавание через Whisper, Faster-Whisper и Whisper-Timestamped, клонирование голоса без обучения (F5-TTS, E2-TTS, CosyVoice), многоязычный синтез Edge-TTS и kokoro, а также перевод на 100+ языков через Deep-Translator. Обработка видео — на базе yt-dlp.

В свежей версии установщик переведён с Miniconda/pip на uv, обновлён рантайм: Python 3.12, Torch 2.8.0+cu128 с поддержкой RTX 50-й серии и Gradio 6.20. CUDA Toolkit и Visual Studio Build Tools больше не нужны — все зависимости идут готовыми сборками.

Приложение дружелюбно к корпоративным ПК: права администратора не требуются, portable-версия ffmpeg скачивается автоматически, а загрузка моделей восстанавливается после обрывов. Ошибки теперь показываются в интерфейсе красными уведомлениями, которые не исчезают сами.

Разработчики сосредоточились на проекте WeConnect, поэтому обновления Voice-Pro приостановлены. Весь код открыт и бесплатен: его можно свободно распространять и изменять. Стабильная работа проверена на Windows с видеокартой NVIDIA.

Большинство проблем решается удалением рабочей папки и повторным запуском — чистая переустановка занимает несколько минут, а скачанные модели сохраняются. Проект позиционируется как альтернатива ElevenLabs для подкастеров и разработчиков.

GitHub ★ 11,541

Загрузка страницы