Voice-Pro 是 Gradio WebUI,整合 Whisper 语音识别、F5/E2/CosyVoice 零样本克隆、多语言 TTS 和 YouTube 处理等功能。为语音应用开发者提供开箱即用的完整解决方案。
最好的 AI 语音识别、翻译和多语言配音解决方案 🚀

🎙️ 一款由 AI 驱动的网页应用,用于语音识别、翻译和配音
한국어 ∙ English ∙ 中文简体 ∙ 中文繁體 ∙ 日本語 ∙ Deutsch ∙ Español ∙ Português
Voice-Pro 是一款最先进的网页应用,能够改变多媒体内容创作。它将 YouTube 视频下载、语音分离、语音识别、翻译和文本转语音集成到一个强大的工具中,为创作者、研究人员和多语言专业人士服务。
🔊 顶级语音识别:Whisper、Faster-Whisper、Whisper-Timestamped
🎤 零样本声音克隆:F5-TTS、E2-TTS、CosyVoice(包括 Fun-CosyVoice3 — 韩语及其他 8 种语言)
📢 多语言文本转语音:Edge-TTS、kokoro(可选 Azure TTS,需自备密钥 — 见 Azure 服务)
🎥 YouTube 处理与音频提取:yt-dlp
🌍 100+ 语言即时翻译:Deep-Translator(可选 Azure 翻译器,需自备密钥)
Voice-Pro 是 ElevenLabs 的强大替代方案,为播客主、开发者和创作者提供先进的语音解决方案。
由于 WeConnect 开发工作,Voice-Pro 目前无法进行开发和更新。
我们已开源所有 Voice-Pro 代码并完全免费。Voice-Pro 现在可以被任何人自由分发和修改。
在装有 NVIDIA GPU 的 Windows 上运行良好。Mac 和 Linux 上的运行情况未经验证。
请在相关页面提交您的需求。
故障排查:在大多数情况下,可以通过删除 installer_files 文件夹,然后再次运行 start.bat 来解决问题(干净重新安装只需几分钟;model/ 中下载的 AI 模型会保留)。错误会在 WebUI 中显示为红色 toast 通知,需手动关闭。
⚡ 将安装程序从 Miniconda/pip 迁移到 uv — 大幅提速,从提交的 uv.lock 实现完全可重现的安装。所有内容都保留在 installer_files/ 中(uv、Python、包)。
🐍 升级运行时:Python 3.12、Torch 2.8.0+cu128(支持 RTX 50 系列)、Gradio 6.20。
🎙️ 最新 ASR 栈:faster-whisper 1.2.1(large-v3-turbo、distil-large-v3.5)、openai-whisper 20250625、whisper-timestamped 1.15.9。whisperX 已移除(其依赖项冲突阻止了 Gradio 6 升级;现有配置回退到 faster-whisper)。
🗣️ 最新 TTS 栈:F5-TTS 1.1.21、kokoro 0.9.4、edge-tts 7.x,以及重新编包的 CosyVoice(上游主分支)。
🇰🇷 新增可选 TTS 模型:Fun-CosyVoice3-0.5B — 包括韩语在内的 9 种语言,可在 CosyVoice 选项卡中选择(首次使用时从官方 HF 仓库下载)。
🧹 CUDA Toolkit 和 Visual Studio Build Tools 不再需要 — 所有依赖项都附带预编译的 wheels,PyTorch 捆绑了 CUDA 运行时。
🛡️ 对受限/企业 PC 友好:无需管理员权限 — start.bat 在未安装时自动下载便携版 ffmpeg、Whisper 模型下载在中断/损坏传输后可自动修复,翻译在网络限速免费 Google 端点时自动重试(失败行会报告,原文保留)。
🚨 错误现在在 WebUI 中可见:每个失败都显示一个红色错误 toast 通知,需手动关闭(之前是 10 秒警告,容易被忽略),并提供常见原因的可操作信息(缺少 ffmpeg、未注册媒体等)。
🖥️ UI:迁移至 Gradio 6(所有选项卡的全宽布局、字幕轨道直接显示在视频播放器中)。
🧽 uninstall.bat 不再需要管理员权限,也不再强制重启;uninstall.bat 可以以静默方式无人值守运行。
过去几个月我们一直专注于 WeConnect 开发,无法管理 Voice-Pro。
我们决定开源所有 Voice-Pro 代码。
Voice-Pro 完全免费,支持 Windows、Mac、Linux。
WeConnect 是一个全球文化交流应用。
与来自世界各地的人建立联系,进行有意义的文化交流、语言学习和国际友谊。





🪄 支持 F5-TTS 的微调模型
🌍 支持的语言 英文 & 中文:SWivid/F5-TTS_v1 芬兰语:AsmoKoskinen/F5-TTS_Finnish_Model 法语:RASPIAUDIO/F5-French-MixedSpeakers-reduced 印地语:SPRINGLab/F5-Hindi-24KHz 意大利语:alien79/F5-TTS-italian 日语:Jmica/F5TTS/JA_21999120 俄语:hotstone228/F5-TTS-Russian 西班牙语:jpgallegoar/F5-Spanish
英文 & 中文:SWivid/F5-TTS_v1
芬兰语:AsmoKoskinen/F5-TTS_Finnish_Model
法语:RASPIAUDIO/F5-French-MixedSpeakers-reduced
印地语:SPRINGLab/F5-Hindi-24KHz
意大利语:alien79/F5-TTS-italian
日语:Jmica/F5TTS/JA_21999120
俄语:hotstone228/F5-TTS-Russian
西班牙语:jpgallegoar/F5-Spanish
🔥 已移除 AI 翻唱功能。
🚀 新增对 m-bain/whisperX 的支持。
🐍 使用 Python 3.10.15、Torch 2.5.1+cu124 和 Gradio 5.14.0 构建。
🆓 免费试用版支持最长 60 秒的媒体。
🔥 新增 AI 翻唱功能。
🎤 新增对 CosyVoice 和 kokoro 的支持。
⏳ 首次运行时会下载 CozyVoice2-0.5B(9GB),根据网络速度,可能需要一个多小时。
🎧 用于克隆的声音样本将持续更新。
📝 新增 spaCy,用于自然地逐句翻译和执行 TTS。
☁️ 订阅版包含 Microsoft Azure Translator 和 TTS。
🏪 订阅期间可无限使用(不受 60 秒限制),可通过以下渠道获取。
YouTube 视频下载与音频提取
使用 Demucs 分离人声
支持 100 多种语言的语音识别与翻译
语音转文本:Whisper、Faster-Whisper、Whisper-Timestamped
文本转语音:Edge-TTS:支持 100 多种语言、400 多种声音;E2-TTS、F5-TTS、CosyVoice:零样本克隆;kokoro:在 HuggingFace TTS Arena 中排名第 2
Edge-TTS:支持 100 多种语言、400 多种声音
E2-TTS、F5-TTS、CosyVoice:零样本克隆
kokoro:在 HuggingFace TTS Arena 中排名第 2
即时语音识别
即时多语言翻译
可自定义音频输入
一站式中心:YouTube 下载、降噪、字幕、翻译和 TTS
支持所有与 ffmpeg 兼容的格式
输出选项:WAV、FLAC、MP3
支持 100 多种语言的字幕与识别
TTS 支持语速、音量和音调控制

专注于字幕:支持 90 多种语言
视频内嵌字幕显示
逐词高亮与降噪选项
支持 100 多种语言的翻译
支持字幕文件(ASS、SSA、SRT 等)
实时语音识别与翻译

语音生成选项卡
选项:Edge-TTS、F5-TTS、CosyVoice、kokoro
支持名人声音播客和多语言

请在 Issues 页面提出你希望添加的声音。Issues
💻 系统要求
操作系统:Windows 10/11(64 位)、Linux、Mac(Apple Silicon)
GPU:配备较新驱动程序的 NVIDIA GPU(建议 >= 570;支持 RTX 50 系列)。无需安装 CUDA Toolkit。
显存:4GB 以上(推荐 8GB 以上)
存储空间:20GB 以上可用空间
使用 configure.bat 和 start.bat 即可轻松安装 Voice-Pro(Mac/Linux 请使用 configure.sh 和 start.sh)。
从以下位置克隆或下载最新版本(Source code (zip))
git clone https://github.com/abus-aikorea/voice-pro.git
🚀 configure.bat(可选)在系统范围内配置 git 和 ffmpeg(不再需要 CUDA Toolkit / Visual Studio)需要管理员权限;只需运行一次没有管理员权限?可以跳过——start.bat 会自动下载便携版 ffmpeg
在系统范围内配置 git 和 ffmpeg(不再需要 CUDA Toolkit / Visual Studio)
需要管理员权限;只需运行一次
没有管理员权限?可以跳过——start.bat 会自动下载便携版 ffmpeg
🚀 start.bat 启动 Voice-Pro WebUI 首次运行时会下载 uv + Python 3.12,并根据锁文件安装所有依赖项(只需几分钟,而非数小时),随后下载 AI 模型(约 10GB——这是耗时较长的部分)系统会自动检测 GPU/CPU;可通过 GPU_CHOICE 环境变量(G=NVIDIA,C=CPU)覆盖,也可以删除 installer_files\gpu_choice.txt 遇到问题时,请删除 installer_files 后重试
启动 Voice-Pro WebUI
首次运行时会下载 uv + Python 3.12,并根据锁文件安装所有依赖项(只需几分钟,而非数小时),随后下载 AI 模型(约 10GB——这是耗时较长的部分)
系统会自动检测 GPU/CPU;可通过 GPU_CHOICE 环境变量(G=NVIDIA,C=CPU)覆盖,也可以删除 installer_files\gpu_choice.txt
遇到问题时,请删除 installer_files 后重试
🚀 update.bat:严格按照已提交的锁文件重新同步 Python 环境(速度很快)
运行 uninstall.bat 或删除文件夹(便携式安装)
无需管理员权限;如需无人值守卸载,请添加 silent(uninstall.bat silent)
只会删除 installer_files 文件夹——你的 model/ 和 workspace/ 文件夹会被保留
🔑 Azure 服务(可选,.env)
Voice-Pro 默认使用免费服务:通过 Deep-Translator(Google 的免费 Web 端点)进行翻译,并使用 Edge-TTS 进行语音合成。如果你拥有自己的 Microsoft Azure 订阅,可以将这两项服务切换到 Azure API:
将项目根目录中的 .env.example 复制为 .env:copy .env.example .env # Windows cp .env.example .env # Mac/Linux
copy .env.example .env # Windows
cp .env.example .env # Mac/Linux
填写你的 Azure 凭据:# Azure Speech Service (TTS) AZURE_SPEECH_KEY=your_azure_speech_key_here AZURE_SPEECH_REGION=eastus # Azure Translator Service AZURE_TRANSLATOR_KEY=your_azure_translator_key_here AZURE_TRANSLATOR_ENDPOINT=https://your-translator-resource.cognitiveservices.azure.com/ AZURE_TRANSLATOR_REGION=eastus
# Azure Speech Service (TTS)
AZURE_SPEECH_KEY=your_azure_speech_key_here
AZURE_SPEECH_REGION=eastus
# Azure Translator Service
AZURE_TRANSLATOR_KEY=your_azure_translator_key_here
AZURE_TRANSLATOR_ENDPOINT=https://your-translator-resource.cognitiveservices.azure.com/
AZURE_TRANSLATOR_REGION=eastus
重启 Voice-Pro。系统启动时会自动检测有效的密钥——翻译服务将切换为 Azure Translator,第一个“语音生成”选项卡也会变为 Azure-TTS。
哪些情况下值得进行这项配置?
🏢 企业网络/受限网络:安全设备经常会对免费的 translate.google.com 端点进行速率限制或直接拦截,导致较长的字幕翻译速度变慢或失败。Voice-Pro 会采用退避策略重试,并为失败的字幕行保留原文(你会看到一条包含失败数量的警告),而 Azure Translator 可以彻底避免这一问题。
🗣️ 获得质量更高、表现更稳定的 TTS 声音,以及更高的速率限制。
不要将 .env 提交到版本控制系统——其中包含你的私钥。
关闭 Windows 命令窗口,然后再次运行 start.bat。
直接打开浏览器,在地址栏中输入 Windows 命令窗口里显示的地址(例如 http://127.0.0.1:7870)。
在 Windows 任务管理器的“性能”选项卡中检查 GPU 显存状态。
将 Denoise 级别设置为 0 或 1。Denoise 级别 2 至少需要 8GB GPU 显存。
将 Compute Type 设置为 int 类型。float 类型的质量更好,但需要更多 GPU 显存。
使用更大的 Whisper 模型通常能提高字幕质量,但情况并非总是如此。large > medium > small > base > tiny
在计算类型中,float 类型性能较好。int 类型是通过模型量化来减少 GPU 使用量并提高速度的模型。另一方面,性能会下降。
如果增加降噪等级,将会移除更多背景噪声,只有剩余的语音用于语音识别。这不一定总能保证好的结果。
由于 WeConnect 开发工作,Voice-Pro 在一段时间内将没有更新。
所有 Voice-Pro 代码已开源。现在完全免费使用。
WeConnect 是一个用于全球文化交流的沟通平台。
⏳ 字幕、翻译和 TTS 的 SaaS 平台
下表列出了支持字幕生成、翻译和文本转语音(TTS/配音)功能的 SaaS 平台。成本根据 2025 年 4 月 15 日的最新可用定价数据,计算处理 60 分钟韩语视频的费用,包括字幕生成、英语翻译和英语配音。
成本计算详情
Maestra:高级计划($158/月,1200 积分)。60 分钟视频:60 积分(字幕)+ 60 积分(翻译)+ 60 积分(配音)= 180 积分。成本 = (180/1200) * $158 = $23.70。
Kapwing:Pro 计划(~$24/月,分钟数限制)。估计 $0.50~$0.67/分钟用于字幕+翻译+配音(基于按分钟定价趋势)。60 分钟成本:$30~$40。确切定价需要确认。
VEED.IO:Pro 计划(~$24/月)。字幕+翻译估计为 $0.40~$0.60/分钟。没有 TTS,所以是部分处理。60 分钟成本:$24~$36。在 veed.io 确认。
HappyScribe:按量付费(~$0.20/分钟转录,$0.20/分钟翻译,$0.20/分钟配音)。60 分钟成本:$36~$48(假设结合服务)。在 happyscribe.com 确认。
Sonix:标准计划(~$10/小时转录,翻译/配音另算)。估计 $0.50~$0.67/分钟总计。60 分钟成本:$30~$40。在 sonix.ai 确认。
Descript:创作者计划(~$24/月,小时数限制)。估计 $0.60~$0.80/分钟用于字幕+翻译+配音。60 分钟成本:$36~$48。在 descript.com 确认。
AppTek:企业定制定价。没有公开的按分钟费率。联系 apptek.ai 获取报价。
Transkriptor:按量付费($0.05~$0.10/分钟转录,翻译类似)。没有 TTS,所以是部分处理。60 分钟成本:$12~$18。在 transkriptor.com 确认。
60 分钟视频成本: 成本为近似值,假设处理 60 分钟韩语视频用于字幕、英语翻译和英语配音(如果可用)。没有 TTS 的平台(例如 VEED.IO、Transkriptor)反映的是部分处理成本。
语言支持: 大多数平台支持韩语和英语。在其网站上验证特定语言的可用性。
使用场景:
定价更新: 由于计划变化或促销,定价可能会有所不同。查看官方网站以获取最新详情。
如要贡献或针对特定用例的建议,请在此仓库中提出问题或提交拉取请求!
你好,我是 Voice-Pro 团队的 David。我们团队发现业界最好的 AI 技术,并为任何人提供易于使用和方便的服务。我们是一个只有一年历史的韩国小初创公司。我们正在努力帮助你和其他创作者制作优质内容。
你的 ⭐⭐⭐⭐⭐ 评价将不胜感激,因为它有助于我们的业务与你一起成长。请帮助支持我们的小团队。
谢谢,ABUS 客户服务
如果你想参与并帮助我们完成这个项目,请随时创建问题
如果出现问题,请提交拉取请求以改进此项目。
欢迎任何类型的贡献。
如有购买、商业合作、技术调优、投资等相关事宜的咨询,请通过电子邮件与我们联系。(abus.aikorea@gmail.com)
如果你喜欢这个项目,请给这个仓库加星。我们将不胜感激。⭐⭐⭐
你可以在这里通过捐赠支持 Voice-Pro:
电子邮件:abus.aikorea@gmail.com
主页(韩文):https://www.wctokyoseoul.com
Demucs:https://github.com/facebookresearch/demucs
yt-dlp:https://github.com/yt-dlp/yt-dlp
gradio:https://github.com/gradio-app/gradio
edge-TTS:https://github.com/rany2/edge-tts
F5-TTS:https://github.com/SWivid/F5-TTS.git
openai-whisper:https://github.com/openai/whisper
faster-whisper:https://github.com/SYSTRAN/faster-whisper
whisper-timestamped:https://github.com/linto-ai/whisper-timestamped
CosyVoice:https://github.com/FunAudioLLM/CosyVoice
kokoro:https://github.com/hexgrad/kokoro
Deep-Translator:https://github.com/nidhaloff/deep-translator