通过 mlx-audio 在 M 系列 Mac 上本地运行 Qwen3-TTS(0.6B 参数,Apache-2.0 许可),零云端依赖,~2GB 显存即可。
我们构建 Sovereign Voice 是因为受够了云端 TTS 按字符收费。以下是如何在你的 Mac 上完全本地运行文字转语音,零云依赖。
云端 TTS 服务(ElevenLabs、PlayHT、Murf)很棒——直到你看到账单。一段 10 分钟的配音需要花费 2-5 美元的 API 额度。一个每天产出的 YouTube 频道每月仅 TTS 费用就要烧掉 100-300 美元。
本地 TTS 过去意味着机器人般的低质量声音。现在不一样了。有了 Apple Silicon(M1+)和 MLX 框架,你可以在笔记本上运行生产级 TTS。
技术栈:Qwen3-TTS + MLX
Qwen3-TTS 是阿里巴巴的 0.6B 参数文字转语音模型,采用 Apache-2.0 许可证。8 位量化版本通过 Apple 的 MLX 框架在 Metal GPU 上运行。
硬件要求:
# Create a venv
python3.11 -m venv mlx-tts-env
source mlx-tts-env/bin/activate
# Install mlx-audio
pip install mlx-audio
# Generate speech
python -c "
from mlx_audio.tts.generate import load_model
model = load_model('mlx-community/Qwen3-TTS-12Hz-0.6B-Base-8bit', lazy=False)
model.generate_to_file(
text='Hello world, this is local text to speech running on Apple Silicon.',
file_path='output.wav',
ref_audio='reference.wav', # 10-30s of your voice
ref_text='This is the text that was spoken in the reference audio.'
)
"
首次运行会从 HuggingFace 下载约 1.9GB。之后一切都在本地运行——无需互联网。
零样本语音克隆
魔法在于 ref_audio + ref_text 组合。你需要提供:
模型将其作为条件信号使用——它"理解"这个声音的特质,然后用那个声音生成新的语音。无需微调、无需训练、无需 GPU 集群。只需在你的 Mac 上做一次前向传播。
质量:我们在一个保留集上测量 Whisper WER(词错误率)为 0.038 p50——即 96.2% 的准确率,与云端服务的英文质量相当。
身份:测量 ECAPA-TDNN 余弦相似度为 0.699 均值——在同一人基线范围内(0.748 均值)。克隆出的声音与同一说话人的另一段录音在生物特征上无法区分。
延迟:预期表现
在 M1(基础款、8GB)上:
权衡:你需要一台 Apple Silicon Mac,而且质量并非在所有声音上都达到 ElevenLabs 水平。但对于大多数场景——配音、旁白、无障碍工具——已经足够好了。
隐私:真正的优势
每次云端 TTS 调用都会将你的文本发送到服务器。服务器会记录它、可能用它训练模型、并存储它。对于敏感内容(内部公司视频、个人消息、医疗保健旁白),这是无法接受的。
超越 CLI:封装成应用
我们将这个技术栈封装成了 Sovereign Voice,一款 Mac 应用,提供:
定价 19 美元一次性买断(无订阅)。25 次生成免费试用。
但底层技术栈——Qwen3-TTS + MLX——是开源免费的。如果你是开发者,一个下午就能构建自己的封装工具。
本地 TTS 的下一步
0.6B 模型只是开始。更大规模的模型(1.7B、7B)已经在 MLX 格式中可用。随着 Apple Silicon 越来越快、模型越来越高效,本地和云端 TTS 之间的差距将完全消失。
问题不再是"本地 TTS 能否达到云端质量"——而是"云端 TTS 何时才能证明其成本高于免费本地替代方案的价值"。
我们在 Eidetic Works 构建 Sovereign Voice 和 Nucleus OS。Sovereign Voice 是一款 19 美元的本地优先 TTS Mac 应用。Nucleus OS 是一个开源的 Agent 控制平面。