发布多个超小型TTS模型(最小<25MB),可直接集成到客户端应用无需云API,降低延迟成本。
新版:Kitten TTS v0.8 已发布——现提供 15M、40M 和 80M 参数规模的模型。
Kitten TTS 是一个基于 ONNX 构建的开源轻量级文本转语音库。模型参数规模从 15M 到 80M 不等(磁盘占用 25~80 MB),无需 GPU,即可在 CPU 上实现高质量语音合成。
状态:开发者预览版——不同版本之间的 API 可能发生变化。
我们提供商业支持。如需集成协助、定制语音或企业许可,请联系我们。
超轻量——模型大小从 25 MB(int8)到 80 MB,适合边缘部署
针对 CPU 优化——基于 ONNX 的推理无需 GPU 即可高效运行
8 种内置语音——Bella、Jasper、Luna、Bruno、Rosie、Hugo、Kiki 和 Leo
语速可调——通过 speed 参数控制播放速度
文本预处理——内置处理管线支持数字、货币、单位等内容
24 kHz 输出——以标准采样率提供高质量音频
注意:部分用户反馈 kitten-tts-nano-0.8-int8 模型存在问题。如果你遇到问题,请提交 issue。
你可以在 Hugging Face Spaces 中直接通过浏览器试用 Kitten TTS。
pip install https://github.com/KittenML/KittenTTS/releases/download/0.8.1/kittentts-0.8.1-py3-none-any.whl
from kittentts import KittenTTS
model = KittenTTS("KittenML/kitten-tts-mini-0.8")
audio = model.generate("This high-quality TTS model runs without a GPU.", voice="Jasper")
import soundfile as sf
sf.write("output.wav", audio, 24000)
# Adjust speech speed (default: 1.0)
audio = model.generate("Hello, world.", voice="Luna", speed=1.2)
# Save directly to a file
model.generate_to_file("Hello, world.", "output.wav", voice="Bruno", speed=0.9)
# List available voices
print(model.available_voices)
# ['Bella', 'Jasper', 'Luna', 'Bruno', 'Rosie', 'Hugo', 'Kiki', 'Leo']
pip install -r requirements_gpu.txt
m = KittenTTS("KittenML/kitten-tts-mini-0.8", backend="cuda")
查看 example_cuda.py
KittenTTS(model_name, cache_dir=None)
从 Hugging Face Hub 加载模型。
model.generate(text, voice, speed, clean_text)
根据文本合成语音,返回一个包含 24 kHz 音频采样数据的 NumPy 数组。
model.generate_to_file(text, output_path, voice, speed, sample_rate, clean_text)
合成语音并直接写入音频文件。
normalize_text(text, locale="en-US", return_spans=False)
在不生成音频的情况下,对用于 TTS 的文本进行规范化。
from kittentts import normalize_text
normalized = normalize_text("Dr. Rivera paid $12.50 at 3:05 p.m.")
# "Doctor Rivera paid twelve dollars and fifty cents at three oh five p m."
result = normalize_text("Fig. 2", return_spans=True)
print(result.text)
print(result.spans)
当 return_spans=True 时,结果会包含从原始文本到规范化文本的字符区间映射,覆盖缩写、日期、时间、数字、货币、URL 和标点等发生变化的片段。
model.available_voices
返回可用语音名称列表:['Bella', 'Jasper', 'Luna', 'Bruno', 'Rosie', 'Hugo', 'Kiki', 'Leo']
操作系统:Linux、macOS 或 Windows
硬件:可在 CPU 上运行,无需 GPU
磁盘空间:根据模型版本不同,需要 25~80 MB
建议使用虚拟环境(conda、venv 或类似工具),以避免依赖冲突。
发布经过优化的推理引擎
发布质量更高的 TTS 模型
发布多语言 TTS
还有其他需求?请告诉我们。
我们为将 Kitten TTS 集成到产品中的团队提供商业支持,包括集成协助、定制语音开发和企业许可。
请联系我们或发送邮件至 info@stellonlabs.com,讨论你的具体需求。
Discord:加入社区
网站:kittenml.com
定制支持:申请表单
电子邮箱:info@stellonlabs.com
问题反馈:GitHub Issues
本项目采用 Apache License 2.0 许可。