前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
返回 AI 情报前线
All News · 全部资讯3545
  • RAG 系统从零到一的实战经验与教训
  • 语音 Agent 评估框架 EVA 发布
  • Claude Code 速查表与功能指南
  • Claude Code 实战提效工作流
  • Prompt 工程入门:问法决定质量
  • Cq:AI 编程 Agent 的专属问答社区
  • iPhone 17 成功运行 400B 大模型演示
  • 用 Claude 自动化移动应用 QA 测试
  • 现代 LLM 注意力机制可视化教程
  • OpenTelemetry 统一 LLM 追踪规范
  • OpenCode:开源 AI 编程 Agent 项目
  • 快速构建领域特定嵌入模型
  • 初次体验 Agent 技能开发
  • 一小时用 AI 快速原型应用
  • Gemini CLI 高级功能全解
  • 用四象限图判断 AI 技术价值
  • 企业级 MCP 应用案例分析
  • AI 术语速成手册
  • Meta AI 失控事件警示录
  • Google AI Studio 快速编程秘诀
  • 轻量级TTS模型库:25MB以内可直接嵌入
  • 用Markdown声明式构建生成式UI交互
  • OpenAI收购Astral:Python工具栈并购
  • OpenAI官宣收购Astral团队
  • Cook:编排Claude Code的轻量级CLI工具
  • Cursor Composer 2:前沿级AI编码能力升级
  • 无需训练!复制LLM参数层突破推理瓶颈
  • Claude Code 在工程领域的实战应用
  • AI 生成代码的保修和法律困境
  • Google Sashiko:Agent 式 AI 审查 Linux 内核
  • AI 生成代码引入的新型技术债
  • Colab MCP Server:AI Agent 的新连接方式
  • 自主运行的 Claude Code Agent:从工具到自主系统
  • Hugging Face 2026 春季开源生态报告
  • Antfly:用 Go 构建分布式多模态搜索系统
  • Holotron-12B:高吞吐量计算机自动化 Agent
  • 用 AI 自动生成技术规范文档
  • 用 MCP 为 AI 知识库接入 Notion
  • Claude Code Skills 官方实战指南:9 大类型与分发策略
  • Mistral 开源形式验证 Agent:提升代码可信性
  • 用 Claude Code Skills 完整开发 Godot 游戏
  • Apideck CLI:低消耗的 AI Agent 接口方案
  • 智能体工程进阶:从 Tab 补全到 Agent 团队的 8 个等级
  • LLM 架构可视化库:全景理解模型设计
  • Claude合作伙伴网络启动
  • Claude使用优惠活动
  • GitAgent:仓库变身AI代理的开放标准
  • Claude在3D创意工作中的实战技巧
  • Spine Swarm:可视化画布上的AI Agent编排
  • 大规模识别LLM的神经元交互机制
  • Claude Code与其他LLM的网关集成指南
  • 已加载 51 / 3545
7.0
热点
AI SCORE
工具产品2026-03-19 23:56

轻量级TTS模型库:25MB以内可直接嵌入

Hacker News · github.com#TTS#开源#轻量化
Editor brief · 编辑速览

发布多个超小型TTS模型(最小<25MB),可直接集成到客户端应用无需云API,降低延迟成本。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

新版:Kitten TTS v0.8 已发布——现提供 15M、40M 和 80M 参数规模的模型。

Kitten TTS 是一个基于 ONNX 构建的开源轻量级文本转语音库。模型参数规模从 15M 到 80M 不等(磁盘占用 25~80 MB),无需 GPU,即可在 CPU 上实现高质量语音合成。

状态:开发者预览版——不同版本之间的 API 可能发生变化。

我们提供商业支持。如需集成协助、定制语音或企业许可,请联系我们。

社区与支持

超轻量——模型大小从 25 MB(int8)到 80 MB,适合边缘部署

针对 CPU 优化——基于 ONNX 的推理无需 GPU 即可高效运行

8 种内置语音——Bella、Jasper、Luna、Bruno、Rosie、Hugo、Kiki 和 Leo

语速可调——通过 speed 参数控制播放速度

文本预处理——内置处理管线支持数字、货币、单位等内容

24 kHz 输出——以标准采样率提供高质量音频

注意:部分用户反馈 kitten-tts-nano-0.8-int8 模型存在问题。如果你遇到问题,请提交 issue。

你可以在 Hugging Face Spaces 中直接通过浏览器试用 Kitten TTS。

pip install https://github.com/KittenML/KittenTTS/releases/download/0.8.1/kittentts-0.8.1-py3-none-any.whl
from kittentts import KittenTTS

model = KittenTTS("KittenML/kitten-tts-mini-0.8")
audio = model.generate("This high-quality TTS model runs without a GPU.", voice="Jasper")

import soundfile as sf
sf.write("output.wav", audio, 24000)
# Adjust speech speed (default: 1.0)
audio = model.generate("Hello, world.", voice="Luna", speed=1.2)

# Save directly to a file
model.generate_to_file("Hello, world.", "output.wav", voice="Bruno", speed=0.9)

# List available voices
print(model.available_voices)
# ['Bella', 'Jasper', 'Luna', 'Bruno', 'Rosie', 'Hugo', 'Kiki', 'Leo']
pip install -r requirements_gpu.txt
m = KittenTTS("KittenML/kitten-tts-mini-0.8", backend="cuda")

查看 example_cuda.py

KittenTTS(model_name, cache_dir=None)

从 Hugging Face Hub 加载模型。

model.generate(text, voice, speed, clean_text)

根据文本合成语音,返回一个包含 24 kHz 音频采样数据的 NumPy 数组。

model.generate_to_file(text, output_path, voice, speed, sample_rate, clean_text)

合成语音并直接写入音频文件。

normalize_text(text, locale="en-US", return_spans=False)

在不生成音频的情况下,对用于 TTS 的文本进行规范化。

from kittentts import normalize_text

normalized = normalize_text("Dr. Rivera paid $12.50 at 3:05 p.m.")
# "Doctor Rivera paid twelve dollars and fifty cents at three oh five p m."

result = normalize_text("Fig. 2", return_spans=True)
print(result.text)
print(result.spans)

当 return_spans=True 时,结果会包含从原始文本到规范化文本的字符区间映射,覆盖缩写、日期、时间、数字、货币、URL 和标点等发生变化的片段。

model.available_voices

返回可用语音名称列表:['Bella', 'Jasper', 'Luna', 'Bruno', 'Rosie', 'Hugo', 'Kiki', 'Leo']

操作系统:Linux、macOS 或 Windows

硬件:可在 CPU 上运行,无需 GPU

磁盘空间:根据模型版本不同,需要 25~80 MB

建议使用虚拟环境(conda、venv 或类似工具),以避免依赖冲突。

发布经过优化的推理引擎

发布质量更高的 TTS 模型

发布多语言 TTS

还有其他需求?请告诉我们。

我们为将 Kitten TTS 集成到产品中的团队提供商业支持,包括集成协助、定制语音开发和企业许可。

请联系我们或发送邮件至 info@stellonlabs.com,讨论你的具体需求。

社区与支持

Discord:加入社区

网站:kittenml.com

定制支持:申请表单

电子邮箱:info@stellonlabs.com

问题反馈:GitHub Issues

本项目采用 Apache License 2.0 许可。

Original source

本文由 AI 翻译整理自 Hacker News · github.com,原文版权归原作者所有。

阅读英文原文
上一篇
Google AI Studio 快速编程秘诀
下一篇
用Markdown声明式构建生成式UI交互