前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9473
  • OpenAI 发布数百个数学难题的解答成果
  • 29款LLM谄媚度基准测试:前沿模型稳住了,小模型全面溃败
  • Anthropic开放Claude最强版本用于安全测试:已发现10万漏洞
  • 谷歌 EmbeddingGemma 2:7.4 亿参数多模态嵌入模型,手机端 191MB 即可运行
  • 无 API 桌面应用远程控制方案:用 CDP 桥接手机与 Claude Code
  • AI功能按调用计费:多数设计在浪费预算
  • Simon Willison 点评 EmbeddingGemma 2:开源权重是嵌入模型唯一理智选择
  • Mistral Large 4预览发布:参数破万亿
  • Google发布EmbeddingGemma 2:开源多模态嵌入模型
  • Google 开源 EmbeddingGemma 2:740M 参数端侧向量模型,191MB 内存跑离线 RAG
  • 间接提示注入攻击链解析与防御架构
  • Whisper 口述转文字 WER 从 8.5% 降至 2.5% 的实战总结
  • 用 AgentCore + OpenClaw 构建持久记忆的个人 AI 助手
  • Google开源EmbeddingGemma 2:7.4亿参数多模态向量模型
  • Mistral Large 4:1.05万亿参数多模态MoE模型预览
  • Vercel AI Gateway 新增置信度触发降级策略
  • QA 工程师自建工具链:验证 AI 编程 Agent 的实际工作成果
  • 一个 MCP 服务器给 Claude Code 接入 200+ 图像视频生成模型
  • Agentic AI 需要元过滤器而非传统 Guardrails:安全架构新思路
  • 2026 开发者调查:AI 编程助手日活高但信任度低
  • GitLab AI Gateway 高危漏洞让我重新审视自建 Agent 权限控制
  • Mistral Large 4 发布:剑指闭源与开源竞品
  • Mistral Large 4:万亿参数主打安全合规
  • Stack Overflow 2026 开发者调查报告发布
  • Mistral Large 4 公开预览:1万亿参数、月底开源
  • Google Gemini 免费版大幅缩限:Flash Lite 限免,Pro/Deep Think 需付费
  • 上线 LLM 功能不死机的工程检查清单
  • AI代理能识别工具失效但仍持续调用,核心问题在于判断与行为的断裂
  • 给Claude Code开发Mod插件:实现额度用量条与项目待办面板
  • LLM 访问控制与监控的实战避坑指南
  • 企业 RAG 实战:混合搜索与重排序的核心差异
  • 日本开发者给 Claude Code 的 Awwwards 级前端 prompt
  • Reflection发布Beam:非中国最强开源模型,编程推理对标GLM
  • Codex CLI vs Claude Code:相同任务实测成本公开
  • Google Docs原生支持Markdown,AI Agent协作成亮点
  • Meta、微软要求员工少用Claude节省成本
  • DeepSeek Harness:24 万 stars 的插件化 AI 工具链
  • 如何给AI编程助手提供正确上下文
  • 12GB显卡跑125B大模型:Strata引擎开源
  • AI 指令遵循失效的深层原因:语义理解≠可靠执行
  • ML 系统上线前的设计审计五问
  • 本地 AI Agent 组织化管理:带预算与汇报链的开源框架
  • 已加载 42 / 9473
8.0
热点
AI SCORE
编程提效2026-10-07 03:28

Whisper 口述转文字 WER 从 8.5% 降至 2.5% 的实战总结

dev.to · AI#Whisper#语音识别#提示词
Editor brief · 编辑速览

Whisper 口述转写中,60% 的「错误」其实不是识别问题:填充词、口述修正、语音指令、数字格式各占一类。简单后处理规则将 WER 从 8.51% 降至 6.05%,再加小模型精调到 2.5%。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

我录口述笔记:给自己的备注、commit 信息、短规格说明,里面有大量产品名和库名。我用 faster-whisper large-v3-turbo 处理了 101 条自己的录音,得到 8.5% 的词错误率。听起来很高,所以我逐条分析了所有错误。大部分结果出乎我意料。

1. 大部分"错误"其实不是识别错误

在 90 个错误词中,大约 60 个并非识别错误:

口述修正(如 "Tuesday, no, Wednesday")

语音命令(如 "new paragraph")

数字格式(如把 "three thirty p m" 识别成 "3:30 PM")

对填充词、语音命令和数字格式做一轮简单规则过滤,WER 就从 8.51% 降到了 6.05%,模型本身没动。在之前的一次跑测中,在规则基础上加一层小 LLM 清理进一步降到了约 2.5%,额外耗时约 450ms。如果你在跑口述的基准测试,先看看你的参考文本假定了什么。

2. 术语提示词有用——如果你把它写成句子的话

Whisper 支持传入初始提示词。不要直接给词表,我把它写成一句完整的句子:

from faster_whisper import WhisperModel

model = WhisperModel("large-v3-turbo", device="cuda", compute_type="float16")
terms = ["Kubernetes", "PostgreSQL", "Jetpack Compose"]
prompt = "Notes about " + ", ".join(terms[:-1]) + " and " + terms[-1] + "."

segments, info = model.transcribe(
    "clip.wav",
    language="en", # 固定语言,不要自动检测
    initial_prompt=prompt,
    vad_filter=True, # 保持开启,见下文
    beam_size=1,
)

我测量到两个关键点:

保持 VAD 开启。 关闭 VAD 且设置了提示词的情况下,我的全部 80 个静音片段都返回了幻觉文本。

提示词有容量上限。 大约 223 个 token,所以适用于十几个到上百个术语。到约 1000 个时就会失效,出现截断和误插入。

在我测试的 15 个术语(19 次出现)中,裸模型只对了 12 个;单独加提示词对了 16 个;下方完整方案全部 19 个都对。

3. 一个 rewriter 抓遗漏,顺便修了一个 bug

提示词不是万能的("Postgres sequel",或者同一个名字有三种读法)。所以解码之后我会跑一个小型语音 rewriter:用 1 到 3 个词的滑动窗口扫过转写结果,把每个窗口和字典词条比较,选出最佳的非重叠替换。

我的第一个版本用 相似度 × 窗口字符长度 来评分。这样会倾向于更长的窗口,所以 "to Kubernetes" 反而击败了精确匹配的 "Kubernetes",rewriter 把 "to" 给吞了。这个问题发生在 6 个触发重写的片段中的 4 个里。修复只有一行:按匹配词本身的长度加权,而不是按窗口长度加权。

我把这套修复在其他测试集上重新跑了一遍:485 条真实录音(无字典词条,零改动,零误插入)、450 条合成术语录音、以及掺了干扰词的字典。在所有情况下结果都是中性或更好。

4. 哪些方法不管用,以及我怀疑的坑

在公开数据上微调反而更差。 LoRA 在公开集合上把会议风格基准的误差从 12.5% 压到 5.9%(5 小时数据),然后就平台期了,还把我自己的口述数据集弄得更糟(从 8.2% 到 11.3%,用了 50 小时)。口头形式的标签反而教模型去掉了数字和货币格式。

"Notes about..." 提示词有副作用。 它会让 Whisper 把列表项改成首字母大写,有时还会漏掉一个小词("a jacket, a charger" 变成了 "Jacket, Charger")。在部分录音里,它还把口述的 "period" 拼成了字面的单词。这两个我都没修。

噪音最先搞坏它。 在 10 dB 下混入多说话人的嘈杂声会增加约 20 个百分点的 WER,数字受损最严重。

行话数字是 in-sample 的。 那 15 个术语是我一个人调出来的。提示词加 rewriter 的整体收益(在样本内从 8.51% 到 7.57%)在噪声范围内。规则通过的收益则不是。想对新音频下结论需要 20+ 说话人。我不发布这些录音,因为那是我的声音。

5. 如果你想试试

我把这套东西跑在一个小批量转录 API 后面,因为我自己的工具需要。你可以在浏览器里直接试,不需要 API key:https://readaloudai.org/transcribe。用 API key 的话是每分钟音频 $0.11,按秒计费。新账户有免费额度,大约够 54 分钟转录,开始时不需要信用卡。

坦诚说,来自文档:

仅限批量:没有实时流,没有说话人标签。

准确率仅在英语上测量。

安静期后第一个请求需要 10 到 18 秒来拉起 GPU,之后短录音大约一秒。

Whisper 偶尔会在静音或噪音上编造文本。

声明:我是开发者。如果某个录音里你的术语被弄错了,欢迎发给我看。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
间接提示注入攻击链解析与防御架构
下一篇
用 AgentCore + OpenClaw 构建持久记忆的个人 AI 助手