Fish Audio四款语音合成与转写模型接入Vercel AI Gateway,30天内免费使用,支持低延迟流式语音克隆。
Fish Audio 的语音模型现已上线 AI Gateway。为庆祝发布,即日起至 9 月 18 日,Fish Audio 所有模型在 AI Gateway 上均免费使用 30 天。
$15.00 / 百万字符
$0.36 / 小时音频
Fish Audio 提供四款模型,包括其最新的文本转语音模型:
fish-audio/s2.1-pro (text-to-speech): 为低延迟流式传输而设计;通过参考录音克隆声音。
fish-audio/transcribe-1 (transcription): 返回文本以及音频时长和时间戳分段,精确到单个单词。
fish-audio/s2-pro (text-to-speech): 支持约八十种语言,并接受内联标签——写在文本内的纯语言指令——因此可以更改单个单词或短语的发音方式,而无需为整个请求设置一种风格。
fish-audio/s1 (text-to-speech): 读取可携带情绪、语调、和音效标记的文本。
使用标准模型名称(如 fish-audio/s2.1-pro)是免费的,但在优惠期结束后将自动开始计费。
为确保在免费期结束后不被扣费,请在标准名称后添加 -free 后缀,这样模型将在优惠结束时停止服务(例如 fish-audio/s2.1-pro-free)。
Speech and transcription 已随当前 AI SDK 7 版本发布。
npm install ai@latest @ai-sdk/gateway@latest
使用 generateSpeech 从文本生成语音音频并写入文件:
import { experimental_generateSpeech as generateSpeech } from 'ai';
import { writeFile } from 'node:fs/promises';
const result = await generateSpeech({
model: 'fish-audio/s2.1-pro',
text: 'How are you doing today?',
});
await writeFile('speech.mp3', result.audio.uint8Array);
使用 transcribe 将录音转录为文本。音频可以是缓冲区、base64 字符串或 URL:
import { experimental_transcribe as transcribe } from 'ai';
import { readFile } from 'node:fs/promises';
const result = await transcribe({
model: 'fish-audio/transcribe-1',
audio: await readFile('audio.mp3'),
});
console.log(result.text);
console.log(result.segments);
每个 segment 包含文本及其开始和结束时间(秒),精确到单个单词。
也可以在不编写代码的情况下试用 Fish Audio 模型。打开模型列表,点击进入某个模型,然后发送文本或音频,即可在浏览器中听到或读取结果。
有关音频模型的完整使用指南,请参阅 speech quickstart。有关 Fish Audio 的更多详细信息,请参阅该 provider 的 AI SDK 文档。