Simon Willison 公开了一套纯浏览器端代码,无依赖库,直接连 Google BidiGenerateContent WebSocket 接口实现语音对话。
Google 今天发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking——两款新的语音转语音模型,形态上与 OpenAI 的 GPT-Live 系列相似。
我让 GPT-6 Astra Extra High 去啃文档,然后用它帮我搭建了这个 Web UI 来试用这些新模型。你可以选择一个模型和语音预设,输入一个可选的系统提示词,然后通过浏览器开始语音对话,包括在模型说话时打断它的能力。

这个实现没有使用任何第三方库。它连接到 wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent?key=... WebSocket 端点,并使用 Web Audio API 的 AudioContext 来进行音频采集和播放。
这里有一份 Gemini Live 入门教程,教你如何开始使用那个 WebSockets API。
用 GPT-6 Astra 和 ChatGPT Work 生成跑步路线 - 2026年9月12日
OpenAI agents 在今年五月攻击了 RubyGems - 2026年9月12日
关于纳维-斯托克斯千禧年难题的一些思考 - 2026年9月8日
这是 Simon Willison 的报道,发表于 2026 年 9 月 15 日。
赞助我 $10/月,每月收到一份关于当月最重要 LLM 动态的精选摘要。
付费让我少发给你!