通过识别会议中70%无效填充语,仅在30%关键问题时触发LLM和向量检索,实现令牌成本降低超过65%,延迟控制在2秒内。
构建实时 AI Agent 时,最难的挑战不仅仅是获得准确的答案——更是如何避免 API 账单爆炸式增长。
在开发 LiveAssist 时——一款静默的实时会议 Copilot,旨在通过查询企业 RAG 知识库帮助主持人在直播通话中回答客户问题——我们立刻遇到了一个巨大的架构障碍:连续音频流中的 Token 过度消耗。
以下是详细的技术拆解,讲述我们如何解决这一问题、将不必要的 token 成本削减超过 65%、并将延迟控制在 2 秒以内。
在一场标准的 60 分钟商务会议或销售通话中:
~70% 的对话由问候、寒暄、客套话("你能听到吗?"、"今天天气不错")以及无行动价值的闲聊组成。
仅有约 30% 是需要精确回答的关键技术、商业或合规问题。
如果你的系统将整个实时转录流直接灌入 LLM 和向量数据库:
疯狂的 Token 消耗:每次通话中因无用的会话填充词而燃烧数万个 token。
噪音与高延迟:RAG 管道被反复触发,向会议主持人狂轰滥炸无关的文档片段,同时拖慢响应速度。
天真的全流摄取:将所有内容推给 LLM 会让 SaaS 产品的单位经济效益破产。
大型过滤系统 Prompt:用长系统 Prompt 指示高端模型(如 GPT-4o 或 Claude 3.5)"忽略闲聊",仍然会为通话这一小时中说出的每个字收取 input token 费用。
为了解决这一问题,我们将语音摄取从核心 RAG 生成管道解耦为三层架构:
[ 实时音频流 ] │ ▼
[ 第一级:轻量级意图分类器 / 快速语义路由 ]
├── casual small talk? ──────► [ 丢弃 / 本地状态更新 ]
└── high-intent query? ──────► [ 进入第二级 ]
│ ▼
[ 第二级:上下文压缩器 & RAG 知识库检索 ]
├── 查询 AES-256 加密的企业向量数据库
└── 剥离冗余上下文块
│ ▼
[ 第三级:实时主持人 UI 展示 ]
└── 在屏幕上进行低延迟答案生成
在任何文本到达主 LLM 或向量搜索之前,它会经过一个亚 50ms 的轻量级意图路由器。这一层分析语音块以分类意图:
如果是随意填充词,管道立即终止,零 RAG 或基础 LLM token 消耗。
当检测到合法查询时(例如:"你们企业托管的 SLA 是什么?"),引擎清除会话伪影,构建查询向量,并仅从公司上传的文档(PDF、定价表)中检索最相关的前几条片段。
答案被简洁地合成,并实时展示在主持人的驾驶舱中——在不产生延迟峰值的情况下交付技术答案。
通过将重型 lifting 从持续 LLM 推理转移到上游门控:
现实世界的 AI 应用开发很少仅仅是连接一个 API 端点。真正的生产就绪 AI 需要成本工程、智能门控和严格的延迟优化。
我们将这一架构直接集成到了 LiveAssist 中。如果你正在管理复杂的客户通话或技术销售,可以试用 3 小时免费版。
你是如何处理 token 的?欢迎在评论区讨论!