AssemblyAI Challenge的参赛项目,统一处理音频转录和文档理解。展示了多模态AI集成的实用价值。
这是 AssemblyAI Voice Agents Challenge 的投稿作品
我构建了一个命令行界面(CLI)工具,设计用来帮助用户更有效地管理医学和法律对话。
该工具可以转录与医生或财务顾问的音频文件或通话,然后组织和检索相关见解以协助决策制定。
这个想法源于一个个人痛点——在重要的医学或法律讨论中,我发现很难:
通过使用 AssemblyAI 的准确转录,特别是对于特定领域(医学/法律)词汇的处理,这个项目得以实现。
所有的 CLI 命令和标志都可以在 README.md 中找到。要进行设置,你需要在 .env 文件中包含以下内容:
ASSEMBLY_AI_API_KEY=""
OPENAI_API_KEY=""
QDRANT_URL=""
确保在本地系统中运行 Qdrant。
使用 AssemblyAI 进行转录并将其注入到 RAG 中。
使用来自医生过去通话的记忆。
https://github.com/KarneeshkarV/-AssemblyAI-Domain-Expert-Voice-Agent
使用 Agno agent 框架构建。
每个特定领域的 agent(医学或法律)由一个子 agent 团队驱动——一个用于 RAG(检索)、一个用于记忆/上下文管理、一个用于网络搜索和知识查询,等等....
在主要实现中,我使用了 OpenAI 模型以获得成本效益,尽管我在测试中发现 Claude 模型在工具使用方面表现更好。
对音频进行了一些优化以有效使用 TTS 积分。
核心转录由 AssemblyAI 提供支持,可以健壮地处理特定领域的词汇。
我计划:
然而,由于时间限制——这些仍在我的待办事项列表中!
我很想听听我如何能改进这个项目。
一些评论可能仅对已登录的访问者可见。登录以查看所有评论。
如需进一步操作,你可能会考虑阻止此人和/或举报滥用。