开源工具让你直接对话 ArXiv 论文内容。对做 AI 研究和快速学习新论文的程序员很实用。
通知:你必须登录才能更改通知设置
仓库文件导航
Talk2Arxiv 是一个专为学术论文 PDF 构建的开源 RAG(Retrieval-Augmented Generation,检索增强生成)系统,由 talk2arxiv-server 提供支持。
只需运行 yarn,然后运行 yarn run dev。
PDF 解析:使用 GROBID 高效提取 PDF 中的文本。
分块算法:采用自主开发的算法,实现最优文本分块。它会按照逻辑章节(引言、摘要、作者等)进行分块,同时也采用递归细分分块策略(先按 512 个字符分块,然后是 256 个,再然后是 128 个……)。
文本 Embedding:使用 Cohere 的 EmbedV3 模型生成准确的文本 Embedding。
Vector Database 集成:使用 Qdrant 存储和查询 Embedding。它还可以作为研究论文的缓存,因此每篇论文只需生成一次 Embedding。
上下文相关性:采用 reranking 流程,根据用户输入选出最相关的内容。
前端:使用 Typescript、ReactJS、TailwindCSS 和 NextJS 开发。后端:由 talk2arxiv-server 提供支持,使用 Flask、Gunicorn 和 Nginx。
改进分块策略
改为提取 LaTeX 源代码,以提升符号数学公式和非标准文本元素的检索效果
同时使用具备视觉理解能力的 LLM 模型
基于账户的个性化
后端并非为承载任何规模的负载而构建。当大量请求并发到来时,后端会出现停滞,因为它只能以单线程方式逐个处理请求
使用 ChatGPT 与任意 ArXiv 论文对话