观点文章探讨搜索在 RAG 和未来 AI 应用中的战略地位,提供趋势思考但缺乏具体技术方案。
在浏览LinkedIn时,我发现了一篇有趣的文章。标题是《每家LLM公司都是搜索公司,搜索很难:LLM检索系统的未来》。
这很有意思,因为我们在过去几年里构建了SWIRL,帮助企业扩展搜索和AI基础设施。正如我们提到的,搜索无处不在。DEVTO现在使用Algolia(可能更早就用了,他们的代码用于执行搜索)来实现智能搜索。任何尝试过构建启用搜索的应用程序的人都知道,搜索很复杂,涉及许多因素,如相关性排名和个性化。
这使得构建搜索变得困难。这是给那些尝试过构建启用搜索应用程序的人的。搜索很难管理,有很多因素需要考虑。以搜索引擎AI的领导者谷歌为例,它因搜索结果而面临批评。人们开始抱怨其搜索结果。但我们讨论的不仅仅是谷歌。这里有很多值得理解的地方。
企业拥有大量数据,这些数据散布在各个部门和渠道中——从客户交互和销售记录到运营日志和员工反馈。他们意识到利用这些数据构建AI驱动应用程序的巨大潜力,可以简化运营、增强客户体验并推动创新。然而,挑战在于统一这个碎片化的数据景观。
我们目前的做法是将所有数据流式传输到向量数据库中。然后使用它来检索信息。这既简单又困难。简单是因为你知道在哪里搜索。困难是因为它要管理这些向量数据库(或任何搜索索引)。你必须:
此外,如果你使用向量数据库,你还要处理嵌入。但那是另一个博客的故事了。
我们生成的大量数据变得越来越难以管理。传统方法成本高、耗时长,还存在一些安全风险。
当你的LLM可以搜索数据存储库内部的信息时,它们可以提供你和你的团队所需的信息,而无需在训练记忆中搜索或在信息不存在时产生幻觉。通过提供你所询问内容的上下文,它就变成了查找一本书然后回答问题。
为了开发能够在内部数据上表现良好的AI应用程序,我们需要一个高效的检索增强生成(RAG)方法。在这种情况下,检索器是一个搜索平台。
属性应该包括:
这就是我们构建SWIRL的方式:一个高效的检索器,可以提供好的答案,连接多个数据提供商,并在企业中实现AI。
所以,一项工作就完成了。你有了数据。你所要做的就是配置一个数据提供商。创建一个查询并获取答案。一旦你实时获得你想要的数据,机会就是无限的:
我可以搜索数据源并获取数据。其余的只是如何协调事物的方式。广泛来说,它是简单且安全的。我想给你一个架构的概念。看这个图表。它演示了我们如何通过AI基础设施平台做到这一点。
最好的地方就在这里:实时搜索你的数据。改变游戏规则的是,我们应该选择一个框架,允许我们从多个应用程序获取数据而不限制最终用户。然后,使LLM能够帮助你执行任务。
还有一点:最好的数据不一定在SQL数据库中。它可能在你的团队房间、会议记录或你保存的其他文档中。上述架构允许你查找并获得良好的结果,使你感觉像是你自己写的。为了减少我们对AI的信息差距,需要一种搜索,不仅仅是语义搜索,而是一般的搜索架构。
SWIRL是开源的,用Python构建。我们正在开发许多很棒的东西,从搜索到聊天界面。如果你是UI专家,请帮助我们!
看看这个关于如何设置SWIRL的视频。然后,加入我们的Slack社区并联系我。让我们一起构建一个令人惊艳的开源AI平台。可能有一些令人惊艳的奖励等你。💐🎁
在GitHub上给我们一个🌟。
如需进一步操作,你可以考虑屏蔽此人和/或举报滥用。