AWS详细介绍了其向量搜索产品组合,涵盖六种专用服务,提供选型决策框架和客户案例。
Agentic AI 正在改变你的工作方式,而向量搜索为数智体提供了精准、具上下文感知能力、基于真实数据的基础检索层。数智体能够在多步骤工作流中进行规划、推理和执行操作,使快速、相关地访问组织知识变得至关重要。
这些知识已经存在于数据库、对象存储、搜索引擎以及 PDF、录制视频通话和团队日常使用的系统等非结构化来源中。AWS 向量解决方案将智能搜索和检索带到数据所在之处,帮助数智体找到并使用正确的上下文,而无需移动或复制数据。
对于没有现有数据存储的新工作负载,我们在六种专用解决方案中提供了清晰的决策模型,让你能够为 Agentic AI 和分析工作负载选择合适的向量解决方案。
向量是 AI 的语言。它们桥接前沿模型与数十年积累的分散组织知识。通过将数据表示为高维向量,应用程序可以理解语义含义,识别文本、图像、音频和视频之间的关系,并在会话之间保持上下文。无论你是在处理产品描述、安全日志还是媒体库,向量都将一切转换为统一的数学空间,以便跨模态进行比较和搜索。
结合前沿 AI 模型,向量是个性化、具备上下文感知能力、智能用户体验的基础:
检索增强生成(RAG)和知识库通过在运行时检索的受信任数据为前沿模型响应提供基础,提高准确性、减少幻觉,并生成与组织知识一致的响应。
语义搜索基于含义和意图而非精确关键词匹配来检索信息,允许用户即使使用不同术语也能发现相关内容。
混合搜索将词汇搜索与语义搜索相结合,在结构化和非结构化数据上提供全面结果。
GraphRAG 将语义搜索与知识图谱相结合,为需要多步推理的企业场景提供准确、上下文丰富且可追溯的响应。
知识图谱通过明确的关系连接人、产品、文档和概念等实体,支持更智能的搜索、发现和 AI 驱动的推理。
通过上一节概述的选项,向量支持多种用例,包括:
实时推荐系统通过零售、媒体和娱乐领域的向量相似性识别符合用户兴趣的产品、内容或体验,实现个性化。
异常检测和欺诈识别在高维数据中识别异常模式,支持更早发现威胁、网络安全问题或设备故障。
多模态内容发现基于语义含义(而非文件类型或元数据)使用单一查询跨文本、图像、音频和视频进行搜索。
好消息是,对于大多数这些用例,你不需要新的数据库。使用 AWS,你可以在数据已经所在之处获得向量能力,跨你已经熟悉和使用的服务和数据库,无需数据迁移。
下图展示了 AWS 向量能力的广度以及 Agentic AI 的主要用例。
图 1:面向 Agentic AI 用例的 AWS 向量能力广度
这是指导我们整个方法的原则。如果你已经有 AWS 数据存储,就在该数据存储中添加向量搜索。除非有令人信服的理由,否则不要引入新服务。向量与源数据共存,消除了跨服务跳转,并将向量搜索与原生查询能力相结合。
使用现有数据存储时,你可以消除新编程工具、API、SDK 等的学习曲线。你也可以相信现有数据存储满足你的要求。例如,你在生产中经过可扩展性、可用性和性能验证的数据库现在将继续提供向量搜索功能。最后,当你的向量和数据存储在同一位置时,应用程序运行得更快。无需担心数据同步或数据移动。你还可以通过构建已经投资的资产来实现成本节约。
如果你的数据已经在 Amazon OpenSearch Service、Amazon Simple Storage Service(Amazon S3)、Amazon Aurora PostgreSQL、Amazon DynamoDB、Amazon ElastiCache for Valkey 或 Amazon Neptune 中,就在数据所在之处添加向量。正确的向量搜索解决方案跟随数据,而非相反。
对于新工作负载,识别你的主要需求:延迟、成本或访问模式,然后选择针对其优化的引擎。许多工作负载需要搜索、规模和 Agentic AI 集成的平衡。对于这些工作负载,默认选择 Amazon OpenSearch Service,它在单个系统中结合了词汇、向量、混合和 Agentic 搜索,具有高吞吐量、低延迟和大规模相关结果。
以下决策模型可以帮助你根据工作负载需求选择正确的向量解决方案。
图 2:向量引擎决策模型
Amazon OpenSearch Service 是一个托管检索引擎,在单个系统中结合了词汇、向量和混合搜索,具有高吞吐量、低延迟和大规模相关结果。它支持多种索引策略、向量量化和元数据过滤,从简单的 RAG 应用程序扩展到高级多信号检索。机器学习(ML)驱动的自动优化通过自动选择正确配置来消除手动调优。GPU 加速将大规模数据集的索引速度提高最多 10 倍,成本降低至原来的四分之一,而 UltraWarm 和 Writable Warm 层降低了访问频率较低数据的存储成本。
选择 OpenSearch Service 作为新工作负载的默认选择,因为大多数新工作负载没有单一的主要需求。它们需要搜索、规模和 Agentic AI 集成的平衡。OpenSearch Service 在延迟、向量容量、每秒查询数(QPS)、成本效益、混合搜索和易用性方面提供了最大的灵活性。它涵盖了最广泛的用例,包括 RAG、异常检测、多模态内容发现以及任何需要混合搜索的工作负载。它支持数十亿向量规模,处理数千 QPS,服务超过 100,000 名月度活跃客户,每月处理超过 10 万亿次请求。
下一代 Amazon OpenSearch Serverless 专为 Agentic AI 和动态工作负载而构建。它比上一代自动扩展快 20 倍,可在数秒内配置,从零扩展到每秒数千请求。它还会在空闲时缩减至零,与为峰值容量配置相比,可节省高达 60% 的成本。你只需为消耗的容量付费。如果你的数智体没有运行,你无需付费。
Adobe 采用 OpenSearch Service 来扩展其 Acrobat AI Assistant,为数亿用户提供服务。这是一个对话式生成式 AI 引擎,直接集成到 Adobe 的文档生态系统中。
Amazon S3 Vectors 是 Amazon S3 的一项功能,是首个支持存储和查询向量的原生云对象存储。它将 S3 的成本结构、规模和简单性带到向量存储中,与专用向量数据库相比,向量上传、存储和查询的成本降低高达 90%。这使得构建和维护十亿级向量索引变得经济高效,可在 Amazon S3 中存储的内容上提升 AI 数智体记忆、上下文和语义搜索,且无需管理基础设施。
自 S3 Vectors 正式发布以来,客户平均每天执行数千万次查询,比预览期增长了 5 倍以上。最近的两个增强功能改善了查询体验和定价。首先,S3 Vectors 现在每次查询支持最多 10,000 个搜索结果,比之前增加了 100 倍,这对于多阶段检索管道特别有价值,这些管道应用重排序、聚合或去重来生成更相关的结果集。其次,拥有超过 1000 万向量的向量索引的查询费用现在降低高达 80%,显著降低了大规模 AI、RAG 和语义搜索工作负载的运行成本。
当需要经济高效的向量存储、对大型向量数据集进行简单向量搜索和元数据过滤以支持低频查询时,请选择 Amazon S3 Vectors。建议在延迟可接受约 100 毫秒或更高、或以中等 QPS 快速增长向量数据集的场景使用。它支持每个向量索引高达 20 亿个向量,采用按查询付费定价,因此只需为存储的向量付费,搜索时才会产生查询费用。常见用例包括数据湖语义搜索、基于 RAG 的知识检索、大规模向量存储和批量检索。客户还可以通过 S3 API 直接处理向量和索引。
BMW Group 将 S3 Vectors 作为其混合搜索解决方案的构建块,该方案由使用 Amazon Bedrock AgentCore 构建的智能搜索智能体驱动。工程师可以用自然语言查询 20 PB 的数据,结合 S3 Vectors 进行语义相似性搜索和 Amazon Athena 进行 SQL 查询。
Amazon DynamoDB 是一款无服务器、完全托管的分布式 NoSQL 数据库,在任意规模下均能实现个位数毫秒级性能。DynamoDB 向量搜索在超过 99% 的召回率下提供个位数毫秒级延迟,适用于任意规模(即使数万亿向量)。它完全无服务器,无需配置、修补或管理服务器,无需安装、维护或运营软件。您喜爱的 DynamoDB 零基础设施管理特性——无版本、无维护窗口、无停机维护——同样适用于向量搜索。DynamoDB 向量搜索引入了一种新索引,创建在存储向量嵌入的属性上。它支持高达 4,096 维,欧氏距离、余弦距离和点积距离函数,以及内联过滤。DynamoDB 向量搜索可与 DynamoDB 全局表配合使用,同时支持多区域最终一致性和强一致性。
DynamoDB 服务超过 100 万客户。客户目前已将 DynamoDB 用于 AI 智能体工作负载,例如在对话期间保持会话上下文以及跨多步骤任务跟踪状态。通过向量搜索,DynamoDB 可以支持 AI 智能体应用中长期记忆的语义检索。其他用例包括 RAG、多模态相似性搜索和推荐引擎。您可以在一个无服务器数据库中完成所有这些操作,无需维护单独的向量存储来同步数据,也无需学习新的 API。
当您的运营数据已存在于 DynamoDB 中,或需要在任意规模下实现个位数毫秒级向量搜索且无需基础设施管理时,请选择 DynamoDB 向量搜索。
Globant 是一家数字化原生公司,为全球企业构建 AI 驱动的产品和数字化转型解决方案。
"我们已在 DynamoDB 上构建客户解决方案,因此在同一数据库中获得原生向量搜索极具价值——无需将数据复制到单独的向量存储或管理第二个系统。它完全无服务器,可自动扩展到几乎任意规模,因此我们只需为每个客户使用的资源付费,并提供用户-facing AI 体验所需的实时、低延迟搜索。它让我们的工程师专注于构建 AI 应用,而不是管理基础设施。"
— Gastón Milano,Globant 企业 AI CEO
Amazon ElastiCache 是一款无服务器、完全托管的缓存服务,通过完全兼容 Valkey、Memcached 和 Redis OSS 的协议提供微秒级延迟性能。
借助 ElastiCache for Valkey,您可以通过实现记忆机制来构建更个性化、更具上下文感知能力的响应,这种机制可将跨会话对话历史呈现给大型语言模型(LLM)。类似于缓存如何降低数据库成本并提高应用性能,语义缓存通过为语义相似的提示提供缓存响应来降低使用 LLM 的成本和延迟。您还可以使用向量搜索在大型数据集上驱动 RAG,通过真实数据为输出提供依据来提高相关性并减少幻觉。
当工作负载有微秒级延迟要求时,请选择 ElastiCache for Valkey。这包括实时推荐引擎、基于会话的个性化、延迟敏感的 RAG 管道和语义缓存。它支持高达 10 亿个向量实现微秒级延迟向量搜索。
Sanoma 使用 ElastiCache for Valkey 将人工版主决策转化为向量,实时为未来的 AI 版主决策提供参考,无需重新训练。如今,30% 的评论与过去的决策匹配,其中 6.5% 因此获得了更准确的不同结果。
Amazon Neptune 是一款无服务器图形数据库服务,适用于互联数据和提高 AI 准确性。
当您的工作负载涉及高度互联的数据或多跳推理时,Amazon Neptune 通过将图形遍历与向量相似性结合在单个查询中独特地解决了这一问题。
Neptune 提供低延迟向量搜索,容量达 20-30 亿向量,并内置多跳推理和可追溯性。最后一点至关重要。受监管行业必须展示为何返回某个结果,而不仅仅是返回了什么。这种透明度使 Neptune 成为合规、风险和安全工作负载的必备选择。
当工作负载需要将图形遍历与向量相似性结合在单个查询中时,请选择 Neptune。使用 Neptune,您可以遍历连接(例如"哪些团队拥有受此警报影响的服务?")并将该关系上下文与向量相似性结合在单个查询中。我们的许多客户将 Neptune 用于需要知识图谱的工作负载,例如金融和合规风险、制药研究、药物发现和安全情报。
Deloitte 使用 Amazon Neptune 与 AWS GraphRAG 工具包为安全情报中心提供支持,将基于图形的知识检索与生成式 AI 相结合。通过 GraphRAG 连接策略解释、运营执行和实时指标,Deloitte 提供了基于及时组织上下文的预测性安全指导。
Amazon Aurora 为 PostgreSQL 提供全球规模的高性能和可用性。您可以开启 pgvector 扩展并使用优化读取来实现高性能向量搜索。
启用 pgvector 0.8.0 的 Amazon Aurora PostgreSQL 可实现 9 倍更快的索引和 100 倍更相关的过滤结果。这是一个重大飞跃。它将向量搜索与完整 SQL 查询表面相结合:连接、聚合、WHERE 子句和 ACID 事务在单一引擎中实现。
当您的源数据已存在于 Aurora 中时,请选择 Aurora。建议在需要使用 SQL 或需要将向量和关系工作负载合并到单一数据库时使用。它提供低延迟并支持数千亿向量,是多租户软件即服务(SaaS)应用、AI 智能体记忆存储以及带结构化数据上下文的 RAG 的理想选择。
LeadSquared 是一个 SaaS CRM 平台,服务于 BFSI、医疗和教育等领域,使用 Aurora PostgreSQL 与 pgvector 以及 Amazon Bedrock 构建 RAG 解决方案。他们使用 Aurora 同时存储向量嵌入和关键运营数据,加速了聊天机器人的部署。
某些用例受益于组合多个向量服务。您可能有一个工作负载,最适合结合使用 Amazon ElastiCache for Valkey 进行语义缓存、Amazon OpenSearch Service 进行混合搜索以及 Amazon S3 Vectors 进行持久向量存储的架构。Together,这种组合允许您从零扩展到数万亿向量,同时在热、温、冷层之间优化延迟和成本。
在评估具有潜在竞争需求的复杂工作负载时,请同时考虑三个维度:
性能和规模:延迟特征、向量体积、QPS 要求以及算法调优以提高准确性。
成本和运营:成本-延迟权衡、分层需求、运营模式偏好(无服务器或预置)以及现有团队专业知识。
搜索能力:混合搜索、SQL 支持、复杂元数据过滤、全文搜索和多向量搜索。
下表可帮助您选择正确的向量引擎,以便针对延迟、成本或访问模式需求进行优化。
词法搜索、语义搜索、混合搜索和 AI 智能体搜索。
最广泛的能力集,包括无服务器。
表 1:AWS 向量解决方案
立即开始使用 AWS 向量解决方案,构建语义搜索、自管理知识库和 RAG。现有的数据在哪里,就从哪里添加向量解决方案。对于新的工作负载,可以使用决策模型根据延迟和扩展需求选择向量解决方案;如果不确定,默认选择 Amazon OpenSearch Service。如果您对全托管知识库和 RAG 解决方案感兴趣,请阅读这篇关于 Amazon Bedrock Knowledge Bases 的文章。
参加我们的网络研讨会《AWS 向量解决方案概述:数据所在之处的 Agentic AI 智能》,深入了解如何选择合适的向量引擎以及我们产品组合的最新更新。联系您的 AWS 客户团队,获取实战研讨会或概念验证(POC)的支持。