OpenSearch Service支持MCP Apps,AI Agent可在单次对话内从告警跳转到追踪、日志并定位根因,无需离开IDE即可验证每一步操作。
可观测性代理很快。它们查询告警、将日志与追踪关联,并在几分钟内给出根因假设。但验证部分仍然耗时。你阅读代理的文本摘要,在浏览器中打开可观测性工具,导航到追踪瀑布图,检查服务地图以确定影响范围,然后将代理告诉你的信息与屏幕上看到的内容进行交叉验证。代理为你节省了查询时间。但它没有节省你切换标签页、携带上下文、手动验证的时间。那仍然是你自己的工作。
Amazon OpenSearch Service MCP Apps 填补了这一缺口。MCP Apps 扩展了 Model Context Protocol,使每个工具调用都返回一个交互式可视化——追踪瀑布图、服务拓扑、日志模式视图——直接渲染在你的 AI 助手聊天窗口中,与文本响应并列。你让代理进行调查。代理查询 Amazon OpenSearch Service。响应同时包含文本解释和相关的数据面板小组件。你在与提问相同的线程中验证,无需打开另一个浏览器标签页或重新运行查询。
本文解释 MCP Apps 如何改变你的可观测性工作流程,并逐步引导你完成设置。
典型的调查循环如下进行。首先,工程师向代理提问并获得基于文本的根因假设。接下来,他们离开 IDE,打开浏览器并登录单独的可观测性 UI。然后他们在不同的工具中手动重新运行查询以复现代理发现的内容。通过将代理的文本输出与实际仪表板进行视觉对比进行验证后,他们返回代理并恢复对话,但在调查中已经失去了自己的位置。
代理在几秒钟内生成响应,但你必须离开代理环境进行验证。这意味着要登录一个单独的可观测性体验并手动导航仪表板。这种外部验证循环是瓶颈。它迫使你进入一种工具切换的角色,削弱了代理自动化带来的速度优势。
在当地运行代理可观测性的组织选择了控制权和成本效率,而不是供应商提供的 AI。但这一选择历来伴随着权衡:本地代理设置牺牲了易用性,有时在代理性能上也比不上紧密耦合 AI 与服务的供应商托管解决方案。对于这些团队来说,验证差距是主要的运营负担。他们为自治性做了优化,但验证仍然以人类速度在单独的可观测性工具中进行。
Amazon OpenSearch Service 现在支持 MCP Apps,这是一种扩展 MCP 的双响应模式。
当你的 AI 代理调用 MCP App 工具时,响应包含两部分。第一部分是带有简洁结构化数据的文本摘要。第二部分是交互式可视化,渲染在同一对话线程中供你查看。OpenSearch MCP App 通过对为仪表板提供支持的相同数据源执行代码来生成可视化。正因如此,结果是确定性的。你不是在信任 AI 的解释。你看到的是实际查询结果渲染为交互式图表、追踪瀑布图或服务地图。
图 1:MCP App 在代理 IDE 内渲染可观测性报告,显示按服务分组的错误计数以及 AI 生成的根因分析
MCP Apps 功能由本地 MCP 服务器、你的 IDE 和你的 OpenSearch UI 应用程序协同工作。本节解释架构、协议扩展机制以及单个工具调用的端到端流程。
本地 MCP 服务器在你的机器上运行。它充当你的代理 IDE 和 OpenSearch UI 应用程序之间的安全桥梁。服务器暴露代理可调用的可观测性工具。每个工具调用通过 MCP 服务器到达你的 OpenSearch UI 端点,执行查询,并将双响应返回到你的 IDE。OpenSearch UI 是统一可观测性的无服务器接口,可与 OpenSearch 域、无服务器集合、CloudWatch 和 Amazon Managed Service for Prometheus 配合使用(了解更多关于 OpenSearch UI 的信息)。
下图显示了请求流程:
你的 IDE 或 AI 桌面客户端(Claude、VS Code、Cursor 等)
↓ 工具调用
本地 MCP 服务器(在你的机器上运行)
↓ 经过身份验证的查询
OpenSearch UI 应用程序(与你的数据源连接)
↓ 双响应
你的 IDE ← 文本摘要 + 交互式 MCP App 可视化
你保持完全控制。MCP 服务器在本地运行。你的数据留在你的 AWS 账户中。你的凭证、你的策略、你的域。
标准 MCP 工具调用仅返回文本响应。代理发送一个 JSON-RPC 请求,指定工具名称和参数,服务器返回一个文本结果,代理将其纳入推理。MCP Apps 通过添加第二个响应通道来扩展此模式:一个可视化负载,IDE 将其渲染为交互式小组件,与文本并列显示。
当本地 MCP 服务器收到工具调用时,它使用你配置的 AWS 凭证进行身份验证,并将请求作为 HTTP API 调用转发到你的 OpenSearch UI 应用程序端点。OpenSearch UI 对你的连接数据源执行查询,并返回结构化文本摘要和渲染的可视化产物。支持的数据源包括 OpenSearch 域、无服务器集合和 Amazon Managed Service for Prometheus。MCP 服务器将它们打包成单个 MCP 响应,包含代理的文本内容和 IDE 主机要渲染的可视化内容。
IDE 主机检测到可视化负载,并将其作为交互式小组件渲染在对话线程中。OpenSearch MCP App 通过对你的实际数据执行代码在服务端生成可视化。因此,渲染的输出是确定性的,与你在 OpenSearch 仪表板中看到的内容一致。
为了说明双响应模式在实践中的应用,以追踪调查为例。下面的演练展示当你的代理调用追踪调查 MCP App 工具时会发生什么。
代理发送的内容。你的代理向追踪调查 MCP App 发出工具调用,传递诸如追踪 ID 或服务名称和时间范围等筛选条件等参数。此调用通过标准 MCP 协议从你的 IDE 传输到本地 MCP 服务器。
服务器如何执行它。本地 MCP 服务器接收工具调用,针对你的 AWS 凭证进行身份验证,然后将请求转发到你的 OpenSearch UI 应用程序端点。OpenSearch UI 对你的连接数据源执行追踪查询,检索匹配的跨度,并组装响应。
双响应包含什么。MCP 服务器在单个响应中返回两个输出。文本部分包含结构化摘要,包括追踪 ID、总时长、跨度计数、关键路径以及失败来源的分析。可视化部分包含交互式追踪瀑布图,渲染为 IDE 内的 MCP App,显示跨度层次结构、时序和错误标注。
代理和人类如何各自消费它。从文本摘要中,你的代理提取下一步推理的上下文,例如将失败的跨度与相关日志条目关联。与此同时,你在同一对话线程中看到交互式追踪瀑布图。你可以展开各个跨度、检查属性,并直观地确认根因,无需打开单独的浏览器标签页。
MCP Apps 支持跨生命周期进行可观测性调查,工具可在调查阶段之间链接。
典型的调查从分类和响应工具开始,这些工具呈现活跃告警、跨数据源关联相关告警,并展示严重性细分,以便你的代理可以优先处理问题。在代理识别出受影响的服务后,日志调查工具搜索错误模式并将相似日志条目聚类以隔离失败特征。从那里,追踪调查工具定位特定分布式追踪,显示跨度层次结构和延迟细分,并精确定位失败发生的位置。
为了量化影响,指标调查工具执行 PromQL 查询并进行阈值分析,而服务性能工具提供服务级别的 RED 指标(速率、错误、时长)。拓扑工具将服务地图渲染为依赖图。该图显示跨边缘的调用量和错误率,以便你可以确定影响范围。在整个调查过程中,动态可视化工具根据你指定的查询生成折线图、柱状图、面积图和指标图表,数据集和关联工具支持跨信号连接和数据摘要。
专业工具应对新兴需求。AI 和代理可观测性工具追踪大语言模型(LLM)调用,并为构建自己 AI 工作流的团队渲染代理追踪地图。栈健康工具报告集群状态和分片分配。插桩评分工具检测遥测质量差距,以便团队可以提高其可观测性覆盖率。
图 2:追踪调查 MCP App 在 IDE 内显示跨度层次结构、时间线和失败来源分析
有了 MCP Apps,相同的值班调查现在是这样的。
工程师问代理:"什么导致结账错误激增?"代理通过查询日志、与追踪关联和检查服务地图进行调查。双响应到达,包含文本摘要和交互式可视化(告警视图、追踪瀑布图和服务地图),渲染在同一线程中。工程师通过滚动浏览 MCP App 可视化并选择跨度详情来确认影响范围,在 IDE 内进行内联审查,无需离开 IDE。最后,他们指示代理起草问题摘要或触发修复。
工程师从不离开 IDE。调查、验证和解决在单个对话线程中发生。对于值班工程师,这意味着更快的解决和与 AI 代理协作更简单的体验。
图 3:服务地图 MCP App 显示带有错误率颜色编码和调用量边缘宽度的依赖图
按照以下步骤将你的代理 IDE 连接到 OpenSearch UI 应用程序。
在开始之前,请确认你具备以下条件:
以下过程引导你完成下载服务器、配置 IDE 和验证连接。
下载并准备 MCP 服务器包:
每个支持的 IDE 都有一个 MCP 配置文件。以下列表显示在哪里找到它:
打开 IDE 的配置并添加以下内容:
{
"mcpServers": {
"opensearch-observability-stack-mcp": {
"command": "node",
"args": ["/path/to/opensearch-observability-stack-mcp/server/server.js"],
"env": {
"OS_UI_ENDPOINT": "application-foo-bar.us-west-2.opensearch.amazonaws.com",
"AWS_REGION": "us-west-2",
"AWS_PROFILE": "my-profile"
}
}
}
}
将占位符值替换为你的 OpenSearch UI 端点、AWS 区域和配置文件。
要查找你的 OpenSearch UI 端点:
保存配置后,重启你的 IDE 或重新加载 MCP 服务器列表。然后在你的 IDE 中输入以下提示:
"List available observability data sources"
如果代理返回你的连接数据源(Amazon OpenSearch Service 域、无服务器集合或 Amazon Managed Service for Prometheus 工作区),则 MCP 服务器配置正确。
如果收到错误,请检查你的 AWS 凭证是否处于活跃状态,以及你的 AWS Identity and Access Management(IAM)策略是否为你的 OpenSearch UI 应用程序 ARN 包含了 es:ESHttpGet 和 es:ESHttpPost 操作。
提示:要在没有生产数据的情况下进行测试,请部署 OpenTelemetry Demo 应用程序以在你的 Amazon OpenSearch Service 域中生成示例追踪、日志和指标。
要移除 MCP 服务器配置,请打开 IDE 的 MCP 设置并删除 opensearch-observability-stack-mcp 条目。然后从本地机器上删除解压后的 MCP 服务器目录。此设置不配置任何云资源,因此不需要 AWS 端清理。
下表总结了 MCP Apps 如何改变值班工作流程:
有了 MCP Apps,Amazon OpenSearch Service 填补了代理可观测性中的验证差距。你的 AI 代理进行调查,交互式证明到达同一线程:无需上下文切换、无需单独登录、无需重新运行查询。对于值班工程师,这意味着更快的解决。对于在当地运行代理可观测性的组织,这在不牺牲准确性的情况下提供了你想要的运营简单性。
立即开始:有关设置说明,请参阅 Amazon OpenSearch Service 开发者指南中的使用 MCP Apps 实现代理可观测性。