实测Claude直接爬取5大零售商成功率为0,接入Apify MCP后达100%;详解连接配置与Product Data for AI Agents实操。
让 Claude 或 ChatGPT 去查一个随机电商网站上的商品价格,它要么会拒绝(无法浏览网页),要么从过时的训练数据里瞎猜。即使是有浏览能力的 AI 助手,实际能查到结果的情况也远比预期少:Apify 自己的测试发现,Claude 直接浏览五大零售商网站,从 100 个商品中只拉取到 0 个——而接上 Apify 的 MCP server 后,变成了 100 个全中。同样的模型,同样的问题,结果却完全不同——因为瓶颈从来不是模型的推理能力,而是缺少一种可靠的方式来读取商品页面。
本指南展示完整的配置步骤:将 Claude Desktop 连接到 Apify 的 MCP server,然后通过它获取干净、结构化的商品数据——包括一个使用专门为此构建的 actor 的真实示例(Product Data for AI Shopping Agents)。
MCP(Model Context Protocol)是一个标准,允许 AI 模型在对话过程中调用外部工具——不仅仅是生成文本,而是真正获取实时数据或执行操作。Apify 运营着一个 MCP server,将其整个 Store(70,000+ actors——爬虫、提取器、自动化工具)都暴露为可调用的工具。连接后,Claude 可以搜索到合适的工具、用真实输入调用它,并在对话中获取真实输出。
打开 Claude Desktop 的配置文件(claude_desktop_config.json),添加以下配置之一:
远程,OAuth(推荐——无需管理 token):
{
"mcpServers": {
"apify": {
"url": "https://mcp.apify.com"
}
}
}
首次连接会打开浏览器进行 Apify 登录和授权,无需其他配置。
远程,带 token(如果你不想走 OAuth 流程):
{
"mcpServers": {
"apify": {
"url": "https://mcp.apify.com",
"headers": {
"Authorization": "Bearer <YOUR_APIFY_TOKEN>"
}
}
}
}
Token 可从 Apify Console → Settings → API & Integrations 获取。
本地(stdio),如果你希望运行在自己的机器上而不是 Apify 的远程端点:
{
"mcpServers": {
"apify": {
"command": "npx",
"args": ["-y", "@apify/actors-mcp-server"],
"env": {
"APIFY_TOKEN": "YOUR_APIFY_TOKEN"
}
}
}
}
重启 Claude Desktop。现在你应该能看到 Apify 的工具可用——search-actors、call-actor、get-dataset-items 等。
ChatGPT 通过 Developer Mode 而不是配置文件来连接 MCP server。完整的读写访问权限(call-actor 需要,因为运行 actor 是一种写操作)在 Business、Enterprise 和 Edu 计划中可用;Pro 在 developer mode 下只有读/获取权限。Plus 和 Free 目前不支持自定义连接器。
如果你使用的是支持的计划:
Settings → Apps → Advanced Settings → 开启 Developer Mode。
Settings → Apps → Create → 添加一个新的连接器。
粘贴服务器 URL:https://mcp.apify.com,设置认证(OAuth 最简单——与 Claude 相同的流程)。
点击 Scan Tools,等待索引 Apify 的工具列表。
在新对话中,点击工具图标,选择 Apify 连接器,然后像在 Claude 中一样提问——或者在对话中 @提及它当你需要新的调用时。
连接器扫描完成后,以下所有内容——call-actor 的输入、输出结构、定价——都是相同的。
你不需要记住 actor 的确切名称——只需自然地向 Claude 提问,它会使用 search-actors 来找到合适的:
"Search Apify for an actor that turns e-commerce product pages into structured data for AI agents."
或者直接跳过搜索,用 call-actor 按名称调用 actor:
{
"actor": "dynamict3ch/product-data-for-ai-shopping-agents",
"input": {
"startUrls": [
{ "url": "https://mejuri.com/ca/en/products/bia-mini-hoops" }
],
"maxRequestsPerCrawl": 10
}
}
这次调用返回的真实输出:
{
"id": "p134860210",
"name": "18k Gold Vermeil / Lab Grown White Sapphire",
"brand": "Mejuri",
"price": 168,
"currency": "CAD",
"availability": "InStock",
"rating": 4.6,
"reviewCount": 29,
"url": "https://mejuri.com/ca/en/products/bia-mini-hoops",
"imageUrl": "https://cdn.shopify.com/...",
"description": null,
"embeddingText": "18k Gold Vermeil / Lab Grown White Sapphire — Mejuri",
"source": "json-ld",
"scrapedAt": "2026-09-11T04:01:52.791Z"
}
无论 URL 指向哪家商店,返回的数据结构始终一致——包含 name、brand、price、currency、stock status、rating,以及 source URL,每个字段都明确存在(或明确为 null),而不是出现缺失的键让你需要做防护判断。
连接后,你不必一次只调用一次。真实的 prompt 可能像这样:
"Here are three ring product URLs. Get the current price and rating for each, and tell me which one has the best rating-to-price ratio."
Claude 对每个 URL 调用一次 actor(或者在一个 startUrls 列表中批量处理),获取结构化的记录,然后基于真实数据而非它半记不牢的商品描述来推理。
大多数电商网站会嵌入 schema.org/JSON-LD 商品标记给 Google 的爬虫用——这个 actor 首先读取那种结构化数据,只有在 JSON-LD 不存在时才回退到 Open Graph 标签。这就是区别:Agent 解析一百种不同的 HTML 布局(每次重新设计都会坏掉)vs. Agent 读取网站已经以机器可读格式发布的数据。
按次计费:按返回的商品记录数收费,而非按页面抓取数。大约每个商品 $0.01——100 个商品的批次大约花费一美元。
Product Data for AI Shopping Agents on Apify Store
Sources: Apify — Real-time product data for AI agents, Apify MCP server documentation