mcp-vision-bridge 可在本地把截图交给已有多模态模型解析,再将文字描述返回给纯文本编程智能体。它仅提供 analyze_image 工具,兼容 Claude Code、Codex、Cursor 等 MCP 客户端,并支持直接传入图片路径。
DeepSeek V4 Flash 写代码很出色。但它看不到你刚刚粘贴的错误对话框、出现故障的 UI,也看不到渲染 bug 的截图。它只会回复:“我看不到图片。”于是你又得手动把错误信息敲出来。
mcp-vision-bridge 解决了这个问题。它是一个轻量级 MCP server,通过把图片转发给你可能已经付费使用的多模态模型——mimo、Claude、Gemini、GPT-4o、Qwen-VL——让任何纯文本 coding Agent 都能拥有视觉能力。它只提供一个工具:analyze_image。
You (paste a screenshot of an error dialog)
↓
Agent (text-only, calls analyze_image)
↓
mcp-vision-bridge (forwards the image bytes)
↓
Your vision model (mimo / Claude / Gemini / GPT-4o)
↓
Agent now reasons over a full text description
图片绝不会进入 Agent 的上下文。bridge 读取像素,由你的视觉模型负责识别,再将文本结果返回。
市面上有很多所谓的“MCP vision”server,但其中大多数都要求你自己托管一个与之通信的 server。这个工具完全在本地运行,只需一条命令,零配置:
适用于所有 Agent——Claude Code、Codex、opencode、Kimi、PI、Cursor、Reasonix。一个 server,支持任意 MCP client。
粘贴或拖放皆可。将图片文件拖进聊天窗口 → prompt 中会出现真实文件路径 → analyze_image 读取该文件。不依赖剪贴板,也没有各种粘贴兼容问题。
自动发现。image="recent" / image="session" 可以找到你在 Claude Code、Codex、opencode、Cowork、Reasonix 和 Grok 中粘贴的图片——无须手动输入路径。
一次调用处理多张图片。粘贴 3 张截图,只需提出一个问题。hook 会读取当前 session transcript,把所有图片放在一次请求中传给模型,并为每张图片分别分配 token 预算。
仅限当前 session。recent/session 绝不会泄露其他 session 中的图片,因此既能保护隐私,也能安全支持并行使用。
自动更新。每次 server 启动时,skill 和 hook 都会自动同步到 ~/.claude/,因此 npx -y mcp-vision-bridge 始终运行最新版本。
Claude Code(plugin,一条命令):
claude plugin marketplace add KuaaMU/agent-plugins
claude plugin install mcp-vision-bridge
其他 Agent(Codex、opencode、Kimi、PI……):
git clone https://github.com/KuaaMU/mcp-vision-bridge && cd mcp-vision-bridge
./install.sh # auto-detects your agent
手动配置(适用于任意 MCP client):
{
"command": "npx",
"args": ["-y", "mcp-vision-bridge"],
"env": {
"VISION_OPENAI_BASE_URL": "https://your-endpoint/v1",
"VISION_OPENAI_API_KEY": "sk-your-key",
"VISION_MODEL": "your-vision-model"
}
}
需要 Node.js ≥ 18。
安装完成后,重启你的 Agent。
将图片文件拖进聊天窗口(也可以在 Claude Code / Cowork 中使用 Ctrl+V)。
然后说“看看这个” / “analyze this” / “what's the error?”。
你的 Agent 会调用 analyze_image,并获得一份可用于调试的详细文本描述,包括逐字文本、布局、颜色和异常之处。
粘贴了多张图片?hook 会在当前 session transcript 中检测到它们,并引导 Agent 调用 analyze_image(image="session")——一次调用,处理全部图片。
analyze_image(image, prompt, task, detail, save_to) 接受路径、URL、"clipboard"、"recent"、"session" 或数组。task 预设(describe | ocr | ui | layout | qa)本质上是发送给视觉模型的 prompt——工具没有内置 OCR engine;读取工作由模型完成。将用户的实际问题作为 prompt 传入,模型就会回答你真正提出的问题。
它不是视觉模型——只是把请求转发给你已经付费使用的模型。
它不是 OCR engine——只是请求多模态模型读取图片。
它不是云服务——它在本地运行;你的密钥和图片都会留在自己的机器上。
采用 MIT 许可证。npm:mcp-vision-bridge。源代码:github.com/KuaaMU/mcp-vision-bridge ⭐ 如果它能让你少手动抄写一次错误对话框,点一颗 star 就能帮助这个项目继续维护下去。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。