PixelRAG 将网页、PDF、图片渲染为截图后直接给模型,避免 HTML 解析破坏表格和图表布局,保持原始视觉结构检索。对需要处理数据文档的工程师有直接提效价值。
PixelRAG 是一个视觉 RAG 工具,它将网页、PDF 和图片视为截图来对待——保留表格和图表的布局,让你能够原汁原味地搜索和引用。
这篇文章涵盖:如何将它作为插件安装、实际用法、它与传统文本 RAG 的区别,以及你可能会踩到的坑——全部站在 Claude Code 用户的视角。
PixelRAG 将文档——网页、PDF、图片——渲染为截图,然后将这些图片直接喂给模型。HTML 解析通常会破坏的那些视觉结构——表格、图表、布局、信息图——得以完整保留,模型也就能真正回答关于它们的问题。
PixelRAG 是一个围绕"视觉检索增强生成"(Visual Retrieval-Augmented Generation)构建的开源项目,由 5 个组件组成:
现在这些都打包进了单个 pixelrag 包,一行 pip install pixelrag 即可安装。作为 Claude Code 用户,你第一个真正接触到的是 pixelshot 命令(由 pixelrag-render 提供)以及将它接入 Claude Code 的 "pixelbrowse" 插件。
flowchart LR
A[URL / PDF] --> B["pixelshot<br/>(generates image tiles)"]
B --> C["tile_0000.jpg ..."]
C --> D["Claude Code's Read tool"]
D --> E["Claude understands it visually"]
C -.->|optional| F[pixelrag-embed / index]
F --> G[FAISS index]
G --> H[pixelrag-serve search API]
传统文本 RAG 在处理以下内容时往往力不从心:
安装很简单:要么 clone 仓库本地运行,要么通过 marketplace 添加插件。
前置条件:
注意:仓库的 pyproject.toml 包含 environments = ["sys_platform == 'linux'"],意味着 GPU 相关的部分(embed/serve/train)假设在 Linux 上运行。如果你只使用截图功能(pixelshot),这应该问题不大,但在 Mac/Windows 上通过 WSL 运行更稳妥。
成本说明:pixelshot 截图功能只是在本地运行 Playwright/Chromium,不会产生额外费用(除了你正常的 Claude Code token 消耗)。不过,使用 embed/serve/train 构建自己的索引需要 GPU,如果用云端 GPU,就要单独为此付费。
官方插件安装脚本如下:
#!/bin/bash
# One-liner that installs pixelrag and registers it as a Claude Code plugin
set -e
# Install pixelrag into an isolated environment via uv
uv tool install --from "$REPO_DIR" pixelrag 2>/dev/null || \
uv tool upgrade --from "$REPO_DIR" pixelrag
# Install Chromium for screenshots
uvx playwright install chromium 2>/dev/null || true
git clone https://github.com/StarTrail-org/PixelRAG.git
cd PixelRAG
./plugin/setup.sh
claude --plugin-dir ./plugin
pip install pixelrag # installs the pixelshot command
claude plugin marketplace add StarTrail-org/PixelRAG
claude plugin install pixelbrowse@pixelrag-plugins
插件安装好后,Claude 就准备好了——通过 Bash 调用 pixelshot,然后用 Read 工具读取生成的图片。
安装完成后,你只需在普通对话中传入一个 URL 就能工作。
claude -p "Look at https://news.ycombinator.com and summarize the top stories"
在交互式会话中,你也可以使用斜杠命令:
claude --plugin-dir ./plugin
# inside the session
/screenshot https://example.com
底层实现中,Claude 通过 Bash 运行类似以下的 pixelshot 命令:
# Screenshot a URL (tile height optimized to 1568px for Claude's vision model)
pixelshot https://example.com --output /tmp/pixelbrowse --tile-height 1568 --wait-network-idle
# Process multiple URLs in parallel
pixelshot url1 url2 --output /tmp/pixelbrowse --tile-height 1568 --wait-network-idle --workers 4
# Render a PDF
pixelshot document.pdf --output /tmp/pixelbrowse
输出文件保存在类似 /tmp/pixelbrowse/<domain>.png.tiles/tile_0000.jpg 的路径下,Claude 把它作为图片读入来理解内容。
以下注意事项直接来自官方 SKILL.md,在实践中很重要。
忘记加 --wait-network-idle 会得到空白页 如果跳过这个 flag,通过 JavaScript 渲染的网站会在加载完成前就被捕获,导致截图是空的。面向 URL 时务必带上它。
坚持使用默认的 --tile-height 1568px Claude 的视觉模型会将长边超过 1568px 的图片(Sonnet/Haiku)或 2576px(Opus)降采样后再处理。如果保持默认的 8192px,文字会被压缩到无法阅读。
如果文字太小看不清,就裁剪后重新读取 官方工作流是用 Pillow 裁剪相关区域,再通过 Read 工具重新喂入。
PixelRAG 专攻的正是传统文本 RAG 的短板:保留表格、图表和布局地搜索文档。
将它接入 Claude Code 完全不需要 MCP 服务器——只是一个纯 skill 的配置方案,归结为一个 pixelshot 命令。在生产环境使用前,请查看官方仓库的最新状态。
官方仓库:https://github.com/StarTrail-org/PixelRAG
官方网站:https://pixelrag.ai
插件专用 README:https://github.com/StarTrail-org/PixelRAG/blob/main/plugin/README.md
📌 本文反映的是 2026 年 8 月的信息。由于 Claude Code 更新频繁,请查看官方文档获取最新详情。
本文在 AI 辅助下编辑。*最初发表于 EdgeHUB 日语版。