针对 AI 抓取场景的网页净化工具 Fit-Markdown,去除导航栏、Cookie横幅等噪音,200站测试token从11400降至1320,支持按量付费加密货币付款绕过Stripe门槛。
将实时网页内容注入 LLM(如 Claude 3.5、Cursor AI 或本地 DeepSeek/Llama 模型)已成为现代 AI Agent 和 RAG 管线的核心需求。
然而,任何构建过生产级网页抓取管线的人都知道两大痛点:
Token 膨胀:一篇 1000 词的博客文章在转换为标准 Markdown 时通常会膨胀到 12000+ tokens,原因是导航菜单、页眉链接、Cookie 同意横幅和追踪脚本。
昂贵的付费墙与支付限制:大多数商业抓取 API 要求西方信用卡(Stripe)并强制设置每月 99 美元的最低订阅档位,将独立开发者和只想按需付费的团队拒之门外。
为了解决这个问题,我们构建了 FlyCrawl——一款超快的、编译型 Web-to-Markdown 抓取工具和深度爬虫引擎,专为 AI 场景设计。
📉 Fit-Markdown 如何削减 88% 的 LLM Token 账单
不同于通用的 HTML 转文本转换器,FlyCrawl 实现了 Fit-Markdown:一种启发式 DOM 分析器,在生成 Markdown 前剔除非语义性的冗余内容。
我们对 200 个不同网站进行了基准测试,对比原始 HTML、标准 Markdown 和 FlyCrawl:
原始 HTML 平均:约 11400 tokens 标准 Markdown:约 6200 tokens FlyCrawl Fit-Markdown:约 1320 tokens(降低 88.4% 的 token 消耗)
向量检索召回率也随之提升,因为 Embedding 不会被页脚冗余内容和导航栏稀释。
💻 60 秒快速开始:在项目中使用 FlyCrawl
FlyCrawl 已正式发布在 npm 上,作为独立的 Model Context Protocol (MCP) 服务器:
npx -y flycrawl-mcp
在 Cursor(设置 -> 功能 -> MCP 服务器)或 Claude Desktop(claude_desktop_config.json)中:
{
"mcpServers": {
"flycrawl": {
"command": "npx",
"args": ["-y", "flycrawl-mcp"],
"env": {
"FLYCRAWL_API_KEY": "YOUR_FLYCRAWL_API_KEY"
}
}
}
}
现在 Claude 或 Cursor 可以直接抓取和搜索实时网页,无需担心 token 膨胀!
2. 官方 Python SDK(即插即用 Firecrawl 兼容)
如果你已有 Firecrawl 的代码,FlyCrawl 的 Python 库 100% API 兼容:
pip install flycrawl
from flycrawl import FlyCrawl
client = FlyCrawl(api_key="fc_live_YOUR_API_KEY")
# 将页面抓取为干净的、LLM 可用的 Markdown
result = client.scrape({
"url": "https://news.ycombinator.com",
"formats": ["markdown"],
"onlyMainContent": True
})
print(result.markdown)
🪙 自主加密货币支付(无需每月 99 美元锁死)
无需信用卡。用 USDT(TRC-20)或 TON 充值至少 5 美元即可,链上确认即时到账。纯按量计费,每抓取一页仅需 0.0019 美元。
🎁 免费 Playground
你可以在我们的在线 Playground 无需创建账号直接测试任何 URL:👉 https://flycrawl.net
注册即送 100 免费积分,你可以用它测试边缘情况网站、动态 JavaScript 渲染和反爬虫挑战。
欢迎测试有难度的 URL,并在评论区留下你的基准测试反馈!