前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8336
  • Cognition 发布 SWE-2:低成本对标 Fable 5.1 的代码模型
  • 边缘 AI 部署:LLM 优化最佳实践
  • 边缘设备 LLM 扩展:完整技术指南
  • VS Code 1.137:AI 自动化、语音模式与 GitHub 深度集成
  • Real-SWE:基于私有企业代码库的 AI 模型基准测试
  • OpenResearch:本地优先的多 Agent 研究工作台
  • Check:给 Claude Code 加幻觉防护层
  • Postman 集合一键转为 MCP 工具:实操路径
  • NestJS 测试覆盖提升与安全加固实战
  • Next.js Serverless 下 PDFKit 字体缺失修复
  • 评测编码Agent前,先用同一组任务跑两遍
  • LLM Wiki:文档自动构建可维护知识库的开源桌面应用
  • 深入解析结构化输出:让 AI 生成绝对可解析的 JSON
  • MCP安全核心是权限体系重设计,而非传统边界防护
  • GPT-6 Astra 在机器人基准测试中展现空间推理飞跃
  • Auterix:零依赖通用协议,跨 21 个 AI 工具统一上下文规范
  • 后量子 TLS 是平台迁移工程,不是密码学研究
  • Anthropic 发布 AI-Native SDLC 实践手册:代码不再是瓶颈
  • OpenAI 建议 GPT-6 Astra 提示词应精简,减少安全限制
  • Claude Code 创始人:AI 编程要守住代码质量标准
  • Hyperresearch:Agent 驱动的研究知识库,单次跑 250+ 信源
  • 12 个已落地的 B2B 营收 AI Agent 用例,附代码
  • LLM 项目上线后才会暴露的 6 个隐蔽 Bug
  • OpenAI 代理向 RubyGems 上传两千恶意包
  • AI 时代缓存失效难题复发:LLM 推理的隐性成本
  • Google发布TimesFM-3:单次前向传播即可完成多步时间序列预测
  • 阿里 Qoder CLI 开放自定义模型接入
  • 开源项目 Minitap 指控谷歌盗用代码用于 Artemis,许可证违规引热议
  • GPT-6 Astra 刷穿 FrontierMath Tier 4,AI 数学能力达新里程碑
  • Kimi K2.8发布:性能逼近K3百万上下文全员开放
  • DeepSeek v4.1-Flash发布:763B参数新型因果编解码架构
  • AI Agent 何时该停:成本控制的核心工程问题
  • 三大AI编程工具实战对比:Claude Code六个月生产级使用报告
  • Trail of Bits开源Coop:用隔离VM安全运行Claude Code和Codex
  • OpenAI代理今年5月攻击RubyGems详情披露
  • Google Tunix:TPU上的自主LLM后训练框架
  • GitLab CVE-2026-85706:CVSS 10.0 路径遍历漏洞正被主动利用
  • RAG 检索失效的根源:分块策略正在毁掉你的 AI 应用
  • CPython 字节码缓存导致测试失效的隐藏bug
  • OpenAI代理攻击RubyGems:技术细节与行业反思
  • Anthropic 内部调查:七成公司无法衡量 AI 工具实际回报
  • OpenRouter 隐性陷阱:同一端点行为不一致
  • 字节Seed研究:LLM自建测试harness泛化性堪忧,仅34%有效
  • GitHub Copilot支持查看VS Code Agents使用量指标
  • OpenAI正式开放Agents API:日烧7千美元研发现已公测
  • Anthropic 为 Claude Code 推出插件评测工作流,含 6 种评分器与无插件基准线
  • 一招配置:让 Claude Code、Cursor、Cline 等主流 AI 编程工具共用同一个国产模型端点
  • 我用 Claude Code 搭 AI 团队,抓到它给自己打高分
  • 律师因AI幻觉证人被罚5000美元
  • AI 搜索引擎如何理解网站:RAG 到引用的技术链路
  • 幂等性:防止大问题的 API 小概念
  • 已加载 51 / 8336
8.0
热点
AI SCORE
编程提效2026-09-12 20:05

Hyperresearch:Agent 驱动的研究知识库,单次跑 250+ 信源

GitHub Trending#Agent#深度研究#Claude
Editor brief · 编辑速览

将 Claude Code 变成深度研究 Agent,在 DeepResearch-Bench 基准领先,单次运行覆盖 250+ 信源并对每条引用做审计验证。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

强大的深度研究工具

PyPI 版本

Python 3.11+

许可协议:MIT

GitHub stars

Hyperresearch 将 Claude Code 转变为深度研究智能体:它目前在 DeepResearch-Bench RACE 排行榜上领先(内部基准测试)。一个自适应的 16 步流水线,只需一个提示词即可生成经过对抗性审计的完整来源溯源报告。所有读取的来源都会进入一个持久化、可搜索的知识库,因此每次会话都比上一次更智能。

DeepResearch-Bench 前五名——hyperresearch 领先于 Grep Deep Research、Cellcog Max、nvidia-aiq、 Gemini Deep Research 和 OpenAI Deep Research

来源于对 DeepResearch-Bench 排行榜快照的分层对照实验的前瞻性推算(https://huggingface.co/spaces/muset-ai/DeepResearch-Bench-Leaderboard)。第三方验证正在进行中。

单次运行覆盖 250+ 来源。顶级规模配置仅在宽度扫描阶段就针对 100–130 个来源;引用追踪和缺口填补获取的来源会超过实际进入语料库数量的两倍以上。

每条引用在报告发布前都经过核实。一个怀疑论的引用检查器会审计每条被引用的来源是否真正支撑其所在句子。虚构的引文和未声明的撤回会被硬性拦截在关卡。

转载不等于共识。独立性审计会聚类衍生副本,因此五份同一新闻稿的转载只具有一个来源的权重。

设计即对抗。每份草稿由四名批评者并行攻击,工具锁定的修补器只能进行精确的编辑。它在物理上无法重写报告。

八个学术来源,一个查询。hpr scholar search 通过单一客户端层对接 OpenAlex、Crossref、CORE、DOAB、ClinicalTrials.gov、SEC EDGAR 和 FRED,返回按 DOI 和标题去重后的统一列表。图书、试验和文件与论文一同返回,每条都带有标签,以便流水线知晓如何处理。人文社科被特意覆盖,而非事后想起。

付费论文会被完整阅读,而非略读。付费论文通常只以 1500 字符的摘要形式进入知识库,然后报告像已阅读全文一样引用它。Hyperresearch 向 Unpaywall、Europe PMC 和 CORE 请求合法的开放获取副本,并存储全文,即使出版商直接阻止了获取。每次替换都会在笔记、前言和 CLI 输出中声明。

没有任何东西被丢弃。每个来源都进入一个可搜索的 markdown 加 SQLite 知识库,你的下一个会话在获取任何新内容之前就会复用它。

崩溃的运行可以恢复。每次运行都保留一份清单;运行恢复从它中断的确切步骤继续。

从 30 分钟到学位论文均可扩展。有界查询自动路由到 5 步快速路径。选择性加入的学位论文运行会撰写跨越多个章节的 25K–80K 词,从 300–450 个来源中生成。

cd your-project
pip install hyperresearch && hyperresearch install

然后在 Claude Code 中使用 /hyperresearch <任意内容>。

Python 3.11–3.13。(3.14 尚未支持。使用 pyenv install 3.13、uv venv -p 3.13 或 py -3.13 -m venv .venv。)

高级用户:hyperresearch install --global 使 /hyperresearch 在任何 Claude Code 会话中均可访问,代价是每个会话的系统提醒会增加约 15 行。按项目安装(上文)可保持无关的 CC 会话整洁。

16 步研究流水线

入口技能是一个轻量路由器。它锁定规范的研究查询,然后通过 Claude Code 的 Skill 工具每阶段调用一个步骤技能。每个步骤的规程只在实际运行该步骤时才加载到上下文中。这就是阻止长流水线因上下文腐化而静默丢弃步骤的机制。

层级和档位:两个规模杠杆

层级按查询路由。第 1 步自动分类为轻量或完整。学位论文是选择性加入的;在提示词中明确要求。

档位设置标准流水线的规模:来源目标、深度预算和词汇目标被渲染到各步骤技能中。

hyperresearch profile list           # 所有配置 + 描述 + 当前档位
hyperresearch profile use premier   # 100–130 个来源,加倍的深度预算(约 3–5 小时)
hyperresearch profile use full       # 回到 55–80 来源的基线

档位按项目持久化,重装后仍然保留。自定义档位:在 .hyperresearch/config.toml 中定义 [profile.<name>](任何参数:来源目标、基因座上限、草稿数量、词汇目标、按智能体划分的模型),然后使用 profile use <name>。

运行杠杆:报告的文风设置

层级和档位决定工作量的大小。杠杆决定产出何种报告,而第 1 步从提示词的动词形式中选取它们。提示词中的明确指令始终优先。

杠杆被渲染为角色作用域的垫片文件,生成模板原字贴入子智能体提示词,因此批评者随语域移动,而非抵消它。在调查语域中,辩证批评者标记不公平的表述而非缺失的承诺,润色审计者停止删除修饰词。在倡导者语域中,所有批评者都收紧标准。

引用检查器和发布关卡完全不接收垫片。核实永远不会因模式而软化。

hyperresearch levers set <tag> inference_depth=deep --rerender   # 中途深入
hyperresearch run status -j                                      # 查看第 1 步选择了什么

两个承载原则

修补,从不重生成。第 11 步产出综合报告后(或轻量层级的第 10 步),唯一的修改都是精确的 Edit 块。修补器和润色审计者在 Claude Code 白名单级别被工具锁定为 [Read, Edit],因此它们在物理上无法 Write 新草稿。每个块的硬性上限使「直接重写」在机械上不可能。无法纳入小块的批评发现会升级为结构性问题。

修补,从不重生成。第 11 步产出综合报告后(或轻量层级的第 10 步),唯一的修改都是精确的 Edit 块。修补器和润色审计者在 Claude Code 白名单级别被工具锁定为 [Read, Edit],因此它们在物理上无法 Write 新草稿。每个块的硬性上限使「直接重写」在机械上不可能。无法纳入小块的批评发现会升级为结构性问题。

规范研究查询是教义。用户提示词的原文被持久化到 research/runs/<vault_tag>/query.md 一次,随后每个步骤和每个生成的子智能体都会重新读取它。包装要求(保存路径、引用格式、结尾章节)是另一份契约。

规范研究查询是教义。用户提示词的原文被持久化到 research/runs/<vault_tag>/query.md 一次,随后每个步骤和每个生成的子智能体都会重新读取它。包装要求(保存路径、引用格式、结尾章节)是另一份契约。

模型是配置而非硬编码。表格展示的是出厂默认,你可以在 .hyperresearch/config.toml 中覆盖任何一项:在 [profile.full] 中设置 models = { fetcher = "haiku" } 会在下次安装或 profile use 时将所有 fetcher 交换为 Haiku。

知识库:持久化、可搜索、累积

大多数深度研究工具都是一次性的:报告输出,其他一切丢弃。Hyperresearch 保留它读取的所有内容。每个获取的来源都进入一个 SQLite 索引的知识库,未来的会话在获取新内容之前先搜索它。

hyperresearch search "ion-trap gate fidelity" -j           # 全文搜索
hyperresearch search "quantum" --include-body -j           # 含正文的搜索
hyperresearch note show <id1> <id2> <id3> -j               # 批量读取笔记
hyperresearch graph hubs -j                                # 连接度最高的笔记
hyperresearch graph backlinks <id> -j                      # 反向链接
hyperresearch lint -j                                      # 健康检查(失效链接、缺失标签)

Markdown 是真相,SQLite 是缓存。笔记以纯 Markdown 形式存储,带有 YAML frontmatter,位于 research/notes/。SQLite 索引可完全重建:删除它后,hyperresearch sync 会从 Markdown 重新构建。用任何编辑器打开知识库,用 git 做版本控制。无需安装该工具就能读取自己的研究资料。

PDF 直接获取。hyperresearch fetch 自动检测 PDF 链接(arXiv、NBER、SSRN、直链 .pdf)并通过 pymupdf 提取全文。原始 PDF 存放在 research/raw/<note-id>.pdf,笔记的 raw_file: frontmatter 字段做反向链接。

来源血缘追溯。每个获取的来源都带有一个 --suggested-by 链接,指回发现它的来源。这条链条从种子获取开始形成一棵有根树;provenance lint 规则会检测断开的组件。

语义搜索,按需启用。hyperresearch embed sync 填充嵌入向量(提供商可插拔:voyage、openai,或默认的 none,零 API 密钥需求),search --semantic 将向量相似性与全文排名相结合。

笔记的生命周期:整理

每次会话结束前都要经过一轮整理,笔记会经历 draft → review → evergreen 的成长路径,或随着内容老化变为 stale → deprecated → archive。这样才能防止知识库变成一堆半读页面的垃圾场。

hyperresearch note update <id> --summary "..." --add-tag <t> -j   # 晋升草稿
hyperresearch dedup -j                                            # 按内容相似性找出近似重复
hyperresearch topic tree -j                                       # 话题层级结构
hyperresearch index build -j                                      # 重新生成索引页
hyperresearch batch set-status stale --tag <t> -j                 # 批量移动生命周期状态
hyperresearch link --note <id> --dry-run -j                       # 预览 wiki-links 会添加哪些链接

不被锁死

知识库就是一个目录里的 Markdown。以下所有功能都是建立在这个基础之上的便利工具,而非依赖。

hyperresearch export json -o out.json # 每条笔记导出为结构化 JSON
hyperresearch export vault <dir>      # 筛选出的子集导出到另一个目录
hyperresearch import <dir>            # 导入已有的 Markdown 集合
hyperresearch git changed -j          # 有未提交更改的笔记
hyperresearch git log -j              # 最近 commit 触及的笔记
hyperresearch watch                   # 在你自己的编辑器里编辑时自动同步

在 Claude Code 外部使用知识库

一个 MCP 服务器。pip install hyperresearch[mcp],然后 hyperresearch mcp 通过 stdio 通信,Claude Desktop、Cursor 或任何支持 MCP 的工具都能操作同一个知识库。13 个工具:search_notes、read_note、read_many、list_notes、get_backlinks、get_hubs、vault_status、lint_vault、check_source、list_sources、fetch_url、create_note、update_note。

一个本地 Web UI。hyperresearch serve --open 在 8080 端口启动一个标准库 HTTP 服务器,具备笔记浏览、标签页、搜索和交互式链接图。无需构建步骤,也没有 JavaScript 依赖。

来源排名:质量是持久化的,不是凭感觉

每个来源都会累积一个复合 quality_score,由来源类型层级、获取时的实用性、引用权威性(来自 OpenAlex / Semantic Scholar,含撤稿标志)以及知识库的 PageRank 中心度构成:

hyperresearch sources score -j             # 丰富带有 DOI 的笔记:引用、发表场所、撤稿情况
hyperresearch graph rank -j                # 在链接和血缘图上计算 PageRank
hyperresearch search "q" --ranked -j       # 质量加权全文搜索
hyperresearch sources independence -j      # 将同源/派生副本聚类:5 份同一新闻稿 = 1 票
hyperresearch claims search "q" -j         # 在所有来源中查询提取出的论断

撤稿来源的质量分会地板到近零,并且在发布前会进行一次撤稿扫描,逐个重新检查每个被引用的 DOI——因此昨天发表的撤稿今天就能被发现。甚至对旧运行中复用过来的知识库来源也有效。

运行:可恢复、有预算、可验证

每次运行拥有独立的workspace(research/runs/<vault_tag>/)和一份清单。并发运行永不相撞,崩溃的运行精确地从中断处恢复:

hyperresearch run status -j          # 逐步骤状态、支出、升级队列深度
hyperresearch run resume -j          # 精确的下一步 + Skill 调用以继续
hyperresearch run report -j          # 每步 wall-time / 支出 / 来源产出遥测
hyperresearch run verify <tag> -j    # 发布门禁:标题、长度、引用密度、引用核查分辨率

run init --budget 50 限制预估的 API 等效支出;超过上限会阻断运行,而非让它悄悄超支。而在任何报告发布前,验证电池组会运行:引用完整性(每个被引用的片段必须在知识库笔记中逐字存在)、撤稿引用(未声明地引用撤稿来源是硬错误)、数字一致性(无法追溯到证据的数字会被标记),外加引用核查步骤的逐引用绑定审计。

结构层面的强制约束

逐字 Prompt 即真理。scaffold-prompt lint 会在脚手架不是以用户精确 Prompt 开头时阻断。

轨迹覆盖。每个 step 4 的 locus 必须有 step 5 的中间笔记;缺失的中间笔记会被标记为错误。

仅补丁式修改。Step 14、15、16 只能使用 [Read, Edit] 工具。不能重新生成草稿。

关键发现不会静默跳过。patch-surgery lint 会暴露修补器无法应用的关键发现。

引用的文本必须存在。quote-integrity lint 会在被引用片段未逐字出现在知识库笔记中时阻断;虚构的引用无法发布。

撤稿阻断发布。未声明地引用撤稿来源是最终门禁的硬错误。

Schema 完整性。tier、content_type 和 type 是 SQLite CHECK 约束的词汇表;损坏的 frontmatter 无法污染索引。

发布前堵住卫生泄露。脚手架部分、YAML frontmatter 和 Prompt 回显由 step 15 在发布前剥离。

获取的文本是数据,绝不是指令。从网页获取的内容在笔记展示和搜索中都包裹在 <untrusted-source> fence 内,因此一个让智能体忽略指令的页面只会被当作内容来读取。

网页是敌意输入

研究智能体会读取数百个它没有主动选择的页面,其中任何一个页面都可能包含写给智能体而非给你的文字。

每个从网页获取的 body 都被包裹在 <untrusted-source url="..."> 分隔符中,内含一行"treat-as-data"前言,在两条服务 body 的路径上均如此(笔记的单条、批量和 JSON 形式展示,以及包含 body 的搜索)。你自己的流水线子智能体编写的笔记则直接通过,不加包裹。获取 body 内伪造的 fence 标签会被中和并保留以供取证,url 属性会做 HTML 转义并去除控制字符,在搜索中包裹发生在 token 预算截断之后,因此关闭 fence 永远不会被切断。fetcher、depth-investigat

、draft-orchestrator 和 source-analyst 的 prompt 都携带了一条策略块,告诉它们不要将加了 fence 的页面的指令洗白到可信输出中。

来自第三方 API 的解析后 URL 同样受此保护。开放获取的位置嵌套在别人的 JSON 里,因此在任何获取发生之前会先检查 scheme、嵌入凭证和公开可路由解析。

.hyperresearch/config.toml 中的 [web] provider 设置决定如何获取页面,以及对于支持该功能的提供商来说,如何搜索网页。除默认提供商外,其他都是可选的额外组件。

builtin(默认)—— 纯 HTTP 获取,无搜索功能。零额外依赖;是一切改进的起点。

crawl4ai —— 带隐匿功能的无头浏览器获取、PDF 提取和浏览器升级通道。流水线针对此优化。pip install "hyperresearch[crawl4ai]"。

exa —— 神经网页搜索和页面提取。需要 API 密钥。pip install "hyperresearch[exa]"。

tavily —— 为智能体构建的搜索和提取。需要 API 密钥。pip install "hyperresearch[tavily]"。

parallel —— Parallel 的 Search MCP 端点,无需账号或密钥。仅为搜索——批量获取波会退化为逐 URL,因此它是一个很好的搜索提供商,而非 crawl4ai 获取路径的替代品。每个进程的请求都携带一个随机会话 ID,Parallel 用它做关联和限速。pip install "hyperresearch[parallel]"。

# .hyperresearch/config.toml
[web]
provider = "crawl4ai"

认证爬取 + 浏览器通道

从 LinkedIn、Twitter、付费站或任何可以登录的网站获取:

hyperresearch setup       # 浏览器打开。登录你的网站。完成。

LinkedIn、Twitter、Facebook、Instagram 和 TikTok 会自动使用可见浏览器以避免会话被杀。

被阻止的请求会升级而非直接失败。当无头爬虫在运行中遇到登录墙或机器人墙时,URL 会被加入升级队列(hyperresearch escalation list -j)。如果你安装了 Claude-in-Chrome 扩展,浏览器获取代理会通过控制你真实的、已登录的 Chrome 来清空队列。硬性边界:CAPTCHA、2FA 和登录永远不会被自动解决。它们会被合并成一条消息交给你处理。

学术发现:八个来源,一次查询,一个去重列表

对于任何有研究文献的主题,先搜索学术来源,再进行网络搜索。它们返回按引用排序的权威著作;网络搜索返回的是衍生评论。这条建议过去是以 URL 模板列表的形式提供,依赖 agent 手动组装——没有重试、没有速率限制、没有去重、没有测试。现在它是一个真正的客户端层:

hpr scholar search "Byzantine iconoclasm" -j                # every available source, merged
hpr scholar search "GLP-1 cardiovascular outcomes" --scope papers -j
hpr scholar search "credit default swaps" -s edgar -s fred -j
hpr scholar sources                                          # what is wired, what each covers

一次调用查询所有配置的来源,合并相同作品的记录(首先按 DOI,其次按规范化标题和年份),返回一个列表。被两个提供者发现的作品在 also_in 中同时携带两方信息,引用次数取较高的那个,摘要取较长的那个。每个提供者共享一个缓存、一个按主机礼貌速率限制器,和一个统一的结果格式。

文献来源:

OpenAlex — 覆盖约 2.5 亿条跨学科作品,包括图书、书籍章节和学位论文。在 STEM 以外的领域是正确默认值,那里的竞品工具最为薄弱。

Crossref — DOI 注册表本身。约 1.6 亿条已注册作品的权威元数据,包括太新以至于其他来源尚未索引的新登记记录。

CORE — 最大的开放获取全文聚合器。直接托管文本而非链接到它,因此它也是一个全文解析器(见下文)。需要密钥:CORE_API_KEY。

DOAB — 同行评审的开放获取学术书籍和章节。这里唯一能找到原书而非书评的来源,这很重要,因为在人文领域,书籍而非文章才是发表单位。

RePEc — 列入它是为了让差距可见而非静默。他们的 API 没有搜索功能;hpr scholar sources 会说明这一点,并指向 OpenAlex 和 Crossref 查找带 DOI 的系列。

专业来源——可引用记录而非论文,按 work_type 标记,这样流水线不会把它们误认为文献:

ClinicalTrials.gov — 注册研究,包括从未发表论文的研究。不需要密钥。

SEC EDGAR — Filing 的全文搜索。SEC 拒绝不含联系地址的 User-Agent 的任何请求,因此请设置 HYPERRESEARCH_CONTACT_EMAIL。

FRED — 美联储经济序列。需要密钥:FRED_API_KEY,该密钥永不写入缓存。

设置 HYPERRESEARCH_CONTACT_EMAIL 也会让你进入 OpenAlex 和 Crossref 的"礼貌池",其速率限制比匿名流量慷慨得多。永远不会代表你发送占位符。

完成学术搜索后,运行网络搜索以获取背景、新闻、非学术角度,以及至少一次对抗性搜索("X 的批评"、"X 的局限性")。

开放获取全文:引用前先读这篇

一篇付费论文否则会以摘要的形式进入知识库,然后流水线会在约 1500 个字符上推理,同时引用该作品——仿佛已经读过论文一样。为了解决这个问题,当一次获取落地到一个携带 DOI 的薄页面时,hyperresearch 按顺序向 Unpaywall、Europe PMC 和 CORE 请求合法开放获取副本,并将该文本存储在笔记正文中。Unpaywall 需要联系地址;Europe PMC 仅覆盖生物医学领域;CORE 是广撒网,捕获其他一切,并且它直接托管文本而非指向可能 403 的仓库。

笔记的 source:仍指向你请求的 URL。正文可能来自别处。这种替换在四个地方有披露,你应该知道所有这些:

笔记正文顶部的一条横幅,标明文本实际来自的 URL 以及是哪个版本。

笔记 frontmatter 中的 oa_url / oa_source / oa_version / oa_license / oa_recovery_kind。

hpr note show <id> --json 中的 oa 块,携带 body_is_not_from_source: true。

hpr fetch 和 hpr fetch-batch 输出中的一行。

已救援笔记:其中没有任何内容来自来源

同样的查找在来源完全无法读取时也会运行——403、登录墙、机器人墙。这些正是付费论文最容易彻底丢失的地方,也正是因为 DOI 标识的是作品而非主机,合法副本最有可能存在于其他地方。

这样构建的笔记比替换声明更强,它被不同地标记:oa_recovery_kind: rescued、nothing_from_source: true(在 note show 中),以及一条横幅说明从未读取过 source URL。请字面理解。标题、作者和正文中的每一个字都来自开放获取副本——没有任何内容是从 source URL 中读取的。如果你宁愿不要笔记也不要完全由替代品拼凑的笔记,请设置 oa_rescue_blocked = false。

两个值得知道的限制。救援需要 DOI,而一个什么都没有返回的来源没有页面可以读取 DOI,因此它只在 DOI 本身在 URL 中(doi.org 链接)或在墙页面的 citation_doi meta 标签中时才会触发。没有 DOI 的裸发布者 URL 完全和以前一样失败。而且被救援的来源不会进入浏览器升级通道,因为论文已经在手——如果你特别想要发布者自己的页面,请自己通过该通道获取。

版本不可互换。Unpaywall 在没有已发布副本开放时会愉快地返回接受的手稿或提交的预印本。hyperresearch 优先选择正式记录版本并在 oa_version 中记录获取的版本,但如果它显示 acceptedVersion 或 submittedVersion,在进入报告之前请对照已发表的论文检查任何直接引用。正文横幅也会说明这一点。

在 .hyperresearch/config.toml 的 [scholar] 下配置:

[scholar]
oa_recovery = true              # set false to disable entirely
contact_email = ""              # REQUIRED by Unpaywall's terms — empty means Unpaywall is skipped
oa_min_f
Original source

本文由 AI 翻译整理自 GitHub Trending,原文版权归原作者所有。

阅读英文原文
上一篇
Claude Code 创始人:AI 编程要守住代码质量标准
下一篇
12 个已落地的 B2B 营收 AI Agent 用例,附代码