提供从研究到发表的完整 Claude Code 技能集,含苏格拉底式论文结构对话、参考文献追踪与逻辑一致性检查。
简体中文版 | 繁體中文版 | 日本語版 | 한국어
一套面向学术研究的 Claude Code 技能集,涵盖从研究到发表的全流程。
30 秒安装(Claude Code CLI / VS Code / JetBrains,v3.7.0+):
/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills
安装后可以运行 /ars-plan 通过苏格拉底式对话帮你梳理论文结构,也可以跳到 Quick install 查看前置依赖和传统的符号链接安装方式。
AI 是你的副驾驶,不是主驾驶。这个工具不会替你写论文。它处理那些累活——检索文献、格式化引用、验证数据、检查逻辑一致性——让你能把精力集中在真正需要你大脑的地方:定义问题、选择方法、解读数据含义,以及写出"我主张……"之后的那句话。
与文章润色工具不同,这个工具不会帮你掩盖你使用了 AI 的事实。它帮助你写得更好。Style Calibration(风格校准)从你过往的作品中学习你的文风。Writing Quality Check(写作质量检查)捕捉那些让文章读起来像机器生成的模式。目标是质量,不是作弊。
为什么是人机协作,而不是全自动化?
Lu 等人(2026,Nature 651:914-919)构建了 The AI Scientist——首个通过盲审发表论文的全自主 AI 研究系统,发表在顶级 ML 会议(ICLR 2025 workshop,得分 6.33/10, workshop 平均分 4.87)。其 Limitations(局限性)一节列举了任何全自主 AI 研究流程都必然继承的失败模式:实现 bug、幻觉结果、走捷径、将 bug 重塑为"洞见"、方法论捏造、框架锁定、引用幻觉。
ARS 的设计理念是:由 AI 增强的人类研究者,比单独使用其中任一方能更好地规避这些失败模式。第 2.5 阶段和第 4.5 阶段的完整性门禁运行一份 7 模式拦截清单(见 academic-pipeline/references/ai_research_failure_modes.md);reviewer 提供一种 opt-in 校准模式,可针对用户提供的 gold set 测量自身的 FNR/FPR。
Zhao 等人(2026-05)审计了 arXiv、bioRxiv、SSRN 和 PMC 上 250 万篇论文中的 1.11 亿条参考文献。其保守估计,仅 2025 年一年就有 146,932 条幻觉引用,并观察到 2024 年中期的拐点;对于 bioRxiv 到 PMC 的配对,他们报告 85.3% 的预印本到正式发表存活率。该论文将"部署真实引用来支持被引文献实际上并未做出的声明"描述为一个开放挑战。ARS v3.7.1 为来源溯源添加了 trust-chain frontmatter;v3.7.3 添加了定位符基础设施(三层引用锚),为未来声明级审计做准备,并在引用时展示风险提示信号(ARS 在内部将声明-忠实度差距标记为"L3";这是 ARS 的术语,不是论文的)。v3.7.x 的设计动机来自 Zhao 等人的语料库规模发现;ARS 自身的语料库规模评估仍是未来工作。
v3.8 关闭了 L3 差距的后半段。v3.7.3 使每条引用都携带定位锚;v3.8 添加了一个 opt-in 审计通道(ARS_CLAIM_AUDIT=1),获取每条引用在其锚点处对应的来源,并判断该声明是否实际得到支持。五个新的 HIGH-WARN 类别(claim-not-supported、negative-constraint-violation、fabricated-reference、anchorless、constraint-violation-uncited)通过格式化终端的硬门禁拦截输出。校准以 20-tuple gold set 形式交付,FNR<0.15 + FPR<0.10 为接受阈值;按 v3.8 spec §5 的规定,ramp-on 计划推迟到校准后证据收集完成。
Ren 等人(2026,Self-Improvements in Modern Agentic Systems: A Survey)提供了第三个、调查级别的锚点。其科学发现综合(第 §7.4)结论是:发现智能体很难独立验证新颖性、正确性或可重复性,可能转而利用弱代理;必须在异构工具和文献中管理证据;并引发治理问题——"当证据薄弱时,科学写作也可能放大错误信息"。其生成循环章节(第 §5.1–§5.2)将人类审计和保留的人类锚点列为自生成评估循环的实用保障措施;其历史章节(第 §2.2)记录了这一教训最古老的形式:Lenat 的 EURISKO 的实际成功在很大程度上依赖于用户作为外部评估信号,剪枝无成效的启发式漂移——该调查指出,这一局限性在现代智能体系统中依然存在。ARS 引用该调查作为其人机协作立场的设计依据,而非作为人机协作流程优于自主流程的经验证明;该调查对 ARS 的可操作 delta 已在 #539–#541 和 #547–#550 中追踪。
v3.3 受 PaperOrchestra(Song, Song, Pfister & Yoon, 2026, Google)启发:Semantic Scholar API 验证、抗泄漏协议、VLM 图表验证和修订轨迹追踪。ARS 现在通过分类的、基于证据的准则轨迹(而非分数差值)来实现最后一个想法。
架构与流程
👉 docs/ARCHITECTURE.md — 完整流程视图:流程图、按阶段矩阵、数据访问流、技能依赖图、质量门禁和模式列表。
架构文档取代了之前分散在此处的冗长流程描述。关于各阶段运行内容的全部信息现在都集中在一处。
Claude Code(最新版;插件打包需要近几个版本)
已导出 ANTHROPIC_API_KEY,或在首次 claude run 时设置
可选:Pandoc(用于 DOCX)、tectonic + Source Han Serif TC(用于 APA 7.0 PDF,不装这两个 Markdown 输出也能正常工作)
可选(真实 Python):核心技能(research / write / review)不需要 Python——它们是 prompt 驱动的。真实 Python 解释器只在以下场景需要:PreToolUse write-scope guard(可选的子智能体加固——如果找不到真实 Python,它会干净地 no-op,guard Simply inactive;核心技能不受影响),以及少数几个调用 Python 的 opt-in 功能(revision-patch 模式、submission-package 验证器,以及 /ars-cache-invalidate / /ars-mark-read / /ars-unmark-read 命令)。在 Windows 上,注意 python3 通常是一个非功能性的 Microsoft Store 占位符,而非真实 Python;从 python.org 安装 Python(或通过 winget),以便启动器能找到真正的解释器。guard 启动器是一个 POSIX shell 脚本,hooks.json 通过 bash 调用它,因此在 Windows 上需要 Git Bash(随 Git for Windows 附带)。有 Git Bash 时,找不到真实 Python 会干净地降级(guard no-op,静默)。没有 Git Bash 时,Claude Code 回退到 PowerShell,无法运行 .sh 启动器:guard 不生效,且 PreToolUse hook 每次调用都会记录一个错误而非静默 no-op(可接受的降级——guard 是可选的,永远不会阻止你的写作,但 hook 噪音是需要安装 Git Bash 来消除的代价)。
你的安装渠道激活了哪些控制?不同安装渠道可用性不同。参见按渠道划分的映射:docs/CONTROL_AVAILABILITY.md。
插件安装(v3.7.0+,推荐):
/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills
验证是否正常工作:运行 /ars-plan 并描述你正在写的论文——ARS 将启动苏格拉底式对话来梳理章节结构。如果想单次测试,可以试试 /ars-lit-review "your topic"。
👉 docs/SETUP.md — 完整指南:安装 Claude Code、设置 API key、可选安装 Pandoc/tectonic 用于 DOCX/PDF、跨模型验证(ARS_CROSS_MODEL),以及六种安装方法(插件、项目技能、全局技能、claude.ai Project、仓库克隆、Claude Science 导入)。
👉 docs/DATA_FLOWS.md — 哪些数据会离开你的机器(文献解析器、可选的支持同意的跨模型调用、插件更新检查)、哪些在本地缓存、缓存多久、以及如何关闭每个数据通道。
👉 docs/RISK_REGISTER.md — 该套件已知存在的持续风险、现有哪些控制措施针对每个风险、控制措施背后的证据状态,以及哪些仍是开放问题。
使用 Claude Science?四个技能可直接导入:Skills → Import from GitHub,粘贴 https://github.com/Imbad0202/academic-research-skills,Preview,然后 Import 4 skills(需要本仓库 v3.14.0+ —— 导入器读取 marketplace manifest 中的明确 skill 路径)。导入的是时间点快照:ARS 更新后需重新导入。导入的技能携带 ARS 方法论(研究 / 写作 / 审阅协议);Claude Code 专用机制 —— 斜杠命令、hooks、子 agent 编排 —— 不会迁移过去。详见 docs/SETUP.md Method 5。
使用 Pi?用 pi install git:github.com/Imbad0202/academic-research-skills 安装树内社区维护的包装器。它保持原始 ARS 内容作为权威来源,并记录 Pi 专用的编排和 hook 限制。详见 pi/README.md。
使用 Codex CLI?安装姊妹发行版:Imbad0202/academic-research-skills-codex —— 相同的工作流内容,以单一 $academic-research-suite skill(带 ars-* 别名)做 Codex 原生打包。
第三方平台和集成(包装或托管 ARS 的)列于 THIRD_PARTY.md —— 由社区提交,未经维护者审阅或背书。
Governance:谁做决定、跨模型审阅能做什么和不能做什么,以及项目的生命周期终止姿态,详见 GOVERNANCE.md;安全报告和分级详见 SECURITY.md。
👉 docs/PERFORMANCE.md —— 各模式 token 预算、完整流水线估算(约 $4–6 生成 15k 词论文)、以及推荐的 Claude Code 设置(Auto 模式;Agent Team 可选)。
学术写作不该是一人的事——完整流水线演示(英文)
學術寫作不該是一個人的事:一套開源 AI 協作工具如何改變研究者的工作流——完整使用指南(繁體中文)
Deep Research —— 13-agent 研究团队,带苏格拉底引导模式、PRISMA 系统综述、意图检测、对话健康监控、可选跨模型 DA、Semantic Scholar API 验证。
Academic Paper —— 12-agent 论文写作,带风格校准、写作质量检查、LaTeX 加固、可视化、修订指导、引用转换、防泄漏协议、VLM 图表验证。
Academic Paper Reviewer —— 7-agent 多视角同行评审,带标准约束的、证据锚定的叙事判断(期刊匹配审阅人 + 3 个动态审阅人 + 魔鬼代言人)、让步阈值协议、攻击强度保持、可选跨模型 DA 批评 / 校准、R&R 可追溯矩阵、只读约束。当前实时评审保持 NOT_CALIBRATED;完整校准产生一个边界候选画像,而实时画像应用尚未接通。
Academic Pipeline —— 10 阶段流水线编排器,带自适应检查点、声明验证、Material Passport、可选 repro_lock、可选跨模型完整性验证、对话中强化、叙事逐标准回归检查(带类型的轨迹载体被推迟)。
数据访问级别元数据(v3.3.2+)—— 每个 skill 声明 data_access_level(raw / redacted / verified_only);由 scripts/check_data_access_level.py 强制执行。模式改编自 Anthropic 的 automated-w2s-researcher(2026)。详见 shared/ground_truth_isolation_pattern.md。
任务类型标注(v3.3.2+)—— 每个 skill 声明 task_type(open-ended 或 outcome-gradable)。所有当前 ARS skill 均为 open-ended。
基准报告模式(v3.3.5+)—— JSON Schema + lint 用于诚实基准比较。详见 shared/benchmark_report_pattern.md。
制品可重现锁文件(v3.3.5+)—— Material Passport 上可选的 repro_lock 子块。配置文档,非重放保证 —— LLM 输出无法字节级可重现。详见 shared/artifact_reproducibility_pattern.md。
模型分层(#517, v3.16+)—— 可选的 ARS_MODEL_TIERING 开关,有两个方向:economy(执行型 agents 调度比会话模型低一档,底线 Opus 级)和 quality-boost(判断型 agents 在完整性检查点和最终审阅步骤升级到前沿模型)。默认未设置 = 与 #517 之前行为字节等价。详见 shared/model_tiering.md。
规范跨模型交接信封(#527, v3.17+)—— owner→dispatcher→owner 盲检查点传输路径(#523)现在有机器稳定的 [CROSS-MODEL-HANDOFF v1] 信封,带规范性 Python 语法(scripts/cross_model_handoff.py),而非纯文本强制执行,跨三个检查点所有者固定 agreement/divergence/malformed-result 路由。详见 shared/cross_model_verification.md §"Cross-model handoff envelope"。
实验溯源摄入(#260)—— Material Passport 上可选的 experiment_provenance[] 记录学者在外部运行的实验(ARS 从不运行实验),手稿声明通过 claim_intent_manifest.planned_experiment_ids[] 与它们关联。完整性检查点(Stage 2.5/4.5)审核每个有实验支撑的声明与声明溯源的一致性 —— ALIGNED / OVERSTATED / NOT_SUPPORTED_BY_PROVENANCE / PROVENANCE_INSUFFICIENT —— 但不判断实验本身是否正确。fail-closed 的 experiment_intake_declaration 使「你是否做了实验?」成为明确的 Stage 1 决策(即使是文献-only 跑也声明 no_experiments_declared)。详见 shared/handoff_schemas.md §"Experiment Provenance Intake (#260)"。
完整性与验证边界:ARS 检查手稿和报告的过程——包括引用存在性、声明-来源一致性、报告方法论、声明实验-结果一致性、图表保真度、以及报告/过程/包一致性。部分检查为采样或 LLM 介入。ARS 不确立流程实际被执行、原始数据真实可信、或结果可复现;一贯报告的造假可以绕过这些检查。详见 POSITIONING.md § Integrity checks and the empirical-work boundary。
展示:真实流水线输出
查看完整 10 阶段流水线运行产生的制品——同行评审报告、完整性验证报告、以及最终论文:
浏览所有流水线制品 →
配套:Experiment Agent
如果你的研究涉及在写作前运行实验(代码或人类研究),Experiment Agent skill 填补了 ARS Stage 1(RESEARCH)和 Stage 2(WRITE)之间的空白。
ARS Stage 1 RESEARCH → RQ Brief + Methodology Blueprint
↓
experiment-agent → run/manage experiments → validate results
↓
ARS Stage 2 WRITE → write paper with verified experiment results
它做什么:执行代码实验(Python、R 等)并实时监控,管理人类研究协议并附 IRB 伦理清单,用 11 类谬误检测解释统计结果,验证可重现性。
如何配合使用:在 Stage 1 之后暂停 ARS 流水线,在单独的 experiment-agent 会话中运行实验,然后将结果(带 Material Passport)带回 ARS Stage 2。ARS 无需任何修改。详见 experiment-agent README 获取设置说明。
Stage 1 intake 声明(#260):在 Stage 1,ARS 检测该次运行是否包含实验支撑的声明,并在 Material Passport 上设置 fail-closed 的 experiment_intake_declaration。如果你在外部做了实验,学者为每个实验输入一条 experiment_provenance[] 条目(experiment_id、嵌套 repro_lock、planned_vs_executed[]、negative_results[]、known_limitations[]),并将声明设置为 experiments_declared;如果没有,则设置为 no_experiments_declared。声明在每个 #260 之后 passport 上必须存在——未涉及实验的运行仍声明 no_experiments_declared,这样完整性检查点就永远不会被遗忘的溯源块静默绕过。experiment_ids 在此摄入点冻结;作者稍后通过 planned_experiment_ids[] 引用它们。
教学侧配套:Teaching Skills 将 ARS 架构(skill 合集、共享契约、阶段化检查点、Course Passport)应用于学术生活的教学侧——课程设计 → 课时 → 评估 → 交付 → 反思;其 sotl 模式将课堂探究项目交接给 ARS deep-research / academic-paper 用于发表阶段。
# 启动完整研究流水线
You: "I want to write a research paper on AI's impact on higher education QA"
# 从苏格拉底引导开始
You: "Guide my research on AI in educational evaluation"
# 通过引导规划写论文
You: "Guide me through writing a paper on demographic decline"
# 审阅现有论文
You: "Review this paper" (然后提供论文)
# 检查流水线状态
You: "status"
"Research the impact of AI on higher education" → full mode "Give me a quick brief on X" → quick mode "Do a systematic review on X with PRISMA" → systematic-review mode "Guide my research on X" → socratic mode (guided) "Fact-check these claims" → fact-check mode "Do a literature review on X" → lit-review mode "Compare these papers in WHY/HOW/WHAT format" → three-way-scan mode "Review this paper's research quality" → review mode
"Write a paper on X" → full mode
"Guide me through writing a paper" → plan mode (guided)
"Build a paper outline" → outline-only mode
"I have a draft, here are reviewer comments" → revision mode
"Parse these reviewer comments into a roadmap" → revision-coach mode
"Write an abstract for this paper" → abstract-only mode
"Turn this into a literature review paper" → lit-review mode
"Convert to LaTeX" / "Convert citations to IEEE" → format-convert mode
"Check citations" → citation-check mode
"Generate an AI disclosure statement for NeurIPS" → disclosure mode
"Audit my rebuttal draft against the reviews" → rebuttal-audit mode
"Review this paper" → full mode (Journal-Fit Reviewer + R1/R2/R3 + Devil's Advocate)
"Quick assessment of this paper" → quick mode
"Guide me to improve this paper" → guided mode
"Check the methodology" → methodology-focus mode
"Verify the revisions" → re-review mode
"Calibrate this reviewer against my gold set" → calibration mode
"I want to write a complete research paper" → full pipeline from Stage 1
"I already have a paper, review it" → mid-entry at Stage 2.5 (integrity first)
"I received reviewer comments" → mid-entry at Stage 4
Pipeline 以 Stage 6: Process Summary 结束——自动生成论文创作过程记录,包含 6 维度 Collaboration Quality Evaluation(1–100 评分)。
繁体中文(Traditional Chinese)——用户使用中文时的默认语言
英语(English)——用户使用英语时的默认语言
学术论文的双语摘要(中文 + 英文)
使用其他语言?Socratic mode(deep-research)和 Plan mode(academic-paper)使用基于意图的激活——它们检测你请求的含义,而非特定关键词。这意味着它们无需修改即可在任何语言下工作。
不过,通用触发关键词部分(决定技能是否被激活)仍列出英语和繁体中文关键词。如果你发现技能在你的语言环境下激活不够可靠,可以在每个 SKILL.md 文件的 ### Trigger Keywords 部分添加你语言的关键词,以提高匹配准确度。
支持的引用格式
APA 7.0(默认,包含中文引用规则)
Chicago(注释式与作者日期式)
支持的论文结构
IMRaD(实证研究)
主题文献综述
各 Agent 职责和各阶段产出物现位于 docs/ARCHITECTURE.md。版本号在此锚定,发布元数据保持单一来源。
Deep Research(v2.12.1)
13 Agent 研究团队。模式:full、quick、review、lit-review、three-way-scan、fact-check、socratic、systematic-review。完整 Agent 列表和产出物:见 ARCHITECTURE.md §3。
Academic Paper(v3.3.1)
12 Agent 论文写作流水线。模式:full、plan、outline-only、revision、revision-coach、abstract-only、lit-review、format-convert、citation-check、disclosure、rebuttal-audit。输出:MD + DOCX(Pandoc 可用时)+ LaTeX(APA 7.0 apa7 类 / IEEE / Chicago)→ PDF(via tectonic)。完整 Agent 列表和各阶段职责:见 ARCHITECTURE.md §3。
Academic Paper Reviewer(v1.11.1)
7 Agent 多视角评审,具备准则约束的叙事判断。模式:full、re-review、quick、methodology-focus、guided、calibration。当前活跃评审和 Schema 6 包仍保持 NOT_CALIBRATED 状态;完整校准可产生有界的候选轮廓,但对活跃评审的应用尚未接入。没有将数值总分映射到 Accept、Minor Revision、Major Revision 或 Reject。第一轮评审面板与合同管理的再评审派遣边界:见 ARCHITECTURE.md §3 Stage 3 / Stage 3'。
Academic Pipeline(v3.21.1)
10 阶段编排器,含完整性验证、两阶段评审、苏格拉底式辅导和协作评估。流水线保证:每个阶段需要用户确认检查点;完整性验证(Stage 2.5 + 4.5)为强制执行,无记录旁路的绕过方式(每次覆盖均需用户理由并记录至 Stage 6);R&R Traceability Matrix(Schema 11)独立验证作者修订声明。v3.4 在 Stage 2.5 / 4.5 新增 Compliance Agent(PRISMA-trAIce + RAISE)。v3.5 在每个 FULL/SLIM 检查点及流水线完成时新增 Collaboration Depth Observer(collaboration_depth_agent,仅提供建议——从不阻断)。强制完整性门控(2.5 / 4.5)明确跳过该观察者,以免合规检查被稀释。基于 Wang & Zhang (2026),IJETHE 23:11。按阶段划分的 Agent、产出物和门控矩阵:见 ARCHITECTURE.md §3。
v3.0 优化:我们发现的 AI 结构极限
在使用 ARS 撰写关于高等教育中 AI 的反思文章时,我遇到了三个无论多少提示词工程都无法解决的结构性问题:
框架锁定(Frame-lock):我让 AI 对自己的论点展开魔鬼代言人辩论。它照做了——四轮,每轮都比上一轮更精炼。但每一轮都停留在我所设定的框架内。DA 攻击的是论点,而非前提。它从未问过"我们讨论的问题本身是否正确?"这与 v2.7 压力测试中 31% 引用错误率的问题是同一模式:验证 AI 和生成 AI 共享同一个认知框架。
框架锁定(Frame-lock):我让 AI 对自己的论点展开魔鬼代言人辩论。它照做了——四轮,每轮都比上一轮更精炼。但每一轮都停留在我所设定的框架内。DA 攻击的是论点,而非前提。它从未问过"我们讨论的问题本身是否正确?"这与 v2.7 压力测试中 31% 引用错误率的问题是同一模式:验证 AI 和生成 AI 共享同一个认知框架。
在 pushback 下的讨好倾向(Sycophancy under pushback):每当我