📌 项目地址Imbad0202/academic-research-skills | ⭐ 10,678 颗星 | 🔧 Python | 📜 未标注

1.11 亿条参考文献里的 14.6 万个错误

2026 年 5 月,Zhao 团队在 arXiv 发布了一篇论文(arXiv:2605.07723)。他们审计了 arXiv、bioRxiv、SSRN、PMC 四个平台上 250 万篇论文、1.11 亿条参考文献。

结论是:仅 2025 年一年,就有 146,932 条引用是幻觉——要么文献根本不存在,要么文献存在但内容与它被引用来支持的论点完全无关。而且这不是偶然错误。bioRxiv 预印本被期刊接收后,85.3% 的“假引用”原样进入了 PMC 正式版本。

预印本阶段引入的错误,会直接污染正式文献。

同一个月,Lu 等人在 Nature(651:914-919)发表了 The AI Scientist——第一个完全自主跑完盲审流程的 AI 科研系统。它在 ICLR 2025 workshop 拿到 6.33/10,workshop 平均分 4.87。论文的 Limitations 部分罗列了全自动 AI 科研系统的七种失败模式:

  • 实现 bug:代码错误被当成实验结果
  • 幻觉结果:数据凭空生成
  • 捷径依赖:选择最容易的方向,而非正确的方向
  • bug-as-insight reframing:把 bug 重新包装成“洞见”
  • 方法论捏造:编造不存在的实验步骤
  • frame-lock:锁死在初始框架里,无法跳出
  • 引用幻觉:引用不存在的文献,或引用与论点不符的文献

引用幻觉只是七分之一。但 Zhao 的数据显示,它大到可以量化:14.6 万只是被审计的样本,实际规模只会更大。

这个项目做了什么

academic-research-skills 是一个 Claude Code 插件,10,678 星,带 DOI(10.5281/zenodo.20696614)、CC BY-NC 4.0 协议和 Buy Me a Coffee 链接。

安装命令:

/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills

需要 Claude Code v3.7.0+,支持 CLI、VS Code、JetBrains。

项目的核心立场写在 README 第一段:“AI 是你的副驾,不是飞行员。这个工具不会替你写论文。它处理苦活——查文献、排引用、验数据、查逻辑一致性——把需要你大脑的部分留给你:定义问题、选择方法、解释数据含义、写完‘我论证的是’之后的那句话。”

这不是一句口号。项目的每个功能都对应上面七种失败模式中的一种或几种。

引用验证:功能实现是诚实的

v3.7.1 版针对 Zhao 论文点名的“开放挑战”做了更新。Zhao 说的开放挑战是:引用本身是真实的,但被部署来支持这些文献并不支持的论点。这不是简单检查“这个引用存在吗”,而是逐条比对来源和论点是否匹配。

为什么这比幻觉引用更难查?因为一条真实引用可能被三种方式误用:

  1. 断章取义:原文说“在某些条件下 A 成立”,引用者说“研究表明 A 成立”
  2. 位置错位:引用出现在结论段,但原文只支持方法段的某个细节
  3. 概念漂移:原文讨论的是 B 的近似行为,引用者把它当作 B 的准确定义

纯查重工具抓不到这些。ARS 的引用检查需要逐条比对,工作量在工具侧,不在你侧。

完整性检查:不是黑箱

写作管线有两道闸:Stage 2.5 和 Stage 4.5。检查清单对应那七种 AI 失败模式,文件在 academic-pipeline/references/ai_research_failure_modes.md。出问题,管线卡住,修完才放行。

值得注意的设计是 opt-in 校准模式:你准备一组已知正确和错误的引用样本,工具测量自己的漏检率(FNR,假阴性率)和误报率(FPR,假阳性率)。阈值按领域可调——高能物理和临床医学的引用错误类型不一样,你可以根据数据调节严格程度。

也就是说,这个工具告诉你它自己的能力边界,而不是假装自己不会犯错。这在科研工具里少见。

苏格拉底式方法论文档:AI 在问,你在答

/ars-plan 不是自动生成大纲,而是通过对话走一遍论文结构。我用的时候,工具反复在一个节点卡住我:你论文的核心论证链条里,必须回应的反对观点是什么?具体来源在哪儿?

大多数人写论文的习惯是先堆支持证据,反对观点最后处理。它在起点就逼你梳理对立论证,而不是写完再补。

这一步如果无效,后面那些功能也不必试了——引用验证的前提是你有自己的论证链条,工具只是帮你守卫它。

风格校准与写作质量检查

Style Calibration 从我过去文章学习用词和句式模式。它指出我最近三篇论文的结论段全部以 “therefore” 开头——我自己完全没注意到。

Writing Quality Check 抓重复过渡词、僵硬主谓结构、不必要的被动语态。默认开启,不是附加选项。

它不直接改句子,只是标出来。改不改由你定。

边界在哪里

这个项目只依赖 Claude Code 生态。不用 Claude Code,项目对你没有价值。

对非英语母语论文的检测准确性,我没有系统测试过。项目有简体中文版 README,但写作质量检查对中文的效果需要你自己验证。

引用验证的判断基准来自用户提供的 gold set——如果你的样本本身有问题,校准结果也不可靠。

为什么它值得关注

这个项目过万星,不是因为它“帮助科研”——这是句空话。是因为它瞄准了一个具体、可量化的问题:引用错误。有人审计出 1.11 亿条引用里的 14.6 万条假货,然后有人写了个工具专门对治其中一部分,并且诚实地标注了工具自身的误差率。

The AI Scientist 的论文证明了全自动路线为什么走不通:七种失败模式是系统性的,不是修几个 bug 能解决的。ARS 认为有判断力的人类加上工具,比任何单独一方都可靠。Zhao 的数据支持这个判断:人类单独写论文,2019 年以来引用幻觉率在持续上升(论文里有 mid-2024 inflection 的数据拐点);AI 全自动跑,幻觉是内建的。

工具好坏不由星数决定,由它挡住的那条错误引用决定。建议先跑 /ars-plan,看它追问的逻辑深度是否对你有启发。如果被问到了关键漏洞,继续用,把引用验证打开,把校准模式跑一遍。

这篇文章对你有帮助吗?

发表回复