开源项目

academic-research-skills

为 Claude Code 设计的学术研究全流程技能套件,覆盖文献调研、论文撰写、同行评审、格式转换等环节。亮点是采用人机协作而非全自动模式,内置反幻觉、抗恭维机制,并引用 Zhao et al. (2026) 等最新研究优化引用诚实度。以 CC BY-NC 4.0 授权,仅限非商业用途。

README

Academic Research Skills for Claude Code

版本 许可证:CC BY-NC 4.0 赞助

繁體中文版

一套面向学术研究的 Claude Code 技能集,覆盖从研究到发表的完整流程。

30 秒安装(Claude Code CLI / VS Code / JetBrains,v3.7.0+):

/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills

然后运行 /ars-plan 通过苏格拉底式对话梳理论文结构,或跳转到快速安装查看前置条件和传统的符号链接流程。

AI 是你的 Copilot(副驾驶),而不是 Pilot(主驾驶)。 此工具不会替你写论文。它处理那些繁琐的工作——查找参考文献、格式化引用、验证数据、检查逻辑一致性——这样你就可以专注于那些真正需要你大脑的部分:定义问题、选择方法、解释数据的含义、以及写出 "I argue that" 之后的那句话。

与 Humanizer(拟人化工具)不同,此工具不会帮你隐藏使用过 AI 的事实。它帮助你写得更好。Style Calibration(风格校准)从你过去的作品中学习你的声音。Writing Quality Check(写作质量检查)捕捉那些让文字感觉像是机器生成的模式。目标是质量,而不是作弊。

为什么坚持 Human-in-the-loop(人在回路中),而不是完全自动化?

Lu 等人(2026,Nature 651:914-919)构建了 The AI Scientist ——首个全自主 AI 研究系统,其论文通过了顶级 ML 会议(ICLR 2025 研讨会,评分 6.33/10 vs 研讨会平均 4.87)的盲审。他们的 Limitations 部分列举了任何全自动 AI 研究流程都会继承的失败模式:实现错误、幻觉结果、捷径依赖、把 bug 当作洞见、方法捏造、思维定势(frame-lock)、引用幻觉。

ARS 建立在这样的前提上:一个由 AI 增强的人类研究者,比任何单独一方都能更好地避免这些失败模式。 Stage 2.5 和 Stage 4.5 完整性检查门执行一个 7 模式的阻断清单(参见 academic-pipeline/references/ai_research_failure_modes.md);审稿人提供可选的校准模式,根据用户提供的黄金标准集(gold set)测量自身的 FNR(假阴性率)/ FPR(假阳性率)。

Zhao 等人(2026-05)审计了 arXiv、bioRxiv、SSRN 和 PMC 上 250 万篇论文中的 1.11 亿条参考文献。他们保守估计 2025 年一年就有 146,932 条幻觉引用,并在 2024 年中观察到一个转折点;对于 bioRxiv 到 PMC 的配对,他们报告了 85.3% 的预印本到出版后的一致性。该论文将 "真实的引用被用于支持被引文献并未实际做出的声明" 描述为一个开放挑战。ARS v3.7.1 为来源出处添加了信任链 frontmatter;v3.7.3 为未来的声明级审计添加了定位器基础设施(三层引文锚点),并在引用时显示建议性风险信号(ARS 内部将声明-忠实性差距标记为 "L3";这是 ARS 的术语,不是该论文的)。v3.7.x 的动机来自 Zhao 等人基于大规模语料库的发现;对 ARS 本身的大规模语料库评估仍是未来工作。

v3.8 弥补了 L3 差距的后半部分。v3.7.3 使每条引用都带有定位器锚点;v3.8 增加了一个可选的审计通道(ARS_CLAIM_AUDIT=1),它针对每个锚点获取被引来源,并判断该声明是否确实得到支持。五个新的 HIGH-WARN 类别(声明不被支持、否定约束违反、虚构引用、无锚点、未引用但违反约束)通过格式化终端硬门拒绝输出。校准以 20 元组黄金标准集的形式提供,接受阈值为 FNR<0.15 + FPR<0.10;根据 v3.8 规范第 5 节,渐进式启用计划推迟到校准证据之后。

v3.3 受到了 PaperOrchestra(Song, Song, Pfister & Yoon, 2026, Google)的启发:Semantic Scholar API 验证、反泄漏协议、VLM 图形验证、以及评分轨迹追踪。


架构与流程

👉 docs/ARCHITECTURE.md ——完整的流程视图:流程图、逐阶段矩阵、数据访问流程、技能依赖图、质量门和模式列表。

架构文档取代了曾经在这里的冗长流程描述。所有关于 在哪个阶段运行什么 的内容现在都在一个地方。

快速安装

前置条件

  • Claude Code(最新版;插件包装需要较新版本)
  • 导出 ANTHROPIC_API_KEY,或在首次运行 claude 时设置
  • 可选: Pandoc(用于 DOCX),tectonic + Source Han Serif TC(用于 APA 7.0 PDF)(Markdown 输出在没有它们的情况下也能工作)

插件安装(v3.7.0+,推荐):

/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills

验证是否生效: 运行 /ars-plan 并描述你正在撰写的论文——ARS 将开始一次苏格拉底式对话来规划章节结构。如需一次性测试,可尝试 /ars-lit-review "你的主题"。

👉 docs/SETUP.md ——完整指南:安装 Claude Code、设置 API 密钥、可选的 Pandoc/tectonic(用于 DOCX/PDF)、跨模型验证(ARS_CROSS_MODEL),以及五种安装方法(插件、项目技能、全局技能、claude.ai 项目、仓库克隆)。

使用 Codex CLI? 改为安装配套发行版:Imbad0202/academic-research-skills-codex——相同的工作流内容,Codex 原生打包为单个 $academic-research-suite 技能,带有 ars-* 别名。

性能与成本

👉 docs/PERFORMANCE.md ——每种模式的 token 预算、完整流程估算(一篇 15000 词的论文约 $4–6),以及推荐的 Claude Code 设置(Skip Permissions;可选的 Agent Team)。

指南与文章


功能速览

  • Deep Research(深度研究) ——13 个智能体的研究团队,包含苏格拉底式引导模式、PRISMA 系统综述、意图检测、对话健康监控、可选的跨模型 DA、Semantic Scholar API 验证。
  • Academic Paper(学术论文) ——12 个智能体的论文写作,包含 Style Calibration(风格校准)、Writing Quality Check(写作质量检查)、LaTeX 加固、可视化、修订辅导、引用转换、反泄漏协议和 VLM 图形验证。
  • Academic Paper Reviewer(学术论文审稿人) ——7 个智能体的多角度同行评审,包含 0–100 质量评分标准(EIC + 3 个动态审稿人 + 魔鬼代言人)、让步阈值协议、攻击强度保持、可选的跨模型 DA 批评/校准、R&R 可追溯性矩阵、只读约束。
  • Academic Pipeline(学术流程) ——10 阶段流程编排器,包含自适应检查点、声明验证、Material Passport(材料护照)、可选的 repro_lock、可选的跨模型完整性验证、对话中强化、以及评分轨迹追踪。
  • Data Access Level Metadata(数据访问级别元数据)(v3.3.2+)——每个技能声明自己的 data_access_level(raw / redacted / verified_only);由 scripts/check_data_access_level.py 强制执行。模式改编自 Anthropic 的 automated-w2s-researcher(2026)。参见 shared/ground_truth_isolation_pattern.md。
  • Task Type Annotation(任务类型标注)(v3.3.2+)——每个技能声明自己的 task_type(open-ended 或 outcome-gradable)。所有当前的 ARS 技能都是 open-ended。
  • Benchmark Report Schema(基准报告模式)(v3.3.5+)——用于诚实基准比较的 JSON Schema + lint。参见 shared/benchmark_report_pattern.md。
  • Artifact Reproducibility Lockfile(制品可重现性锁定文件)(v3.3.5+)——Material Passport 上的可选 repro_lock 子块。配置文档,而非可重现性保证 ——LLM 输出并非字节可重现的。参见 shared/artifact_reproducibility_pattern.md。

展示:真实流程输出

请查看一次真实 10 阶段流程运行的完整制品——同行评审报告、完整性验证报告以及最终论文:

浏览所有流程制品 →

制品 描述
最终论文(英文) APA 7.0 格式,LaTeX 编译
最终论文(中文) 中文版本,APA 7.0
完整性报告——预审 Stage 2.5:发现 15 条虚构引用 + 3 处统计错误
完整性报告——终审 Stage 4.5:确认零回归
同行评审第 1 轮 EIC + 3 位审稿人 + 魔鬼代言人
重新评审 修订后验证
同行评审第 2 轮 后续评审
对审稿人的回复 逐点作者回复
发表后审计报告 独立全引用审计:发现 21/68 个被 3 轮完整性检查遗漏的问题

配套工具:Experiment Agent

如果你的研究需要在写作前运行实验(代码或人类研究),Experiment Agent 技能填补了 ARS Stage 1(研究)和 Stage 2(写作)之间的空白。

ARS Stage 1 RESEARCH → RQ 简报 + 方法蓝图
        ↓
  experiment-agent → 运行/管理实验 → 验证结果
        ↓
ARS Stage 2 WRITE → 使用经过验证的实验结果撰写论文

功能: 执行代码实验(Python、R 等)并实时监控,管理包含 IRB 伦理检查清单的人类研究方案,解释统计结果并检测 11 种谬误,验证可重现性。

如何一起使用: 在 Stage 1 后暂停 ARS 流程,在单独的 experiment-agent 会话中运行实验,然后将结果(附带 Material Passport)带回 ARS Stage 2。ARS 无需任何修改。查看 experiment-agent README 获取安装说明。


用法

快速开始

# 启动完整研究流程
你:"我想撰写一篇关于 AI 对高等教育 QA 影响的论文"

# 从苏格拉底式引导开始
你:"引导我对 AI 在教育评估中的应用进行研究"

# 在引导式规划下写作论文
你:"引导我撰写一篇关于人口下降的论文"

# 评审现有论文
你:"评审这篇论文"(然后提供论文)

# 检查流程状态
你:"状态"

独立技能

Deep Research(深度研究,7 种模式)
"研究 AI 对高等教育的影响"                              → 完整模式
"给我一个关于 X 的快速简报"                              → 快速模式
"用 PRISMA 对 X 进行系统综述"                            → 系统综述模式
"引导我对 X 的研究"                                      → 苏格拉底模式(引导式)
"事实核查这些声明"                                      → 事实核查模式
"对 X 进行文献综述"                                      → 文献综述模式
"评审这篇论文的研究质量"                                 → 评审模式
Academic Paper(学术论文,10 种模式)
"撰写一篇关于 X 的论文"                                  → 完整模式
"引导我完成论文写作"                                     → 规划模式(引导式)
"构建论文大纲"                                          → 仅大纲模式
"我有一份草稿,这里是审稿人意见"                        → 修订模式
"将这些审稿人意见解析为路线图"                          → 修订辅导模式
"为这篇论文写一个摘要"                                  → 仅摘要模式
"将其改写成文献综述论文"                                → 文献综述模式
"转换为 LaTeX" / "将引文转换为 IEEE 格式"                → 格式转换模式
"检查引文"                                              → 引文检查模式
"为 NeurIPS 生成 AI 披露声明"                           → 披露模式
Academic Paper Reviewer(学术论文审稿人,6 种模式)
"评审这篇论文"                                          → 完整模式(EIC + R1/R2/R3 + 魔鬼代言人)
"对该论文进行快速评估"                                  → 快速模式
"引导我改进这篇论文"                                    → 引导模式
"检查方法论"                                            → 方法论聚焦模式
"验证修订"                                              → 重新评审模式
"根据我的黄金标准集校准该审稿人"                        → 校准模式
Academic Pipeline(流程编排器)
"我想撰写一篇完整的研究论文"                            → 从 Stage 1 开始的完整流程
"我已经有了一篇论文,评审它"                            → 从 Stage 2.5 开始(先做完整性检查)
"我收到了审稿人意见"                                    → 从 Stage 4 开始

流程以 Stage 6:过程总结 结束——自动生成论文创作过程记录,包含 6 维度的协作质量评估(1–100 评分)。

支持的语言

  • 繁体中文(Traditional Chinese)——当用户用中文写作时默认使用
  • 英文(English)——当用户用英文写作时默认使用
  • 学术论文的双语摘要(中文 + 英文)

使用其他语言? 苏格拉底模式(deep-research)和规划模式(academic-paper)使用 基于意图的激活(intent-based activation)——它们检测你请求的含义,而非特定关键词。这意味着它们可以在 任何语言 中无需修改地工作。

然而,通用的 Trigger Keywords 部分(决定技能是否被激活)仍然列出英文和繁体中文关键词。如果你发现该技能在你的语言中无法可靠激活,你可以在每个 SKILL.md 文件的 ### Trigger Keywords 部分添加你语言的关键词以提高匹配置信度。

支持的引文格式

  • APA 7.0(默认,包括中文引用规则)
  • Chicago(注释 & 作者-日期)
  • MLA
  • IEEE
  • Vancouver

支持的论文结构

  • IMRaD(实证研究)
  • 主题式文献综述(Thematic Literature Review)
  • 理论分析(Theoretical Analysis)
  • 案例研究(Case Study)
  • 政策简报(Policy Brief)
  • 会议论文(Conference Paper)

技能详情

每个智能体的职责和每个阶段的制品现在位于 docs/ARCHITECTURE.md。版本号在此锚定,以便发布元数据保持在一个地方。

Deep Research(深度研究,v2.8)

13 个智能体的研究团队。模式:完整、快速、评审、文献综述、事实核查、苏格拉底、系统综述。完整智能体名册和制品:参见 ARCHITECTURE.md 第 3 节。

Academic Paper(学术论文,v3.0)

12 个智能体的论文写作流程。模式:完整、规划、仅大纲、修订、修订辅导、仅摘要、文献综述、格式转换、引文检查、披露。输出:MD + DOCX(当 Pandoc 可用时)+ LaTeX(APA 7.0 apa7 类 / IEEE / Chicago)→ 通过 tectonic 生成 PDF。完整智能体名册和各阶段职责:参见 ARCHITECTURE.md 第 3 节。

Academic Paper Reviewer(学术论文审稿人,v1.8)

7 个智能体的多角度评审,带有 0–100 质量评分标准。模式:完整、重新评审、快速、方法论聚焦、引导、校准。决策映射: ≥80 接受,65–79 小修,50–64 大修,<50 拒稿。第一轮评审团队与缩小的重新评审团队之间的边界:参见 ARCHITECTURE.md 第 3 节 Stage 3 / Stage 3'。

Academic Pipeline(学术流程,v3.7)

10 阶段编排器,包含完整性验证、两阶段评审、苏格拉底式辅导和协作评估。流程保证:每个阶段都需要用户确认检查点;完整性验证(Stage 2.5 + 4.5)不可跳过;R&R 可追溯性矩阵(Schema 11)独立验证作者的修订声明。v3.4 在 Stage 2.5 / 4.5 添加了 Compliance Agent(PRISMA-trAIce + RAISE)。v3.5 在每个 FULL/SLIM 检查点和流程完成时添加了 Collaboration Depth Observer(协作深度观察者)(仅建议,从不阻塞)。MANDATORY 完整性检查门(2.5 / 4.5)明确跳过观察者,以免合规检查被稀释。基于 Wang & Zhang(2026),IJETHE 23:11。包含智能体、制品和检查门的逐阶段矩阵:参见 ARCHITECTURE.md 第 3 节。


v3.0 优化:我们发现的 AI 结构性限制

发生了什么

在使用 ARS 撰写一篇关于高等教育中 AI 的反思文章时,我遇到了三个任何提示工程都无法解决的结构性问题:

  1. 思维定势(Frame-lock):我要求 AI 运行一次魔鬼代言人辩论,反驳自己的论点。它照做了——四轮,一轮比一轮更精致。但每一轮都停留在我设定的框架内。DA 攻击的是论点,而不是前提。它从未问过 "我们是否在讨论正确的问题?" 这与 v2.7 压力测试中 31% 的引用错误率是同样的模式:验证 AI 和生成 AI 共享相同的认知框架。

  2. 在面对反驳时的谄媚(Sycophancy under pushback):每次我挑战 DA 的攻击时,它都让步得太快。它撤回发现的速度比提出它们还快。模型的训练奖励对话和谐——所以"用户反驳了"被视为攻击错误的证据,而实际上通常只是用户很坚持。

  3. 意图误检测(Intent misdetection):苏格拉底式导师不断地试图收敛并生成可交付成果("要我把它写下来吗?"),而我还在探索中。它无法区分"用户想要深入的哲学讨论"和"用户想要研究问题简报"。两者看起来都是参与,但它们需要相反的 AI 行为。

我们改变了什么(v3.0)

魔鬼代言人——让步阈值协议(deep-research + academic-paper-reviewer)

  • DA 现在必须在回应前对每条反驳按 1-5 评分
  • 仅在得分 ≥4(反驳直接针对核心攻击并提供证据)时允许让步
  • 得分 ≤3:坚持立场并重述原始攻击
  • 反谄媚规则:不允许连续让步,追踪让步率,每个检查点后检测思维定势

苏格拉底式导师——意图检测层(deep-research)

  • 在对话开始时和每 3 轮后将用户意图分类为探索型(exploratory)vs. 目标导向型(goal-oriented)
  • 探索模式:禁用自动收敛,将最大轮数提升至 60,禁止"需要我总结吗?"的提示
  • 目标导向模式:标准收敛行为
  • 反过早结束规则:在探索模式下,由用户决定何时停止

苏格拉底式导师——对话健康指示器(deep-research)

  • 每 5 轮进行无声的自我评估,涵盖三个维度:持续同意、冲突回避、过早收敛
  • 在检测到同意模式时自动注入挑战性问题
  • 对用户不可见(防止作弊),但日志可用于会话后审查

为什么这很重要

这些优化并不能解决 AI 的结构性限制——它们使限制变得可见和可管理。DA 如果被推得足够猛,最终仍然会让步。苏格拉底式导师仍然会有一些收敛偏差。但现在有了明确的检查点,可以减缓谄媚,迫使 DA 证明让步的合理性,并防止导师在用户准备好之前收尾。

更深的教训:AI 素养不是关于学习将 AI 作为工具使用、遵守伦理规则或害怕 AI 风险。它是关于深入地与 AI 互动,足以自己发现其结构性限制——以及在这个过程中你自己的思维限制。


许可证

本作品采用 CC-BY-NC 4.0 许可。

你可以自由地:

  • 分享——复制和再分发本材料
  • 改编——重新混音、转换和基于本材料构建

在以下条件下:

  • 署名(Attribution)——你必须给予适当的署名
  • 非商业性使用(NonCommercial)——你不得将本材料用于商业目的

署名格式:

基于 Academic Research Skills 作者:Cheng-I Wu (吳政宜)
https://github.com/Imbad0202/academic-research-skills

贡献者

Cheng-I Wu (吳政宜) ——作者和维护者

aspi6246 ——贡献者。v3.1 优化受到 Claude-Code-Skills-for-Academics 中模式的启发:只读约束模式、反模式编码化作为一等设计、认知框架方法(教授"如何思考"而非仅仅步骤),以及精益技能规模哲学。

mchesbro1 ——贡献者。最初提议并起草了 IS 的 Basket of 8 期刊列表,用于 academic-paper-reviewer/references/top_journals_by_field.md(Issue #5)。

cloudenochcsis ——贡献者。将 IS 部分从 Basket of 8 扩展到完整的 Senior Scholars' Basket of 11——增加了 Decision Support Systems、Information & Management 和 Information and Organization(Issue #7,PR #8)。来源:AIS Senior Scholars' List of Premier Journals。


更新日志

v3.9.3(2026-05-18)——#128 整理(共享客户端工具 + 去重解析器)

纯重构 + 来自 v3.9.0 /simplify 审查积压的一个潜在错误修复。提取了 scripts/_text_similarity.py(3 路客户端去重:标准化/相似度/阈值/重试常量)+ scripts/_passport_yaml.py(2 路迁移工具去重:ruamel.yaml 往返配置)+ 私有的 _resolve_by_doi_then_title 辅助函数(2 路解析器主体去重,保留第 3.4 / 第 3.5 节 API 表面)。将节流测量标准化为 time.monotonic,覆盖 OpenAlex + Crossref(之前是 time.time,NTP 不安全),与 Semantic Scholar 对齐。所有 5 个模块级交叉导入上采用双路径导入基础设施(先同级,再命名空间包回退),保留了 SemanticScholarUnavailable 的类标识,并修正了 2 个潜在的损坏的 import scripts.X 路径。1505 个测试通过(+23 个新增,0 个回归)。#128 第 4 节(每条目并行化 OA + CR)移至 #138。

v3.9.2(2026-05-18)——#133 阶段边界热修复

#133 关闭(热修复层)。长期架构修复追踪为 v3.10 active conductor,见 #134。新增:CLAUDE.md 中的路由澄清门(跨阶段材料 → 用 a-d 选项澄清,而非静默调度),22 个单阶段智能体获得提示硬栅栏(## Phase Boundary (v3.9.2)),16 个多阶段 / 阶段正交 / 跨阶段元智能体故意不栅栏(诚实框架——散文安慰剂会产生虚假执行错觉),建议性验证器 scripts/check_pipeline_integrity.py 事后检测 #133 模式。行为冒烟测试使用跨模型抽查(100% Opus 4.7,≥75% Sonnet + GPT-5.5)。

v3.9.1(2026-05-18)——#129 + #130 客户端加固

v3.9.0 热修复。将 OpenAlex / Crossref 响应读取失败包装为 *Unavailable(#129);保护 check_claim_audit_consistency 免受非字符串 manifest_id 的影响(#130)。无规范更改。

v3.9.0(2026-05-17)——#102 跨索引三角测量

#102 关闭。v3.7.3 提供了单索引(Semantic Scholar)的污染检测;v3.9.0 扩展到三索引三角测量(S2 + OpenAlex + Crossref)作为 仅建议性证据。在 contamination_signals 上新增两个可选布尔值(openalex_unmatched、crossref_unmatched);手动输入 not-rule 对称扩展。Finalizer 新增一个 4 层建议矩阵(k=0/1/2/3,基于存在的 *_unmatched 字段),保留 v3.7.3 的 CONTAMINATED-UNMATCHED 用于 k=1/k_max=1 的 S2 唯一情况。格式化器透传白名单从 3 个后缀扩展到 9 个;拒绝规则 1-10 根据 R-L3-2-E 保持不变。策略层(严格模式、硬阻断层、venue_type / triangulation_policy)推迟到 v3.10,见规范第 2.3 节。k=3 标记为 CONTAMINATED-TRIANGULATION-UNMATCHED(描述可观察项,而非推断原因)。3 条新的严格规则:R-L3-2-C(k 基于存在字段计算)、R-L3-2-D(无 API 推断分类)、R-L3-2-E(拒绝列表不变;透传白名单扩展)。

迁移: v3.7.3 语料库——运行 python scripts/migrate_literature_corpus_to_v3_9_0.py PATH 来回填两个新字段。v3.7.3 之前的语料库——先运行 migrate_literature_corpus_to_v3_7_3.py,然后运行 v3.9.0 迁移(根据规范第 3.7 节菊花链连接;v3.9.0 工具只作用于已经具有 contamination_signals.semantic_scholar_unmatched 的条目)。

v3.8.2(2026-05-17)——#118 未引用审计工具失败表面

#118 关闭。ARS_CLAIM_AUDIT=1 的未引用约束判断路径曾经在 JudgeInvocationError 时静默替换为 {"judgment": "NOT_VIOLATED"},从而在瞬态判断器中断时抑制 HIGH-WARN 约束检查。v3.8.2 将这些失败路由到一个专门的 uncited_audit_failures[] 聚合中,处于 MED-WARN 建议层级,镜像了已引用路径的 INV-14 行,但使用专用模式,因为 claim_audit_result.ref_slug 是必需的,而未引用路径没有可绑定的 ref。#118 问题正文中的四个选项 1..4 权衡落在了选项 2(新聚合)上——选项 4(重新引发并中止)因在判断器端点不稳定时对审计覆盖率的负面影响而被拒绝。

  • 新的 uncited_audit_failure.schema.json 聚合(规范第 3.6 节)。每对(未引用句子 × 清单)对应一条条目,其中约束判断器引发了 JudgeInvocationError。与已引用路径 INV-14 相同的故障类别枚举(judge_timeout / judge_api_error / judge_parse_error / cache_corruption / retrieval_api_error / retrieval_timeout / retrieval_network_error)。rule_version: D4-c-v1-uaf-v1。
  • UAF-INV-1..UAF-INV-6 lint 检查(规范第 6 节规则 4d)。finding_id 唯一性、scoped_manifest_id 跨数组完整性、当 manifest_claim_id 非空时的 (M, C) 对完整性、每(句子,清单)去重、rationale 故障类别前缀、跨聚合互斥性与 constraint_violations[]。
  • Finalizer 第 5 节 MED-WARN 建议行:注释 [CLAIM-AUDIT-TOOL-FAILURE-UNCITED — <fault-class>],门通过(下次通过时补救)。格式化器 REFUSE 列表不变——UAF 是建议性的。
  • 流程集成(scripts/claim_audit_pipeline.py):第 1211-1224 行的 swallow 站点已移除;JudgeInvocationError 现在发出一个 UAF 行 + continue 到下一个(句子,清单)对。没有假的 NOT_VIOLATED 进入 constraint_violations[]。
  • 测试:18 个新增(15 个模式/lint TSUAFUncitedAuditFailureInvariants + 3 个流程集成 TP23UncitedJudgeOutageEmitsUAF)。基线 694 → 712 个测试,0 回归。
  • 智能体文档(academic-pipeline/agents/claim_ref_alignment_audit_agent.md):输出发射表增加第七行;错误处理表从 3 个表面增加到 4 个表面,包含未引用路径的 UAF 行。

v3.8.0(2026-05-16)——L3 声明-忠实性定位器 + 审计(成对里程碑)

v3.7.3 + v3.8 端到端关闭了 L3(声明-忠实性)差距。v3.7.3 提供了定位器基础设施——每条引用都携带一个三层锚点,以便未来的审计可以获取被引用的段落。v3.8 提供了消耗这些锚点的审计通道,判断被引来源是否支持该声明,并在格式化器终端硬门处拒绝 HIGH-WARN 违规。此版本还捆绑了自 v3.7.0 以来积累的 5 个审计轨迹特性 PR(#104 / #105 / #108 / #111 / #115)。

  • #103——claim_ref_alignment_audit_agent(v3.8 PR #121)。可选(ARS_CLAIM_AUDIT=1,默认关闭)Stage 4→5 审计智能体。判断每个采样引用与检索到的摘录的匹配情况;发出 claim_audit_results[] + claim_intent_manifests[] + claim_drifts[] + uncited_assertions[] + constraint_violations[] 聚合。8 行 finalizer 矩阵将 HIGH-WARN 类别(CLAIM-NOT-SUPPORTED / NEGATIVE-CONSTRAINT-VIOLATION / FABRICATED-REFERENCE / ANCHORLESS / CONSTRAINT-VIOLATION-UNCITED)路由到格式化器 REFUSE 规则 6-10。校准运行器附带 20 元组黄金标准集(T

[原 README 过长已截断]

开源项目Imbad02022026-05-18原文

相关内容