academic-research-skills
为 Claude Code 设计的学术研究全流程技能套件,覆盖文献调研、论文撰写、同行评审、格式转换等环节。亮点是采用人机协作而非全自动模式,内置反幻觉、抗恭维机制,并引用 Zhao et al. (2026) 等最新研究优化引用诚实度。以 CC BY-NC 4.0 授权,仅限非商业用途。
README
Academic Research Skills for Claude Code
一套面向学术研究的 Claude Code 技能集,覆盖从研究到发表的完整流程。
30 秒安装(Claude Code CLI / VS Code / JetBrains,v3.7.0+):
/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills
然后运行 /ars-plan 通过苏格拉底式对话梳理论文结构,或跳转到快速安装查看前置条件和传统的符号链接流程。
AI 是你的 Copilot(副驾驶),而不是 Pilot(主驾驶)。 此工具不会替你写论文。它处理那些繁琐的工作——查找参考文献、格式化引用、验证数据、检查逻辑一致性——这样你就可以专注于那些真正需要你大脑的部分:定义问题、选择方法、解释数据的含义、以及写出 "I argue that" 之后的那句话。
与 Humanizer(拟人化工具)不同,此工具不会帮你隐藏使用过 AI 的事实。它帮助你写得更好。Style Calibration(风格校准)从你过去的作品中学习你的声音。Writing Quality Check(写作质量检查)捕捉那些让文字感觉像是机器生成的模式。目标是质量,而不是作弊。
为什么坚持 Human-in-the-loop(人在回路中),而不是完全自动化?
Lu 等人(2026,Nature 651:914-919)构建了 The AI Scientist ——首个全自主 AI 研究系统,其论文通过了顶级 ML 会议(ICLR 2025 研讨会,评分 6.33/10 vs 研讨会平均 4.87)的盲审。他们的 Limitations 部分列举了任何全自动 AI 研究流程都会继承的失败模式:实现错误、幻觉结果、捷径依赖、把 bug 当作洞见、方法捏造、思维定势(frame-lock)、引用幻觉。
ARS 建立在这样的前提上:一个由 AI 增强的人类研究者,比任何单独一方都能更好地避免这些失败模式。 Stage 2.5 和 Stage 4.5 完整性检查门执行一个 7 模式的阻断清单(参见 academic-pipeline/references/ai_research_failure_modes.md);审稿人提供可选的校准模式,根据用户提供的黄金标准集(gold set)测量自身的 FNR(假阴性率)/ FPR(假阳性率)。
Zhao 等人(2026-05)审计了 arXiv、bioRxiv、SSRN 和 PMC 上 250 万篇论文中的 1.11 亿条参考文献。他们保守估计 2025 年一年就有 146,932 条幻觉引用,并在 2024 年中观察到一个转折点;对于 bioRxiv 到 PMC 的配对,他们报告了 85.3% 的预印本到出版后的一致性。该论文将 "真实的引用被用于支持被引文献并未实际做出的声明" 描述为一个开放挑战。ARS v3.7.1 为来源出处添加了信任链 frontmatter;v3.7.3 为未来的声明级审计添加了定位器基础设施(三层引文锚点),并在引用时显示建议性风险信号(ARS 内部将声明-忠实性差距标记为 "L3";这是 ARS 的术语,不是该论文的)。v3.7.x 的动机来自 Zhao 等人基于大规模语料库的发现;对 ARS 本身的大规模语料库评估仍是未来工作。
v3.8 弥补了 L3 差距的后半部分。v3.7.3 使每条引用都带有定位器锚点;v3.8 增加了一个可选的审计通道(ARS_CLAIM_AUDIT=1),它针对每个锚点获取被引来源,并判断该声明是否确实得到支持。五个新的 HIGH-WARN 类别(声明不被支持、否定约束违反、虚构引用、无锚点、未引用但违反约束)通过格式化终端硬门拒绝输出。校准以 20 元组黄金标准集的形式提供,接受阈值为 FNR<0.15 + FPR<0.10;根据 v3.8 规范第 5 节,渐进式启用计划推迟到校准证据之后。
v3.3 受到了 PaperOrchestra(Song, Song, Pfister & Yoon, 2026, Google)的启发:Semantic Scholar API 验证、反泄漏协议、VLM 图形验证、以及评分轨迹追踪。
架构与流程
👉 docs/ARCHITECTURE.md ——完整的流程视图:流程图、逐阶段矩阵、数据访问流程、技能依赖图、质量门和模式列表。
架构文档取代了曾经在这里的冗长流程描述。所有关于 在哪个阶段运行什么 的内容现在都在一个地方。
快速安装
前置条件
- Claude Code(最新版;插件包装需要较新版本)
- 导出
ANTHROPIC_API_KEY,或在首次运行claude时设置 - 可选: Pandoc(用于 DOCX),tectonic + Source Han Serif TC(用于 APA 7.0 PDF)(Markdown 输出在没有它们的情况下也能工作)
插件安装(v3.7.0+,推荐):
/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills
验证是否生效: 运行 /ars-plan 并描述你正在撰写的论文——ARS 将开始一次苏格拉底式对话来规划章节结构。如需一次性测试,可尝试 /ars-lit-review "你的主题"。
👉 docs/SETUP.md ——完整指南:安装 Claude Code、设置 API 密钥、可选的 Pandoc/tectonic(用于 DOCX/PDF)、跨模型验证(ARS_CROSS_MODEL),以及五种安装方法(插件、项目技能、全局技能、claude.ai 项目、仓库克隆)。
使用 Codex CLI? 改为安装配套发行版:Imbad0202/academic-research-skills-codex——相同的工作流内容,Codex 原生打包为单个 $academic-research-suite 技能,带有 ars-* 别名。
性能与成本
👉 docs/PERFORMANCE.md ——每种模式的 token 预算、完整流程估算(一篇 15000 词的论文约 $4–6),以及推荐的 Claude Code 设置(Skip Permissions;可选的 Agent Team)。
指南与文章
- Academic Writing Shouldn't Be a Solo Act ——完整流程演练(英文)
- 學術寫作不該是一個人的事:一套開源 AI 協作工具如何改變研究者的工作流 ——完整使用指南(繁体中文)
功能速览
- Deep Research(深度研究) ——13 个智能体的研究团队,包含苏格拉底式引导模式、PRISMA 系统综述、意图检测、对话健康监控、可选的跨模型 DA、Semantic Scholar API 验证。
- Academic Paper(学术论文) ——12 个智能体的论文写作,包含 Style Calibration(风格校准)、Writing Quality Check(写作质量检查)、LaTeX 加固、可视化、修订辅导、引用转换、反泄漏协议和 VLM 图形验证。
- Academic Paper Reviewer(学术论文审稿人) ——7 个智能体的多角度同行评审,包含 0–100 质量评分标准(EIC + 3 个动态审稿人 + 魔鬼代言人)、让步阈值协议、攻击强度保持、可选的跨模型 DA 批评/校准、R&R 可追溯性矩阵、只读约束。
- Academic Pipeline(学术流程) ——10 阶段流程编排器,包含自适应检查点、声明验证、Material Passport(材料护照)、可选的
repro_lock、可选的跨模型完整性验证、对话中强化、以及评分轨迹追踪。 - Data Access Level Metadata(数据访问级别元数据)(v3.3.2+)——每个技能声明自己的
data_access_level(raw/redacted/verified_only);由scripts/check_data_access_level.py强制执行。模式改编自 Anthropic 的 automated-w2s-researcher(2026)。参见shared/ground_truth_isolation_pattern.md。 - Task Type Annotation(任务类型标注)(v3.3.2+)——每个技能声明自己的
task_type(open-ended或outcome-gradable)。所有当前的 ARS 技能都是open-ended。 - Benchmark Report Schema(基准报告模式)(v3.3.5+)——用于诚实基准比较的 JSON Schema + lint。参见
shared/benchmark_report_pattern.md。 - Artifact Reproducibility Lockfile(制品可重现性锁定文件)(v3.3.5+)——Material Passport 上的可选
repro_lock子块。配置文档,而非可重现性保证 ——LLM 输出并非字节可重现的。参见shared/artifact_reproducibility_pattern.md。
展示:真实流程输出
请查看一次真实 10 阶段流程运行的完整制品——同行评审报告、完整性验证报告以及最终论文:
| 制品 | 描述 |
|---|---|
| 最终论文(英文) | APA 7.0 格式,LaTeX 编译 |
| 最终论文(中文) | 中文版本,APA 7.0 |
| 完整性报告——预审 | Stage 2.5:发现 15 条虚构引用 + 3 处统计错误 |
| 完整性报告——终审 | Stage 4.5:确认零回归 |
| 同行评审第 1 轮 | EIC + 3 位审稿人 + 魔鬼代言人 |
| 重新评审 | 修订后验证 |
| 同行评审第 2 轮 | 后续评审 |
| 对审稿人的回复 | 逐点作者回复 |
| 发表后审计报告 | 独立全引用审计:发现 21/68 个被 3 轮完整性检查遗漏的问题 |
配套工具:Experiment Agent
如果你的研究需要在写作前运行实验(代码或人类研究),Experiment Agent 技能填补了 ARS Stage 1(研究)和 Stage 2(写作)之间的空白。
ARS Stage 1 RESEARCH → RQ 简报 + 方法蓝图
↓
experiment-agent → 运行/管理实验 → 验证结果
↓
ARS Stage 2 WRITE → 使用经过验证的实验结果撰写论文
功能: 执行代码实验(Python、R 等)并实时监控,管理包含 IRB 伦理检查清单的人类研究方案,解释统计结果并检测 11 种谬误,验证可重现性。
如何一起使用: 在 Stage 1 后暂停 ARS 流程,在单独的 experiment-agent 会话中运行实验,然后将结果(附带 Material Passport)带回 ARS Stage 2。ARS 无需任何修改。查看 experiment-agent README 获取安装说明。
用法
快速开始
# 启动完整研究流程
你:"我想撰写一篇关于 AI 对高等教育 QA 影响的论文"
# 从苏格拉底式引导开始
你:"引导我对 AI 在教育评估中的应用进行研究"
# 在引导式规划下写作论文
你:"引导我撰写一篇关于人口下降的论文"
# 评审现有论文
你:"评审这篇论文"(然后提供论文)
# 检查流程状态
你:"状态"
独立技能
Deep Research(深度研究,7 种模式)
"研究 AI 对高等教育的影响" → 完整模式
"给我一个关于 X 的快速简报" → 快速模式
"用 PRISMA 对 X 进行系统综述" → 系统综述模式
"引导我对 X 的研究" → 苏格拉底模式(引导式)
"事实核查这些声明" → 事实核查模式
"对 X 进行文献综述" → 文献综述模式
"评审这篇论文的研究质量" → 评审模式
Academic Paper(学术论文,10 种模式)
"撰写一篇关于 X 的论文" → 完整模式
"引导我完成论文写作" → 规划模式(引导式)
"构建论文大纲" → 仅大纲模式
"我有一份草稿,这里是审稿人意见" → 修订模式
"将这些审稿人意见解析为路线图" → 修订辅导模式
"为这篇论文写一个摘要" → 仅摘要模式
"将其改写成文献综述论文" → 文献综述模式
"转换为 LaTeX" / "将引文转换为 IEEE 格式" → 格式转换模式
"检查引文" → 引文检查模式
"为 NeurIPS 生成 AI 披露声明" → 披露模式
Academic Paper Reviewer(学术论文审稿人,6 种模式)
"评审这篇论文" → 完整模式(EIC + R1/R2/R3 + 魔鬼代言人)
"对该论文进行快速评估" → 快速模式
"引导我改进这篇论文" → 引导模式
"检查方法论" → 方法论聚焦模式
"验证修订" → 重新评审模式
"根据我的黄金标准集校准该审稿人" → 校准模式
Academic Pipeline(流程编排器)
"我想撰写一篇完整的研究论文" → 从 Stage 1 开始的完整流程
"我已经有了一篇论文,评审它" → 从 Stage 2.5 开始(先做完整性检查)
"我收到了审稿人意见" → 从 Stage 4 开始
流程以 Stage 6:过程总结 结束——自动生成论文创作过程记录,包含 6 维度的协作质量评估(1–100 评分)。
支持的语言
- 繁体中文(Traditional Chinese)——当用户用中文写作时默认使用
- 英文(English)——当用户用英文写作时默认使用
- 学术论文的双语摘要(中文 + 英文)
使用其他语言? 苏格拉底模式(deep-research)和规划模式(academic-paper)使用 基于意图的激活(intent-based activation)——它们检测你请求的含义,而非特定关键词。这意味着它们可以在 任何语言 中无需修改地工作。
然而,通用的
Trigger Keywords部分(决定技能是否被激活)仍然列出英文和繁体中文关键词。如果你发现该技能在你的语言中无法可靠激活,你可以在每个SKILL.md文件的### Trigger Keywords部分添加你语言的关键词以提高匹配置信度。
支持的引文格式
- APA 7.0(默认,包括中文引用规则)
- Chicago(注释 & 作者-日期)
- MLA
- IEEE
- Vancouver
支持的论文结构
- IMRaD(实证研究)
- 主题式文献综述(Thematic Literature Review)
- 理论分析(Theoretical Analysis)
- 案例研究(Case Study)
- 政策简报(Policy Brief)
- 会议论文(Conference Paper)
技能详情
每个智能体的职责和每个阶段的制品现在位于 docs/ARCHITECTURE.md。版本号在此锚定,以便发布元数据保持在一个地方。
Deep Research(深度研究,v2.8)
13 个智能体的研究团队。模式:完整、快速、评审、文献综述、事实核查、苏格拉底、系统综述。完整智能体名册和制品:参见 ARCHITECTURE.md 第 3 节。
Academic Paper(学术论文,v3.0)
12 个智能体的论文写作流程。模式:完整、规划、仅大纲、修订、修订辅导、仅摘要、文献综述、格式转换、引文检查、披露。输出:MD + DOCX(当 Pandoc 可用时)+ LaTeX(APA 7.0 apa7 类 / IEEE / Chicago)→ 通过 tectonic 生成 PDF。完整智能体名册和各阶段职责:参见 ARCHITECTURE.md 第 3 节。
Academic Paper Reviewer(学术论文审稿人,v1.8)
7 个智能体的多角度评审,带有 0–100 质量评分标准。模式:完整、重新评审、快速、方法论聚焦、引导、校准。决策映射: ≥80 接受,65–79 小修,50–64 大修,<50 拒稿。第一轮评审团队与缩小的重新评审团队之间的边界:参见 ARCHITECTURE.md 第 3 节 Stage 3 / Stage 3'。
Academic Pipeline(学术流程,v3.7)
10 阶段编排器,包含完整性验证、两阶段评审、苏格拉底式辅导和协作评估。流程保证:每个阶段都需要用户确认检查点;完整性验证(Stage 2.5 + 4.5)不可跳过;R&R 可追溯性矩阵(Schema 11)独立验证作者的修订声明。v3.4 在 Stage 2.5 / 4.5 添加了 Compliance Agent(PRISMA-trAIce + RAISE)。v3.5 在每个 FULL/SLIM 检查点和流程完成时添加了 Collaboration Depth Observer(协作深度观察者)(仅建议,从不阻塞)。MANDATORY 完整性检查门(2.5 / 4.5)明确跳过观察者,以免合规检查被稀释。基于 Wang & Zhang(2026),IJETHE 23:11。包含智能体、制品和检查门的逐阶段矩阵:参见 ARCHITECTURE.md 第 3 节。
v3.0 优化:我们发现的 AI 结构性限制
发生了什么
在使用 ARS 撰写一篇关于高等教育中 AI 的反思文章时,我遇到了三个任何提示工程都无法解决的结构性问题:
思维定势(Frame-lock):我要求 AI 运行一次魔鬼代言人辩论,反驳自己的论点。它照做了——四轮,一轮比一轮更精致。但每一轮都停留在我设定的框架内。DA 攻击的是论点,而不是前提。它从未问过 "我们是否在讨论正确的问题?" 这与 v2.7 压力测试中 31% 的引用错误率是同样的模式:验证 AI 和生成 AI 共享相同的认知框架。
在面对反驳时的谄媚(Sycophancy under pushback):每次我挑战 DA 的攻击时,它都让步得太快。它撤回发现的速度比提出它们还快。模型的训练奖励对话和谐——所以"用户反驳了"被视为攻击错误的证据,而实际上通常只是用户很坚持。
意图误检测(Intent misdetection):苏格拉底式导师不断地试图收敛并生成可交付成果("要我把它写下来吗?"),而我还在探索中。它无法区分"用户想要深入的哲学讨论"和"用户想要研究问题简报"。两者看起来都是参与,但它们需要相反的 AI 行为。
我们改变了什么(v3.0)
魔鬼代言人——让步阈值协议(deep-research + academic-paper-reviewer)
- DA 现在必须在回应前对每条反驳按 1-5 评分
- 仅在得分 ≥4(反驳直接针对核心攻击并提供证据)时允许让步
- 得分 ≤3:坚持立场并重述原始攻击
- 反谄媚规则:不允许连续让步,追踪让步率,每个检查点后检测思维定势
苏格拉底式导师——意图检测层(deep-research)
- 在对话开始时和每 3 轮后将用户意图分类为探索型(exploratory)vs. 目标导向型(goal-oriented)
- 探索模式:禁用自动收敛,将最大轮数提升至 60,禁止"需要我总结吗?"的提示
- 目标导向模式:标准收敛行为
- 反过早结束规则:在探索模式下,由用户决定何时停止
苏格拉底式导师——对话健康指示器(deep-research)
- 每 5 轮进行无声的自我评估,涵盖三个维度:持续同意、冲突回避、过早收敛
- 在检测到同意模式时自动注入挑战性问题
- 对用户不可见(防止作弊),但日志可用于会话后审查
为什么这很重要
这些优化并不能解决 AI 的结构性限制——它们使限制变得可见和可管理。DA 如果被推得足够猛,最终仍然会让步。苏格拉底式导师仍然会有一些收敛偏差。但现在有了明确的检查点,可以减缓谄媚,迫使 DA 证明让步的合理性,并防止导师在用户准备好之前收尾。
更深的教训:AI 素养不是关于学习将 AI 作为工具使用、遵守伦理规则或害怕 AI 风险。它是关于深入地与 AI 互动,足以自己发现其结构性限制——以及在这个过程中你自己的思维限制。
许可证
本作品采用 CC-BY-NC 4.0 许可。
你可以自由地:
- 分享——复制和再分发本材料
- 改编——重新混音、转换和基于本材料构建
在以下条件下:
- 署名(Attribution)——你必须给予适当的署名
- 非商业性使用(NonCommercial)——你不得将本材料用于商业目的
署名格式:
基于 Academic Research Skills 作者:Cheng-I Wu (吳政宜)
https://github.com/Imbad0202/academic-research-skills
贡献者
Cheng-I Wu (吳政宜) ——作者和维护者
aspi6246 ——贡献者。v3.1 优化受到 Claude-Code-Skills-for-Academics 中模式的启发:只读约束模式、反模式编码化作为一等设计、认知框架方法(教授"如何思考"而非仅仅步骤),以及精益技能规模哲学。
mchesbro1 ——贡献者。最初提议并起草了 IS 的 Basket of 8 期刊列表,用于 academic-paper-reviewer/references/top_journals_by_field.md(Issue #5)。
cloudenochcsis ——贡献者。将 IS 部分从 Basket of 8 扩展到完整的 Senior Scholars' Basket of 11——增加了 Decision Support Systems、Information & Management 和 Information and Organization(Issue #7,PR #8)。来源:AIS Senior Scholars' List of Premier Journals。
更新日志
v3.9.3(2026-05-18)——#128 整理(共享客户端工具 + 去重解析器)
纯重构 + 来自 v3.9.0
/simplify审查积压的一个潜在错误修复。提取了scripts/_text_similarity.py(3 路客户端去重:标准化/相似度/阈值/重试常量)+scripts/_passport_yaml.py(2 路迁移工具去重:ruamel.yaml 往返配置)+ 私有的_resolve_by_doi_then_title辅助函数(2 路解析器主体去重,保留第 3.4 / 第 3.5 节 API 表面)。将节流测量标准化为time.monotonic,覆盖 OpenAlex + Crossref(之前是time.time,NTP 不安全),与 Semantic Scholar 对齐。所有 5 个模块级交叉导入上采用双路径导入基础设施(先同级,再命名空间包回退),保留了SemanticScholarUnavailable的类标识,并修正了 2 个潜在的损坏的import scripts.X路径。1505 个测试通过(+23 个新增,0 个回归)。#128 第 4 节(每条目并行化 OA + CR)移至 #138。
v3.9.2(2026-05-18)——#133 阶段边界热修复
#133 关闭(热修复层)。长期架构修复追踪为 v3.10 active conductor,见 #134。新增:CLAUDE.md 中的路由澄清门(跨阶段材料 → 用 a-d 选项澄清,而非静默调度),22 个单阶段智能体获得提示硬栅栏(
## Phase Boundary (v3.9.2)),16 个多阶段 / 阶段正交 / 跨阶段元智能体故意不栅栏(诚实框架——散文安慰剂会产生虚假执行错觉),建议性验证器scripts/check_pipeline_integrity.py事后检测 #133 模式。行为冒烟测试使用跨模型抽查(100% Opus 4.7,≥75% Sonnet + GPT-5.5)。
v3.9.1(2026-05-18)——#129 + #130 客户端加固
v3.9.0 热修复。将 OpenAlex / Crossref 响应读取失败包装为
*Unavailable(#129);保护check_claim_audit_consistency免受非字符串manifest_id的影响(#130)。无规范更改。
v3.9.0(2026-05-17)——#102 跨索引三角测量
#102 关闭。v3.7.3 提供了单索引(Semantic Scholar)的污染检测;v3.9.0 扩展到三索引三角测量(S2 + OpenAlex + Crossref)作为 仅建议性证据。在
contamination_signals上新增两个可选布尔值(openalex_unmatched、crossref_unmatched);手动输入 not-rule 对称扩展。Finalizer 新增一个 4 层建议矩阵(k=0/1/2/3,基于存在的*_unmatched字段),保留 v3.7.3 的CONTAMINATED-UNMATCHED用于 k=1/k_max=1 的 S2 唯一情况。格式化器透传白名单从 3 个后缀扩展到 9 个;拒绝规则 1-10 根据 R-L3-2-E 保持不变。策略层(严格模式、硬阻断层、venue_type/triangulation_policy)推迟到 v3.10,见规范第 2.3 节。k=3 标记为CONTAMINATED-TRIANGULATION-UNMATCHED(描述可观察项,而非推断原因)。3 条新的严格规则:R-L3-2-C(k 基于存在字段计算)、R-L3-2-D(无 API 推断分类)、R-L3-2-E(拒绝列表不变;透传白名单扩展)。
迁移: v3.7.3 语料库——运行 python scripts/migrate_literature_corpus_to_v3_9_0.py PATH 来回填两个新字段。v3.7.3 之前的语料库——先运行 migrate_literature_corpus_to_v3_7_3.py,然后运行 v3.9.0 迁移(根据规范第 3.7 节菊花链连接;v3.9.0 工具只作用于已经具有 contamination_signals.semantic_scholar_unmatched 的条目)。
v3.8.2(2026-05-17)——#118 未引用审计工具失败表面
#118 关闭。
ARS_CLAIM_AUDIT=1的未引用约束判断路径曾经在JudgeInvocationError时静默替换为{"judgment": "NOT_VIOLATED"},从而在瞬态判断器中断时抑制 HIGH-WARN 约束检查。v3.8.2 将这些失败路由到一个专门的uncited_audit_failures[]聚合中,处于 MED-WARN 建议层级,镜像了已引用路径的 INV-14 行,但使用专用模式,因为claim_audit_result.ref_slug是必需的,而未引用路径没有可绑定的 ref。#118 问题正文中的四个选项 1..4 权衡落在了选项 2(新聚合)上——选项 4(重新引发并中止)因在判断器端点不稳定时对审计覆盖率的负面影响而被拒绝。
- 新的
uncited_audit_failure.schema.json聚合(规范第 3.6 节)。每对(未引用句子 × 清单)对应一条条目,其中约束判断器引发了JudgeInvocationError。与已引用路径 INV-14 相同的故障类别枚举(judge_timeout/judge_api_error/judge_parse_error/cache_corruption/retrieval_api_error/retrieval_timeout/retrieval_network_error)。rule_version: D4-c-v1-uaf-v1。 - UAF-INV-1..UAF-INV-6 lint 检查(规范第 6 节规则 4d)。
finding_id唯一性、scoped_manifest_id跨数组完整性、当manifest_claim_id非空时的 (M, C) 对完整性、每(句子,清单)去重、rationale 故障类别前缀、跨聚合互斥性与constraint_violations[]。 - Finalizer 第 5 节 MED-WARN 建议行:注释
[CLAIM-AUDIT-TOOL-FAILURE-UNCITED — <fault-class>],门通过(下次通过时补救)。格式化器 REFUSE 列表不变——UAF 是建议性的。 - 流程集成(
scripts/claim_audit_pipeline.py):第 1211-1224 行的 swallow 站点已移除;JudgeInvocationError现在发出一个 UAF 行 +continue到下一个(句子,清单)对。没有假的 NOT_VIOLATED 进入constraint_violations[]。 - 测试:18 个新增(15 个模式/lint TSUAFUncitedAuditFailureInvariants + 3 个流程集成 TP23UncitedJudgeOutageEmitsUAF)。基线 694 → 712 个测试,0 回归。
- 智能体文档(
academic-pipeline/agents/claim_ref_alignment_audit_agent.md):输出发射表增加第七行;错误处理表从 3 个表面增加到 4 个表面,包含未引用路径的 UAF 行。
v3.8.0(2026-05-16)——L3 声明-忠实性定位器 + 审计(成对里程碑)
v3.7.3 + v3.8 端到端关闭了 L3(声明-忠实性)差距。v3.7.3 提供了定位器基础设施——每条引用都携带一个三层锚点,以便未来的审计可以获取被引用的段落。v3.8 提供了消耗这些锚点的审计通道,判断被引来源是否支持该声明,并在格式化器终端硬门处拒绝 HIGH-WARN 违规。此版本还捆绑了自 v3.7.0 以来积累的 5 个审计轨迹特性 PR(#104 / #105 / #108 / #111 / #115)。
- #103——
claim_ref_alignment_audit_agent(v3.8 PR #121)。可选(ARS_CLAIM_AUDIT=1,默认关闭)Stage 4→5 审计智能体。判断每个采样引用与检索到的摘录的匹配情况;发出claim_audit_results[]+claim_intent_manifests[]+claim_drifts[]+uncited_assertions[]+constraint_violations[]聚合。8 行 finalizer 矩阵将 HIGH-WARN 类别(CLAIM-NOT-SUPPORTED / NEGATIVE-CONSTRAINT-VIOLATION / FABRICATED-REFERENCE / ANCHORLESS / CONSTRAINT-VIOLATION-UNCITED)路由到格式化器 REFUSE 规则 6-10。校准运行器附带 20 元组黄金标准集(T
[原 README 过长已截断]