用上下文集成统一语言任务中的共形预测
许多自然语言处理任务,如摘要和抽取式问答,都归结为从文档中检索相关内容,并受两个约束:覆盖率(保留足够的相关信息以达到某个目标)和简洁性(尽可能多地移除不相关信息)。 共形预测方法已被用于保证覆盖率,并且必须通过设计评分函数来优化简洁性。当前最先进的评分函数使用人工设计的LLM提示,让模型对内容重要性进行评分,但手动提示工程费时费力且针对特定任务。 我们提出了Conformal Relevance(共形相关)框架,该框架利用上下文学习示例策展和集成方法来构建评分函数,在保持覆盖率的同时提高简洁性,且只需最少的人工输入。我们展示了该框架在七项自然语言处理任务中的应用,并从理论上研究了集成共形分数的多样性影响,给出一个互补性条件来刻画何时集成能改善最坏情况下的句子分数,以及一个饱和度界来限制集成的改进幅度。
论文精读
TL;DR Conformal Relevance 框架通过上下文示例策展与集成自动构建 conformal score,在保证覆盖率的同时提升简洁性,减少手工 prompt 工程,已在七个 NLP 任务上验证。
问题
问题背景
NLP 中的摘要、抽取式问答等任务,本质是从长文档中检索相关内容,核心约束有二:覆盖率(coverage)与简洁性(conciseness)。共形预测 提供覆盖率统计保证,但其实际简洁性高度依赖评分函数设计。
现有方法局限
当前 SOTA 评分函数普遍依赖手工设计的 LLM 提示,例如让模型对每个句子的重要性打分。这种方式存在三方面不足:
- 手工提示工程劳动密集、难以跨任务复用,每个新任务需要重新调整评分标准;
- 评分函数缺乏理论指导,只能靠试错优化简洁性,效果不稳定;
- 单模型评分易受提示措辞、采样随机性影响,集成虽能增强鲁棒性,但如何构造多样且互补的评分器仍无系统方法。
为什么这个问题难/重要
覆盖率与简洁性本质上是冲突的优化目标,要同时保证统计有效性和实际可用性,须在样本效率、任务泛化和集成多样性之间取得平衡。工业界对 LLM 在长文档场景下的可控信息抽取(如合同审阅、临床记录摘要)需求强烈,任何人工提示调整都会显著增加迭代成本,因此自动化评分函数设计成为关键瓶颈。
行业类比
类似推荐系统中的召回-精排权衡:覆盖率对应召回率,简洁性对应精确率,本框架用集成学习自动调优这一平衡点。
核心洞察
- Conformal Relevance 框架用 in-context learning 示例策展与集成自动构造 conformal score function,替代手工 prompt engineering。与现有依赖人工设计评分 prompt 的方法不同,该方法从少量标注数据中通过示例选择策略(如 Anchor-DPP、Pattern-DPP、BM25)构造多个 ICL 评分器并集成,在保持 coverage 不变的同时提升 conciseness。工程上显著降低跨任务适配成本,因为无需为每个新任务手动调优 prompt,且集成机制提供更稳健的分数估计。
- 理论分析给出 ensembling 提升 worst-case sentence scores 的互补条件与收益饱和上限。论文不仅验证集成有效性,还形式化 complementarity condition,表明只有当评分器在边界样本上互补时集成才严格优于单模型;同时证明集成收益随集成规模 K 以 O(1/K) 递减(saturation bound)。这为工程实践提供清晰指引:应优先筛选互补性强的评分器,而非盲目增大集成数量,避免算力浪费。
方法
输入
给定文档集合、任务描述(如抽取式摘要、抽取式问答)以及少量标注样本作为示例池。目标是在保证覆盖关键信息的前提下,尽可能减少输出内容长度。
关键模块
数据分割
将数据划分为训练集(用于构建 ICL 示例池)、校准集(用于共形校准)和测试集。ICL 相关性评分
使用大语言模型对文档中每个候选句子进行相关性打分。提示模板包含任务指令和精选的正负示例,模型输出该句子的相关性分数。示例选择策略
从训练集中挑选用于 in-context learning 的示例,提供多种策略:anchor_dpp:用行列式点过程选择与查询相关且彼此多样的示例pattern_dpp:基于模式多样性选择示例bm25:基于词重叠度检索相似示例random:随机采样
集成评分器
使用多个不同的 ICL 评分器(不同示例选择策略或随机种子)对每个句子打分,并将分数聚合(例如取最小值或加权平均)。理论分析表明,当评分器之间存在互补性(一个高估时另一个低估)时,集成可改善最坏情况句子分数;集成收益随评分器数量增加呈 O(1/K) 饱和。共形校准
利用校准集确定分数阈值,使所选句子集合满足预设覆盖率(如 1-α),同时最小化冗余内容。
输出
返回满足覆盖率约束的紧凑句子集合,用于下游任务(摘要、抽取式问答等)。
与同类方法的差异点
相对于依赖手工设计 prompt 的共形评分函数,该方法通过 ICL 示例策展与自动集成构建评分器,显著减少任务特定的人工 prompt 工程,并首次从理论上刻画集成互补性条件与收益上限。
实验
实验设计
论文在七个 NLP 检索式任务上验证 Conformal Relevance 框架:ECTSum、SubSumE、PUMA、PhysioNet、HotpotQA、Evidence Inference、ContractNLI。采用数据分割(训练 / 校准 / 测试)以保证 conformal 覆盖率有效。核心流程:用 in-context learning (ICL) 示例选择策略(如 anchor_dpp、pattern_dpp、bm25、random)构建打分函数,再通过集成多个 ICL 打分器得到最终排序分数,用于内容选择。基线包括手工设计的 LLM prompt 评分函数(如 ICL0),以及不同集成规则。
关键发现
实验表明,Conformal Relevance 在保持目标覆盖率的同时,能显著提升内容选择的简洁性(conciseness)。理论分析验证了集成带来的最坏情况句子分数提升的互补性条件:当单个打分器在某些样本上表现较差但彼此互补时,集成后分数下界提高;并给出了集成改善的饱和界(O(1/K)),即随着集成规模 K 增大,收益递减。实验还评估了不同 ICL 示例选择策略的影响,发现基于多样性的策略(如 anchor_dpp)通常优于随机或 BM25。
基线对比解读
与依赖手工 prompt 工程的基线相比,该框架将打分函数设计从人工调参转变为数据驱动的 ICL 示例 curation,减少任务特定的人工投入。在多个任务上,集成 ICL 打分器达到或超过手工设计的性能,尤其在覆盖率-简洁性权衡上表现更优。但需注意,报告未提供具体数值指标(如覆盖率偏差、句子压缩率),因此无法量化对比幅度。工程启示:在实际系统中,可先用少量标注数据自动选择 ICL 示例并集成,替代手工评分函数,同时保持 conformal 覆盖率保证。
行业影响
落地场景
Conformal Relevance 框架适用于需要从长文档中检索关键内容并保证覆盖率的场景,例如:
- 电商评论摘要:从大量用户评论中抽取覆盖核心观点且不冗余的短摘要,辅助买家快速决策。
- 金融财报问答:从数百页 10-K 报告中提取与问题相关的句子,生成带有 coverage 保证 的答案引用。
- 医疗记录信息抽取:从电子病历中提取诊断、用药等关键信息,确保不漏重要条目,同时输出精简。
- 企业合同条款审查:识别合同中与特定风险相关的条款,输出简洁的条款列表供法务复核。
商业价值
- 降本:消除手工设计 prompt 的反复试错,通过 in-context learning 示例自动构建评分函数,减少专家标注和 prompt 工程人力成本。
- 增收/体验提升:在问答和摘要产品中,更简洁的输出直接提升用户满意度和留存;同时 conformal coverage guarantee 增强系统可信度,适用于对可靠性要求高的 B2B 场景。
- 计算优化:输出内容更短,下游生成 token 数减少,降低 API 调用成本。
与现有产品/工作流的集成
该框架可嵌入现有 RAG pipeline 的检索后处理阶段,作为 conformal filter:
- 检索器返回候选片段。
- 使用 ICL-based scorer 对每个片段打分,并应用 ensembled conformal threshold 选取满足 coverage 的最小集合。
- 将筛选后的紧凑内容送入生成器,减少幻觉和无关信息。
代码已在 GitHub 开源,可直接接入基于 transformers 或 LLM API 的服务。对于已有生产系统,只需替换原有的手工 score function,无需改动整体架构。
局限
- 该方法依赖高质量的 ICL 示例来选择与嵌入,示例数量、选择策略(如 DPP、BM25)和底层嵌入模型都会显著影响分数质量,但论文未给出跨任务最优配置的自动选择机制。实验局限于固定 LLM 和少数数据集,跨模型泛化与分布外鲁棒性有待进一步验证。
- 理论上的互补条件(complementarity condition)和饱和界假设各评分器输出独立或可交换,而实际 LLM 生成的分数可能存在系统性偏差和相关性,导致互补收益低于理论预期。论文未提供在实践中验证或强制执行该条件的具体方法,限制了理论对实际部署的指导价值。
- 该方法主要针对抽取式任务,在需要抽象生成或复杂推理的场景中可能不直接适用;同时实验中的覆盖水平 α 和精简度评测指标相对受限,未能全面刻画 conformal 方法在不同风险容忍度下的行为,且 ensembling 带来的额外计算开销未做详细成本分析。