先问再优化:面向交互式优化的动态预建模澄清
大语言模型(LLMs)日益被用于根据自然语言问题描述构建优化模型,然而实际运筹学(OR)请求往往不完整:缺失的目标、约束或业务规则可能改变最终得到的数学规划。现有评估大多假设规格完整,从而忽略了智能体在建模前是否知道何时需要澄清。 为此,我们提出 OR-Clarify 基准,用于评估建模前澄清。每个任务提供部分公开问题描述,隐藏结构化槽位,并通过与模拟用户的有界交互进行评估。基准支持开放式与选择题式澄清,并测量槽位恢复率、停止行为、静默假设和交互成本。此外,我们提出 InterOPT 框架,两阶段识别未解决的建模关键缺口,并据此决定是继续提问还是停止。 在选择题式实验中,InterOPT 在精确槽位恢复上大幅超过所有基线;在开放式设置中,与强先验方法保持竞争力。OR-Clarify 与 InterOPT 共同将 OR 辅助重新定义为一种选择性完整性决策:需要时澄清,就绪时停止,并量化仍缺失的信息。
论文精读
TL;DR 提出 OR-Clarify 基准和 InterOPT 框架,让 LLM 在优化建模前主动识别缺失的目标/约束等关键槽位,动态决定继续提问或停止,显著提升槽位恢复准确率并避免静默假设。
问题
问题背景
LLMs 正被用于将自然语言问题转化为优化模型(如线性规划、混合整数规划),大幅降低人工建模成本。
现有方法局限
现有评测基准(如 NL4Opt、ORLM)假设问题描述已完整,忽略了真实 OR 请求中常见的缺失目标、约束或业务规则。因此,LLM 代理在信息不足时仍直接建模,生成错误或不可行的数学规划模型。此外,缺乏对“何时需要澄清”的评估机制,导致模型要么静默假设缺失值,要么反复提问造成交互成本失控。
为什么这个问题难/重要
技术难点在于:代理需要在有限交互轮次内识别所有关键缺失槽位(例如目标函数、容量约束),同时判断何时停止提问以避免过度打扰用户。隐式槽位的恢复和停止决策无法用固定规则形式化,需要动态建模。业界关注度源于实际部署时的痛点:用户常提供不完整描述,系统若不能主动澄清,生成的优化模型可能严重偏离业务意图,导致不可行方案或错误决策。例如供应链优化中缺失库存约束或目标权重变化,会直接改变最优解。因此,将澄清建模视为选择性完备度决策——该问就问、该停就停、量化剩余缺口——对可靠部署优化型 AI 助手至关重要。
行业类比
类似对话式推荐系统或智能客服,在用户表达模糊时主动追问关键偏好(如订票系统澄清日期、舱位),否则无法执行后续任务。
核心洞察
- 预建模澄清被重新定义为“选择性完整性决策”,而非简单地补齐所有缺失信息。以往 LLM 优化建模工作默认问题描述完备,或仅做一次性的全量澄清;本工作指出真实 OR 请求通常只暴露部分规格,智能体必须根据 formulation-critical gaps 动态决定问什么、问多少、何时停止。这一视角将澄清从被动响应转变为主动的信息获取策略,与直接生成模型或固定轮次问答形成本质差异。
- InterOPT 通过显式的“动态 gap 搜索 + gap-guided 动作搜索”两阶段架构,将不确定性量化为可操作的结构化缺口,并据此选择提问或停止。相比基于置信度阈值或固定预算的停止准则,该方法让停止决策直接服务于建模目标的完整性,能有效减少 silent assumptions 与过度提问。在 choice-based 实验中大幅领先所有基线,证明明确建模“缺失什么关键信息”比单纯提高问答轮次更高效。
- OR-Clarify 首次将 silent assumptions 与 stopping behavior 纳入评估指标,配合隐藏槽位和模拟用户,使澄清能力可量化、可比较。传统评估只看最终模型准确率或平均对话轮数,忽略了智能体在信息不足时是否擅自补全、是否在关键信息缺失时错误停止。这一 benchmark 设计更贴近真实 OR 流程中信息不完整、交互成本受限的场景,为后续交互式优化代理提供了统一的诊断基准。
方法
输入与问题定义
InterOPT 接收部分公开问题描述(自然语言)与截止当前的对话历史,任务是在有限交互预算内,通过主动提问恢复完整的优化建模所需信息(即 hidden slots)。
Stage 1: Dynamic Gap Search
该阶段将当前不完整描述解析为结构化的formulation-critical gaps:缺失的目标函数、约束条件、业务规则等。LLM 基于问题描述和已有对话动态生成候选 gap 列表,并判断每个 gap 是否会影响最终数学规划的形式。该过程是迭代的,每次用户回答后重新执行,以捕获新暴露的缺失信息。
Stage 2: Gap-Guided Action Search
基于 Stage 1 得到的 gap 集合,框架决定下一步动作:
- 继续提问:从 gap 中选择信息增益最高的问题(choice-based 设置中从预定义选项生成;open-ended 设置中生成自然语言问题),以高效填补关键缺口。
- 停止并输出:当没有剩余 critical gap 或交互预算耗尽时,停止询问,输出已恢复的 slots 及隐式假设清单。
该决策权衡slot recovery 与interaction cost,避免过度提问或静默假设。
与同类方法的差异
InterOPT 将澄清建模为序贯决策过程,显式追踪 gap 并主动选择提问或停止,优于一次性全量提问或仅依赖模型自身置信度的被动方法。
实验
实验设计
论文提出 OR-Clarify 基准,用于评估 LLM 在优化建模前的澄清能力。每个任务给出部分公开问题描述,隐藏若干结构化 slots(如目标、约束、业务规则),通过有界交互模拟用户反馈。协议支持 choice-based 和 open-ended 两种澄清方式,评测指标包括:
- slot recovery:隐藏槽位恢复准确率
- stopping behavior:何时停止提问
- silent assumptions:未经确认的隐式假设
- interaction cost:总交互轮次
关键发现
InterOPT 采用两阶段框架:Stage 1 动态搜索未解决的 formulation-critical gaps,Stage 2 基于 gap 决定继续提问或停止。在 choice-based 设置下,InterOPT 在精确槽位恢复上显著优于所有基线;在 open-ended 设置中仍与强先验方法保持竞争力。该方法同时显式建模停止时机与沉默假设,将 OR 助手重新定义为选择性完整性决策。
与基线对比解读
多数现有评估假设问题描述完整,忽略了建模前的信息缺口;一些主动澄清方法则缺乏明确的停止判定,易导致过度提问或过早建模。InterOPT 通过 gap 感知的行动搜索,在交互成本与信息完整性之间取得平衡。工程启示:在实际部署交互式优化系统时,显式识别“哪些缺失信息会改变数学规划结构”比单纯增加提问轮次更关键,且需量化剩余不确定性,避免静默假设造成模型错误。
行业影响
落地场景
- 对话式优化建模助手 落地于企业级 OR SaaS(供应链计划、物流调度、能源管理),业务人员用自然语言描述问题,系统在建模前澄清缺失的目标、约束和业务规则。
- 电商/零售 场景:库存补货、促销排期、仓配网络优化,需要追问服务水平、库存上限、履约时效等参数。
- 金融 场景:投资组合优化与风险限额配置,需澄清风险偏好、流动性约束等。
商业价值
- 降本:减少模型规格错误导致的返工,压缩优化建模时间;同时减少对稀缺 OR 专家的依赖。
- 体验/信任:通过选择性澄清而非盲目假设,提升非技术用户自助建模成功率;高 exact slot recovery 意味着准确捕获业务意图,降低静默假设风险。
与现有工作流集成
- 作为 优化建模前置模块 嵌入现有 stack:在 LLM 生成数学规划前,调用 InterOPT 进行 gap search,输出结构化缺失槽位,再对接 Gurobi / COPT / OR-Tools 求解器。
- 可集成进 低代码/对话式 BI 平台,提供
ask-clarify-model-solve闭环;API 接收问题描述,返回澄清问题或槽位列表,支持 choice-based 与 open-ended 两种协议。
局限
- **模拟用户与真实交互的差异**:OR-Clarify 使用模拟用户提供 slot 信息,虽然保证了可控性和可复现性,但真实场景中用户可能给出模糊、冗余甚至矛盾的回答,且存在领域知识不对称。模拟环境难以完全复现真实澄清中的噪声与不确定性,这会削弱 benchmark 的生态效度。此外,bounded interaction 的有限轮次设定未能覆盖真实长程多轮澄清场景,可能导致对 agent 停止策略的评估偏向保守。
- **方法在 open-ended 设置下优势不足**:摘要明确指出 InterOPT 在 choice-based 实验中大幅超越基线,但在 open-ended 设置中仅保持 competitive(与 strong prior methods 相当)。这表明其 gap 搜索与动作选择策略对自由形式提问的适应性仍有提升空间,尤其当用户回答不受选项约束时,模型可能难以从自然语言中精确提取 slot 值或判断是否达到停止条件。该局限限制了方法在真实开放对话系统中的应用。
- **基准覆盖范围与可扩展性有限**:OR-Clarify 的任务构造围绕可结构化的 hidden slots,且可能集中于特定类型的优化问题(如线性规划、整数规划等),对于更复杂或跨领域的 OR 请求(如非线性约束、随机优化、多目标冲突)覆盖不足。此外,论文未披露 benchmark 规模及领域多样性,难以评估模型在不同问题分布上的鲁棒性。这导致结论的泛化性存疑,后续工作需扩展任务类型和问题复杂度。