关于我们近期 AI 委托与长期可靠性研究的进一步说明
微软研究团队澄清其 AI 委托论文的发现,强调长期可靠性评估方法的重要性,而非简单认定 AI 不可靠。
我们的论文《你委托时大语言模型会破坏你的文档》引发了关于 AI 系统在委托工作流中可靠性的讨论。该研究旨在开发针对长期委托任务(让 AI 自主完成多步骤工作)的稳健评估方法,明确论文的主张边界,并促进对 AI 可靠性的严谨思考。
正文摘录
我们最近发表的论文 [《委托时,LLM 会破坏你的文档》](https://www.microsoft.com/en-us/research/publication/llms-corrupt-your-documents-when-you-delegate/) 引发了关于 AI 系统在委托工作流中可靠性的讨论。感谢大家对本项研究的关注,我们想澄清几个关于该论文主张的关键点——它究竟主张了什么,又没有主张什么。 该研究旨在为长期委托与协作任务开发稳健的评估方法。更广泛地说,这项工作反映了我们持续努力去理解强基准性能与某些现实世界任务之间差距的进程。通过使用受控评估方法,我们考察了信息在这些扩展工作流中被保留的程度。在这个受限设定下,我们观察到模型在重复编辑中可能会累积保真度退化。但请注意,当前的生产系统可以通过验证循环、编排(orchestration)和领域专用工具来缓解这些影响。 我们的目标不是反对在专业工作流中使用 AI 系统,而是指出现有系统在哪些方面需要进一步的研究和工程投入,以帮助它们成为更值得信赖的协作者。该基准测试旨在作为一种诊断工具来审视委托模式,而不是衡量模型整体能力、任务成功率或用户结果的指标。 主要结果 该论文评估了一种特定的交互模式,我们称之为委托工作 (delegated work) —— 即用户将多步骤修改任务(如文档、电子表格、代码或结构化文件)委托给 AI 系统,且步骤之间人类验证有限的情形。 我们使用链式变换与逆变换任务 (chained transformation-and-inversion tasks) 来评估在扩展的委托工作流中,语义内容是否被准确保留。我们的评估使用领域特定语义解析 (domain-specific semantic parsing) 来关注底层工件 (artifact) 的有意义变化,而非表面的格式或风格差异。