行业新闻

AI21 Labs 研究:缓存机制对代理式 LLM 管线方差复现的影响

AI21 Labs 研究:缓存机制对代理式 LLM 管线方差复现的影响

LLM 智能体管线中缓存虽快,但会破坏结果复现,研究揭示其方差影响与缓解策略。

在由多次 LLM 调用组成的代理式管线中,缓存(保存中间输出结果)可以提高效率,但可能破坏结果的可复现性。AI21 Labs 的研究揭示了不同缓存策略如何影响方差——即相同输入下输出的一致性——并提供了缓解方法。

正文摘录

TL;DR 在 Agentic 工作流上做实验时——尤其是包含多个并行 LLM 调用的 Agent——缓存会失效,因为 LLM 是非确定性的。这类工作流需要一种支持两种矛盾行为的缓存机制:可重现性与方差。我们设计了一种缓存键,将每个 LLM 调用在管线中的位置编码进去,使其不受管线执行顺序变化的影响。结果是实验更干净、范围更广:你可以只修改一条 prompt,其余部分使用缓存结果;对任意组件进行 A/B 测试,上游输出完全相同;运行 best-of-N 推理时,多个分支不会坍缩到同一个答案。 在非确定性的世界里做缓存 不用我们告诉你,Agent 因一些核心特征而难以评估。它们是: - 复杂(过程多,通常并行) - 动态(行动路线由 LLM 实时决定) - 长运行(会话可能持续几分钟或几小时) - 昂贵 因此,缓存成了管理评估实验的首选手段。 但问题来了(抱歉): 缓存是为确定性世界构建的——相同的输入,相同的输出,每次都是。作为非确定性实体,LLM 不遵守这些规则。你用同一个 prompt 调用同一个模型,实际上期望得到不同的结果。你甚至可以通过 temperature 控制差异程度。 然而,我们大部分工程工具都内置了这种确定性假设。当你把这些结构直接套用到 LLM 上而不重新思考时,事情会在最初看来不像出错的状况下崩溃。 这正是我们实验室发生的情况。我们的算法开发人员——正在运行 Agent 评估——开始报告“缓存坏了。”当我们软件工程师团队查看时,我们意识到缺少的是一种在每次 Agent 评估运行时,同时保证缓存可重现性 和 方差的方法。于是我们构建了它。这篇博客详细讲述了从问题到解决的过程。 重现方差:定义问题 当我们在实验室构建和测试 Agent 时,我们使用 Maestro 在运行时优化它们。

阅读原文(ai21.com)→

行业新闻2026-05-14原文

相关内容