论文

Φ-Bench:大型语言模型能否工程化驱动它们自身的基础设施?

Φ-Bench:大型语言模型能否工程化驱动它们自身的基础设施?

大型语言模型(LLMs)在推理与代码生成方面已展现出卓越能力,这让人们开始期待它们能够协助开发并优化驱动自身运转的基础设施。然而,现有基准多聚焦于孤立的 kernel、预定义的算子或预先指定的优化目标,无法评估 LLMs 在开放式、长周期 LLM 基础设施工程 任务上的能力。 为填补这一空白,我们提出 Φ-Bench —— 一个用于系统评估 LLMs 工程化 LLM 基础设施栈 能力的基准。它取自前沿研究中的优化问题,并扎根于真实代码仓库,覆盖 LLM 基础设施栈的广泛范围,任务复杂度跨度很大: - 局部化的 kernel 级函数补全; - 长周期实现与 端到端系统优化。 在前沿 LLMs 上的大量实验揭示了它们当前在复杂 LLM 基础设施工程中的能力与局限,并为通往未来 AI 基础设施 自主优化 之路上仍然存在的挑战提供了洞见。

论文精读

TL;DR Φ-Bench 系统评估 LLM 在真实 LLM 基础设施栈上的工程能力,覆盖从 kernel 函数补全到端到端系统优化的开放长时任务,首次量化了前沿模型自主优化 AI 基础设施的潜力与局限。

问题

问题背景

LLM 在推理和代码生成上的能力快速提升,业界开始探索让 LLM 参与开发、优化支撑其自身运行的 LLM 基础设施(如训练/推理 kernel、分布式系统、算子库)。这一方向可能推动 AI 基础设施从手工优化走向 自主演化。

现有方法局限

当前基准主要评测 LLM 在孤立 kernel 函数补全或预定义算子实现上的表现,例如给定函数签名补全 CUDA kernel。这类任务输入输出明确、优化目标预先指定、代码范围局部单一,无法反映真实 LLM 基础设施工程的 开放性 与 长程性。实际工程需要面对未给定的性能目标、跨模块代码改动、系统级性能瓶颈分析、多轮迭代调优等挑战。现有评测无法区分“会写一段算子”与“能设计并优化一个训练/推理子系统”。

为什么这个问题难/重要

LLM 基础设施工程具有 跨栈复杂性:从底层 GPU kernel 到分布式训练框架、推理服务,涉及硬件特性、内存层次、并行策略、调度算法等。模型需要同时具备领域知识、长程规划、代码修改与实证验证能力。优化目标往往不是单一指标,而是延迟、吞吐、显存占用等多目标权衡,需要模型自主探索搜索空间。业界对 自主优化 AI 基础设施 的关注度持续上升,因为这直接关系到模型训练成本与推理效率,是 Scaling Law 之外降本增效的关键路径。

行业类比

类似让编译器参与自身后端优化:就像 LLVM 能用 ML 指导 pass 排序,Φ-Bench 希望评估 LLM 能否反过来优化编译器或运行时,形成“模型优化支撑模型的基础设施”的自举闭环。

核心洞察

  • 现有 LLM 代码基准(如 HumanEval、DS-1000)大多聚焦于孤立 kernel、预定义算子或预指定优化目标,无法评估 LLM 在开放式、长周期 LLM 基础设施工程中的真实能力。Φ-Bench 从 frontier research 优化问题和 real-world code repositories 出发,构建覆盖 kernel 函数完成到端到端系统优化的任务谱系,迫使模型处理跨模块交互、全局资源规划和系统级调试。这一设计使基准与现有工作形成根本差异,直指 LLM 自主优化基础设施所缺失的系统级工程智能。
  • 实验表明,前沿 LLM 在 kernel 级功能完成任务上表现相对较好,但在 long-horizon implementation 和 end-to-end optimization 上能力不足,成功率和实现质量显著降低。这说明 LLM 在真实基础设施工程中的核心瓶颈并非局部代码生成,而是长期规划、跨模块依赖管理和系统级调试。该结果暗示,通往 LLM 自主优化未来 AI 基础设施的道路上,需要重点增强模型对复杂系统架构的理解和全局优化策略的探索能力。

方法

Φ-Bench 的评估流程以真实的 LLM 基础设施工程任务为输入,这些任务源自前沿研究问题与真实代码仓库(如 PyTorch、vLLM)中的 PR/Issue。任务分为三类:Kernel Function Completion (KFC) 要求补全不完整的 kernel 函数以通过测试;Long-Horizon Implementation (LHI) 要求实现跨多文件的完整模块;End-to-End Optimization (E2EO) 要求对给定系统进行全局性能调优。

任务合成经过五步:1. 来源收集与过滤,挑选高质量优化问题;2. 覆盖分类构建,确保任务覆盖算子、编译器、运行时、调度、分布式等层次;3. 基于 PR/Issue 落地,提取真实开发场景;4. Agent 辅助扩充任务变体;5. 专家审查与质量控制。

评价采用双重指标:性能指标 衡量正确性(通过单元测试)与优化幅度(如延迟、吞吐提升);实现指标 评估代码可读性、可维护性及约束遵循。同时引入 作弊检测 防止 LLM 通过绕过测试或利用漏洞得分。

输出为 LLM 生成的代码补丁或完整实现,经自动化测试与人工评审得出最终得分。与同类基准的差异在于:Φ-Bench 聚焦开放式、长时程、端到端的系统级工程,而非孤立算子或预定义优化任务,更贴近真实 AI 基础设施的自主优化场景。

实验

实验设计

Φ-Bench 将 LLM 基础设施工程任务分为三类:Kernel Function Completion (KFC)(内核函数补全)、Long-Horizon Implementation (LHI)(长程实现)和 End-to-End Optimization (E2EO)(端到端优化)。任务来源于前沿研究中的优化问题,并基于真实代码仓库构建,覆盖从局部内核到系统级优化。

关键发现

实验评估多个前沿 LLM,结果显示:LLM 在 KFC 这类局部、定义明确的任务上表现尚可,但在 LHI 和 E2EO 任务上性能显著下降,尤其在需要跨模块协作、长期规划和全局权衡时错误率上升。论文指出,当前 LLM 距离自主优化未来 AI 基础设施仍有明显差距。

与基线对比解读

现有基准多聚焦于孤立算子或固定优化目标,无法反映真实 LLM 基础设施工程中的开放性与长程依赖。Φ-Bench 通过引入真实代码库和三类递进任务,更全面地暴露 LLM 在系统级工程中的短板。其结论强调:单纯提升代码生成能力不足以解决基础设施优化,需要更强的架构理解与迭代调试能力。

行业影响

落地场景

Φ-Bench 可直接用于 AI 基础设施团队的模型选型与能力基线评估,例如在选择哪个 LLM 来辅助 CUDA kernel 优化、分布式训练通信优化或推理引擎参数调优时,参考其在不同任务粒度(KFC / LHI / E2EO)上的得分。对于提供 AI 推理托管服务的云厂商,可将其作为内部 benchmark,筛选出能自动生成高性能算子或端到端系统配置的模型,嵌入到自优化 serving 平台中。

商业价值

主要价值来自 降本:传统 LLM 基础设施优化依赖资深系统工程师手工调优,周期长、人力成本高。若 LLM 能在 Φ-Bench 高分任务上稳定输出可用的 kernel 或系统配置,可将这部分工作从“人工为主”转为“AI 生成 + 人工审核”,减少迭代时间。同时,推理延迟和成本的降低会直接转化为云服务毛利提升。在电商、内容推荐等对实时性敏感的推理场景中,单个算子的微秒级改进乘以海量请求也能带来可观的资源节省。

跟现有产品/工作流的接口

Φ-Bench 可集成到 MLOps / LLMOps 流水线 的评估阶段:

  • 将 benchmark 任务打包为可执行测试集,在 CI 中定期运行,监控候选 LLM 的 infra 工程能力变化。
  • 与 代码仓库 issue 关联:论文中任务合成基于真实 PR 和 issue,因此可直接挂载到 GitHub Actions 或内部 code review 机器人,对提交的优化代码做自动化能力评估。
  • 作为 RLHF 或 RLAIF 的 reward signal 组件:用 Φ-Bench 中可自动判分的性能指标(如 kernel 延迟、内存占用)作为训练信号,驱动模型在 infra 工程任务上持续提升。

具体用例:某内容平台希望用 LLM 优化其推荐模型推理阶段的注意力算子,先用 Φ-Bench 的 kernel 级别任务筛选出在 CUDA 实现上得分最高的模型,再将其生成的算子候选放入内部性能测试环境,通过 A/B 对比决定是否替换现有实现。

局限

  • **任务合成依赖真实代码仓库与 issue/PR**, 但真实仓库可能包含过时实现或特定工程决策, 导致基准测试偏向模型训练数据中常见的模式, 难以覆盖真实世界基础设施工程的全部多样性与动态变化。同时, 来源过滤与任务筛选过程存在一定主观性, 可能引入选择偏差, 影响结果的可比性和普适性。
  • **评估指标多聚焦正确性与性能**, 对代码可维护性、安全性、与现有系统兼容性等工程实践关键维度覆盖不足。在端到端优化任务中, 评价依赖固定的测试用例和性能指标, 而真实系统优化常涉及多目标权衡, 当前指标可能无法全面反映模型决策的合理性, 导致对模型能力的评估过于简化。
  • **实验设置局限于单模型单次尝试**, 缺少对多智能体协作、迭代式调试、人机交互等常见工程场景的评估, 而这些场景对实际基础设施开发非常重要。此外, 基准测试目前规模有限, 社区采用度不高, 可能影响其代表性和长期影响力。
论文Leilei Ding2026-09-09原文

相关内容