论文

Functional Attention: 从成对相似性到功能对应

Functional Attention: 从成对相似性到功能对应

许多机器学习应用需要算子学习,即在无限维函数空间之间建立映射。当前基于 transformer 的算子通常依赖 token-wise attention,将连续场视为离散 Token,忽略了全局功能结构。 为解决此问题,我们提出 Functional Attention,将注意力重新解释为自适应基之间的功能对应。受 几何功能映射 启发,该方法用结构化线性算子替代 softmax 相似性,从而得到紧凑、可泛化且分辨率不变的表示,明确捕获全局依赖关系。 实验表明,Functional Attention 在多项算子学习任务中达到 state-of-the-art 水平,包括 PDE 求解、3D 分割 和回归任务,同时对不同离散化方式保持鲁棒。

论文精读

TL;DR Functional Attention 将 Transformer 的点式注意力重新解释为函数空间中的结构化线性对应,用自适应基间的线性算子捕获全局函数结构,实现紧凑且分辨率不变的算子学习。

问题

问题背景

算子学习(Operator Learning)旨在学习无限维函数空间之间的映射,是 AI for Science 中求解偏微分方程、物理仿真与 3D 分割等任务的核心范式。当前研究聚焦于如何以数据驱动方式逼近复杂的函数间变换,使模型能在任意离散化输入上稳定预测连续场输出。

现有方法局限

基于 Transformer 的神经算子普遍采用 token-wise 注意力,将连续场采样为离散 token 序列并计算两两相似度。这类做法存在两个根本局限:

  • 忽略全局函数结构:注意力仅建模令牌间成对亲和度,难以捕捉函数空间的连续性与整体几何约束,导致内在维度远高于实际函数流形。
  • 对离散化分辨率敏感:模型依赖固定点数采样,输入输出必须保持相同粒度;一旦分辨率变化,需重新训练或插值,无法保证预测精度与泛化性。位置编码或局部窗口等改进仍未解决“连续表示”这一核心缺失。

为什么这个问题难且重要

从有限样本学习连续映射本质上是欠定的,需要模型既能提取全局依赖,又对离散化方式不变。技术上要求一种紧凑表示,可跨分辨率建立函数间的对应关系,同时避免因离散粒度变化引起的分布偏移。Functional Attention 受几何函数映射(Functional Maps)启发,将注意力重定义为函数空间间的结构化线性算子,用自适应基展开替代 softmax 成对亲和度,从而显式建模全局交互并天然具备分辨率不变性。这一思路在计算流体力学、蛋白质结构预测、高分辨率气象仿真等需要跨尺度推理的领域具有广泛应用价值,业界对“一次训练、任意分辨率推断”的神经算子需求迫切。

行业类比

如同 Swin Transformer 通过局部分层注意力解决高分辨率图像的计算与泛化瓶颈,Functional Attention 通过函数基之间的线性对应,解决了连续物理场在任意离散化下的映射学习问题,为科学仿真与工程设计提供了更鲁棒的神经算子框架。

核心洞察

  • 从成对亲和力到函数对应的注意力重构:Functional Attention 将 Transformer 中的注意力重新解释为输入函数空间与输出函数空间之间的线性映射,即用一个结构化算子 C 直接建模全局的函数级依赖关系,而非逐 token 计算 softmax 亲和力。这种视角根本区别于点积注意力——后者将连续场离散为固定 token 序列,丢失连续性与全局结构;而 Functional Attention 在自适应基上操作,天然具有分辨率不变性,对不规则采样和网格变换的鲁棒性更强。
  • 关键在于用线性算子替代 softmax 亲和力,实现了紧凑且可泛化的算子学习。受几何函数映射框架启发,方法通过求解一个低秩线性系统获得 C(例如利用最小二乘或伪逆),避免了 token-wise 注意力的二次复杂度。由于基的数量远少于 token 数量,计算和内存开销大幅降低,同时在零样本超分辨率、分布外几何泛化等任务中展现出与 SOTA 相当甚至更优的性能,启示我们:构建算子学习模型时,显式建模函数空间结构比基于 token 的统计关联更高效。

方法

输入与任务定义

Functional Attention 处理的是算子学习问题:从无限维函数空间到输出函数空间的映射。输入函数以离散点上的采样值给出(如 PDE 解场),但模块并不将其视为固定长度的 token 序列,而是看作连续函数在特定分辨率下的观测。

核心模块:函数对应与自适应基

与传统注意力不同,Functional Attention 将注意力重新解释为两组自适应基之间的函数对应,用结构化线性算子取代逐对 softmax 亲和度。流程分为三步:

  1. 基分解:将输入函数投影到一组可学习的(或固定的谱)基函数上,得到表示系数。基的选择影响表达能力——固定谱基(如傅里叶)具有平滑先验,而学习到的自适应基能端到端适配数据分布。
  2. 算子估计:在两组基之间求解一个紧凑的线性映射 C。该过程通过最小二乘(可加 Tikhonov 正则化)直接建立基系数的对应关系,本质是闭式的函数空间线性变换,捕获全局结构而非局部点对点亲和度。
  3. 传输与后投影:用 C 将输入系数映射到输出系数,再通过输出基函数合成连续函数,可在任意位置查询。

输出与性质

输出是一个连续的函数表示,天然具有分辨率不变性——无论训练时使用何种采样,推理时可处理任意离散化的输入或输出,无需重训。实验显示,该表示能零样本超分至更细网格,并在 PDE 求解、3D 分割等任务中保持竞争力。

与同类方法的差异

相比 Transformer 算子的 token-wise 注意力(依赖点积和 softmax 聚合,需保持统一分辨率的序列结构),Functional Attention 用可学习的基间线性求解替代非线性亲和度,从根本上解耦了函数内在表示与离散化,从而在变化的分辨率下鲁棒,且显式建模全局依赖关系。

实验

实验设计

论文在四个连续域任务上评估 Functional Attention (FuncAttn):正弦回归 验证函数连续性;多个经典 PDE 系统(达西流、纳维-斯托克斯、弹性-塑性、翼型、管道、伯格斯方程)测试物理场映射;3D RNA 分割 展示几何泛化;AirfRANS 评估分布外泛化,并附加 零样本超分辨率 与复杂几何实验。所有任务均使用 自适应基 或固定谱基,消融实验分析了基数量、转置投影 vs 伪逆投影、Tikhonov 正则化参数的影响。

关键发现

  • FuncAttn 通过将注意力重新解释为 函数线性对应,避免 token 离散化,实现了 分辨率不变 的表征。
  • 在几乎所有任务上,FuncAttn 匹配或超越现有最先进的神经算子(如 FNOGalerkin TransformerTransolver),尤其在网格分辨率变化时保持稳定的预测误差。
  • 自适应基比固定谱基更有效,适当增加基数量可提升精度,而 Tikhonov 伪逆 的数值稳定性优于直接转置投影。
  • 模型参数量和推理显存远低于 token-wise 注意力,适合大规模输入。

与基线的深度对比

传统 token-wise 注意力 将连续场离散为独立 token,丢失函数全局结构,导致跨分辨率泛化困难。FuncAttn 受 几何函数映射 启发,将输入/输出基之间的对应建模为 结构化线性算子,替代 softmax 相似度。这一设计不仅显式捕获全局依赖,还允许在任意离散化下计算,使模型在 PDE 求解等物理场回归中更鲁棒。相比之下,Transolver 等基于 transformer 的算子仍需大量 token 交互,而 FuncAttn 在紧凑的基空间中求解,计算效率与泛化性均占优。

行业影响

潜在落地场景

Functional Attention 将注意力重新定义为函数基之间的结构化映射,生成紧凑且离散化分辨率不变的算子表示。这使得它在处理连续物理场预测的任务中天然适配,例如:

  • 物理仿真与工程设计:在结构力学、流体力学仿真中,替代传统数值求解器或现有神经算子,实现快速 PDE 求解(如空气动力学外形优化、材料失效预测)。
  • 3D 场景理解与生成:在点云分割、隐式神经表示等任务中,作为全局上下文提取器,对非均匀采样的几何数据保持稳定性能。
  • 科学计算自动化:用于天气预测、分子动力学等需要学习无限维映射的场景,输入和输出可以是任意分辨率的观测。

商业价值

  • 降本增效:通过零样本超分辨率特性和对离散化变化的鲁棒性,大幅降低重新训练或网格适配的成本。在工程仿真中,一次训练即可应对不同精细度的网格,减少高分辨率标注数据的依赖,直接节省计算资源和人工标注成本。
  • 产品体验提升:在实时交互式仿真(如数字孪生、VR/AR 物理模拟)中,利用其紧凑的全局表示能力,可以在低延迟下保持高精度,提升工具链的响应速度和用户体验。
  • 差异化竞争优势:该方法通过显式建模全局函数对应关系,避免了传统 token-wise 注意力对离散序列的过拟合,有望在科学 AI 平台中成为新的标准算子模块。

与现有产品/工作流的接口

  • 模块化集成:Functional Attention 可作为即插即用的全局特征提取层,替换现有 Transformer 架构中的标准自注意力模块。在代码层面,只需实现从 token 到基的投影和线性求解(C = B_Q^+ B_K),即可嵌入主流框架(PyTorch/JAX)。
  • 与仿真工具链对接:训练好的算子模型可以直接导出为 ONNX 或 TorchScript,嵌入到 ANSYS、OpenFOAM 等工业仿真管道中,作为预推理模块加速参数化扫描。
  • 数据兼容性:方法对输入点云或网格无结构要求,可直接处理工业界常见的非结构化数据(如 LAS 格式点云、STL 网格),降低数据预处理门槛。

具体落地用例

  1. 自动驾驶感知与预测:在激光雷达点云的全景分割中,利用 Functional Attention 的分辨率不变性,使模型在不同密度或扫描模式的雷达之间稳定工作,同时作为交通参与者轨迹预测的算子,处理变长时间序列的输入,减少重新校准成本。
  2. 药物分子性质预测:在虚拟筛选中,分子表面的静电势场是连续函数。使用 Functional Attention 学习从分子几何到势场分布的映射,可处理不同精度的量子化学计算网格,加速候选药物评价,降低从头计算开销。

局限

  • **对复杂几何域的泛化能力受限**: Functional Attention 依赖在输入域上定义基函数,当输入域为高度非规则流形或复杂拓扑时,学习自适应基可能无法稳定收敛。论文在 5.5 Complex Geometry 实验中仅测试了简单变形,未验证极端拓扑变化下的鲁棒性;固定谱基(如拉普拉斯特征函数)在非欧几里德域上的推广也缺乏讨论。这限制了该方法在真实世界复杂几何问题(如不规则三维扫描、动态网格)中的应用。
  • **计算效率与基数量之间的权衡**: 虽然该方法通过紧凑的线性算子降低了 token 数量,但构建基(谱分解或可学习投影)和求解线性系统(伪逆或正则化最小二乘)引入了额外开销。复杂度分析(附录 B)显示计算成本随基数量二次增长,当需要大量基来捕获高频细节时,其效率可能低于标准 token-wise attention,尤其在分辨率本身不高时反而增加延迟。
  • **与最新 PDE Transformer 变体的比较不足**: 实验主要在 Neural Operator 标准基准上验证,对比方法多为较早工作(如 FNO、GNOT),但未系统比较最近专为 PDE 设计的 Transformer 架构(如 Galerkin Transformer、位置编码增强的变体等)。论文声称匹配 SOTA,但在更先进的 Transformer 变体上的相对优势可能不明显,且未测试超大规模问题,可扩展性有待验证。
论文Jiefang Xiao2026-05-29原文

相关内容