论文

等离子体诊断模型中传感器鲁棒性的基准测试:基于TokaMark的系统评估

等离子体诊断模型中传感器鲁棒性的基准测试:基于TokaMark的系统评估

等离子体诊断模型通常在干净、完整的传感器数据上进行评估。然而在实践中,聚变诊断设备频繁出现故障:采集系统启动延迟、单个传感器失效、信号丢失在等离子体破裂临近时尤为集中。我们首次对等离子体诊断机器学习模型进行系统鲁棒性基准测试,使用包含 11573 个 MAST 放电的 TokaMark 数据集,评估了 XGBoost、LSTM、Transformer 以及 TokaMark CNN 基线模型在六种物理故障场景和三种插值策略下的表现。 我们引入了 鲁棒性评分 (RS) 以进行跨架构标准化比较。核心发现是:破裂临近的传感器故障(在最后窗口时间步注入损坏)导致序列模型性能崩溃(LSTM 的 NRMSE 增加 +212%),而基于统计特征的模型(XGBoost)相对稳定(仅 +37%)。前向填充插值几乎消除了随机丢失对序列模型的影响(LSTM 的 NRMSE 从 +57% 降至约 0%),但当窗口末尾被损坏时作用甚微。 使用真实破裂时间戳进行放电级报警评估发现:在临近传感器故障下,LSTM 报警检测的 TPR 降至 0.00,而均值填充插值将其恢复至 1.00——这与在 NRMSE 中观察到的模式相反。等离子体电流 Ip 被确定为所有架构中最关键的诊断量,移除后性能下降 73% 至 140%。 代码、数据和训练好的检查点已开源:https://github.com/Neerav-Gupta/tokamark-robustness。

论文精读

TL;DR 首次系统评估托卡马克等离子诊断模型传感器鲁棒性:邻近中断的失效使LSTM NRMSE激增212%,XGBoost仅增37%,并引入鲁棒性分数(RS)。

问题

问题背景

托卡马克装置中等离子体破裂预测是保障装置安全的关键AI任务,模型需基于多通道诊断信号进行实时预测。

现有方法局限

  • 现有模型多在完整、干净数据上训练与评估,忽略了实际操作中频繁发生的传感器故障。
  • 故障模式多样:数据采集延迟、传感器死亡、信号随机丢失,且在破裂临近时故障往往集群式发生
  • 缺乏系统的鲁棒性基准测试,不同架构(时序模型 vs. 统计模型)对故障的敏感程度未知。
  • 缺失值处理策略(如零填充、均值填充)的有效性未经严格验证。

挑战与重要性

  • 故障与破裂事件耦合:传感器故障在关键窗口(如破裂前最后几步)出现,导致序列模型预测性能崩溃(如LSTM NRMSE增加212%)。
  • 警报系统失效:破裂临近故障可使警报真阳性率降至0,严重威胁装置安全。
  • 实际装置(如ITER)的诊断系统不可避免会出现故障,因此模型鲁棒性评估与缓解策略成为从研究走向部署的瓶颈
  • 该工作首次引入鲁棒性评分(Robustness Score),为不同架构提供统一比较基准。

行业类比

如同自动驾驶车辆在危险时刻激光雷达失效导致感知系统崩溃,聚变诊断模型在破裂临近时遭遇传感器故障也会引发灾难性失效,亟需类似冗余与故障恢复机制。

核心洞察

  • 序列模型在破裂邻近传感器故障下性能崩溃,而基于统计特征的模型保持相对稳定。这是因为 LSTM/Transformer 等架构的归纳偏置使其严重依赖时间窗口末端(最接近破裂时刻)的信号完整性,一旦最后几个时间步被污染,预测误差急剧放大(LSTM NRMSE +212%),但 XGBoost 仅增加 37%。这表明在实际部署中,若预期传感器故障聚集在事件临界区,应优先考虑对短时缺失不敏感的特征工程模型,而非纯粹端到端的序列学习器。
  • 均值填充对回归误差改善有限,却能反转报警检测指标:LSTM 的报警真阳性率(TPR)从 0.00 直接恢复到 1.00。这一“警报指标逆转”揭示鲁棒性评估不能仅依赖 NRMSE 等点预测损失,任务相关的决策指标(如报警召回)可能对填充策略更敏感。均值填充过度补偿了缺失值,虽让回归更平滑,却可能引入假阳性风险,这对高可靠性要求的托卡马克破裂预警系统设计有直接启示:需联合优化信号重建与报警阈值。

方法

输入与任务定义

输入为 MAST 托卡马克 11,573 次放电(shots)的多通道诊断时序信号,采样窗口固定为等离子体电流猝灭前一段时间,预测目标为未来电流值(回归任务)。同时还衍生出shot 级警报任务,即根据真实中断时间戳判断是否应触发警报。

关键模块与评估设计

  • 候选架构:包括手工统计特征模型 XGBoost、序列模型 LSTMTransformer 以及 TokaMark 基线 CNN。各模型统一从原始多变量时序中提取信息,输出单点预测或序列预测。
  • 破坏场景(corruption scenarios):为模拟实际中传感器故障,设计六种物理合理的故障注入方式:
    1. 随机丢失(随机将部分时间点置零)
    2. 通道消融(完全移除某一诊断信号)
    3. 类别级通道重要性(按物理类别分组消融)
    4. 时间间隙(在窗口前段或后段引入连续缺失)
    5. 相关诊断组同时故障(按物理相关性同时丢失多个信号)
    6. 接近中断的故障(恰恰在最后若干时间步注入破坏,模拟中断前夕传感器失效)
  • 缓解策略:对比三种简单插补方法——零填充均值填充前向填充,评估其恢复模型性能的效果。
  • 评价指标:回归精度用 NRMSE,警报性能用 TPR/FPR,并引入鲁棒性得分(Robustness Score, RS) 将多种故障条件下的性能统一成一个标量,便于跨架构对比。

输出与分析框架

对每个模型分别计算清洁数据基线、各故障场景下的指标,以及采用不同插补后的恢复情况。通过对比,揭示时序模型(如 LSTM、Transformer)更易受到接近中断的末尾故障影响,而 XGBoost 基于统计特征的模型相对稳定

与同类工作的差异:以往等离子体诊断 ML 几乎全部在完整、干净的传感器上评估,本研究是首个系统性地注入真实物理故障并度量各架构鲁棒性的基准,弥补了从方法论到实践推荐的鸿沟。

实验

实验设计

基于 TokaMark 数据集 11,573 次 MAST 放电,评估四类模型:XGBoostLSTMTransformerTokaMark CNN Baseline,模拟六种物理真实的传感器故障场景——包括随机丢失、通道消融、时间缺口、相关组失效以及最关键的 临近破裂故障(窗口末尾时间步注入损坏)。同时测试零填充、均值填充、前向填充三种插补策略,并引入 鲁棒性评分 (Robustness Score, RS) 实现标准化跨架构比较。评估指标包括连续值预测的 NRMSE 和 shot 级告警的 TPR 等。

关键发现

  • 架构鲁棒性两极分化:临近破裂故障下,序列模型 (LSTM) NRMSE 飙升 +212%,而统计特征模型 (XGBoost) 仅增加 +37%,暴露时序模型对末尾输入的强烈依赖。
  • 插补策略效果迥异:随机丢失使 LSTM NRMSE 增加 57%,但 前向填充几乎完全消除退化(降至 ≈0%);然而对末尾损坏,前向填充效果甚微,因为过去值无法预测未来故障。
  • 告警指标逆转:临近故障时 LSTM 的 TPR 崩溃至 0.00,但 均值填充可恢复至 1.00,与 NRMSE 的规律相反——说明不同任务对缺失处理策略的敏感性截然不同。
  • 信号重要性:等离子体电流是全局最关键诊断,其缺失使所有模型 NRMSE 上升 +73% 至 +140%

解读与启示

该研究首次系统量化了等离子体诊断模型的传感器鲁棒性,揭示了 时序归纳偏置是一把双刃剑:LSTM/Transformer 在干净数据上能捕捉动态,但对末尾时间步损坏极度脆弱,因其预测高度依赖近期序列上下文;而 XGBoost 仅使用统计特征聚合,天然对局部缺失不敏感。前向填充能有效修复随机缺失,但无法处理突发性末尾故障,提示实际部署中需结合 故障检测与自适应插补。告警指标的逆转则警示:回归性能的鲁棒性不一定迁移到离散告警任务,需针对下游任务独立验证。这项工作为 ITER 等高可靠性聚变装置提供了一套可复现的鲁棒性测试框架,并强调了 前向填充作为实用轻量基线鲁棒性评分 的价值。

行业影响

跨行业传感器鲁棒性基准的启示

核聚变等离子体诊断的鲁棒性研究虽聚焦 Tokamak 装置,但其方法论——系统化故障注入、多架构对比与简单填充策略的效果验证——直接适用于任何依赖时序传感器数据的工业 AI 系统。

落地场景

  • 预测性维护:电机/轴承振动传感器常在故障前失效,需评估模型在信号丢失下的预测能力。
  • 自动驾驶:激光雷达/摄像头在雨雾或脏污时出现随机缺失或连续遮挡,可借鉴 forward-fillmean-fill 策略。
  • 医疗监护:ICU 生理信号可能因接触不良而脱落,要求模型在窗口末端缺失时仍能触发警报。
  • 能源管理:电网 PMU 数据同步丢失时,需要快速检测异常扰动。

商业价值

  • 降本:减少因传感器故障导致的误报警而触发的非计划停机或人工复核成本;通过鲁棒性评分筛选出故障下性能衰减最小的模型上线,避免事后救火。
  • 增收:保证关键安全应用(如自动驾驶紧急制动)的可用性,杜绝因传感器失效导致的功能降级,维持产品竞争力。
  • 体验提升:在客户侧呈现持续、稳定的服务,即使底层数据流受损,系统仍能提供平滑的结果(如推荐/排序模型在特征缺失时仍保持合理性)。

与现有产品/工作流的接口

可直接集成到 MLOps 管线的模型验证环节:

  1. 数据管道增加故障模拟模块,按物理实际故障模式生成损坏推流;
  2. 评估环节加入 NRMSERobustness Score 及任务相关指标(如警报召回率)的对比;
  3. 服务网关内置简单的 forward-fillmean-fill 填充节点,作为模型输入的前置处理,在检测到缺失时自动激活。

具体落地 Use Case

  • 工业机器人关节力矩预测:当力矩传感器在动作急停阶段(相当于“临近事件”窗口)失效时,XGBoost 类特征模型若比 LSTM 稳定,可直接选用或在 LSTM 前串行 mean-fill 恢复性能,避免碰撞风险。
  • 流媒体用户体验预测:CDN 节点上报的卡顿率、延迟等指标存在采集间隔缺失,使用 forward-fill 填补可保证下游预警模型不至于崩溃,维持服务质量监控的连续性。

局限

  • 实验仅在 MAST 单一托卡马克装置与 Task 4-4(等离子体电流猝灭预测)上进行,未跨装置验证,所得结论向 ITER 或其他装置的迁移性存疑;文中虽讨论了 ITER 类装置的启示,但缺乏实际数据或跨装置实验支撑,模型与填充策略的泛化能力仍有待检验。
  • 评估的模型架构限于 XGBoost、LSTM、Transformer 和 TokaMark CNN 四种,未涵盖如 GNN、Foundation Model 等潜在适用架构,且注入的六种传感器故障场景虽具物理合理性,却未必能穷尽真实环境中非平稳、时变故障的复杂模式,对故障空间覆盖不足。
  • Robustness Score 设计简单直观,但其依赖于单一参考模型(clean-data baseline)的归一化,可能受基线性能波动影响,且未考虑多指标权衡(如计算成本、维护复杂度),实际工程决策中需结合更多维度评估稳健性。
论文Neerav Gupta2026-07-05原文

相关内容