真实阀门的世界模型:从未见过故障,五秒内检出
在上一部分中,实验台是一座模拟的迷你热电厂:方便、可控,但终究 是世界的模型,而不是世界本身。真正的问题依然悬而未决:这套配方 在真实数据上是否成立?本文就是答案。我们选取了工业故障检测的经 典基准测试之一——一家波兰糖厂气动阀门的遥测数据,记录于 2001 年——并应用了几乎未经改动的同一套流程。先把结论说在前面:对于 仪表盘能够呈现的故障,模型在其发生后五秒之内即可检出,而 训练中从未见过任何一个故障。
实验台:一台真实的阀门
这个基准测试叫 DAMADICS,为比较工业执行器的诊断方法而设。数据 是真实的遥测:卢布林糖厂的三台气动阀门,于 2001 年 11 月观测了 25 天,每个物理量每秒一个采样点。对我们选定的流量阀(编号 FC57_03)而言,六个物理量各自超过两百万个采样点:控制器输出、 阀杆位置、流量、上游与下游压力、温度。
在正常运行之中,该基准记录了 19 个故障事件,分属四种类型:气 源中断、上游压力突升、旁通阀开启、流量传感器故障。这些故障都很 短——从十四秒到几分钟——由作者有意注入,起止时刻精确到秒并有 记录。对我们而言这是宝贵的真实标签:可以用来衡量检出率与延迟, 而在仿真中这些只能手工构造。
从遥测到仪表盘
LeWorldModel 用图像说话;阀门则用时间序列说话。桥梁在于把遥测 变成图像:每个五秒的块变成一张 224×224 的仪表盘——阀杆位置和 流量用两个指针式仪表,控制器输出和两个压力用水平条,温度用一个 细指示条。模型每一步接收的动作,是该块内控制器输出的五个数值。 诚实性约束:进入仪表盘的只有传感器真实测量的物理量;故障标签留 在外面,保存在仅用于评估的元数据中。
训练:只用正常运行数据
从 25 天中我们只保留了健康时段:81 个正常运行片段, 423,567 个五秒块。配方不变,从零开始训练,在一块租用的 GPU 上 跑了八个 epoch,损失趋于平稳时停止。至于故障,模型再一次连个影 子都没见过:它只学会了根据近期历史和控制器当前的动作,预测下一 个遥测块。
数据结果
评估将阀门故障周围记录的六个窗口——认证起始时刻前后各五分钟 ——与从健康时段抽取的三十个对照窗口进行对比。报警阈值沿用一贯 的规则:正常运行误差的均值加三个标准差。
在流量传感器故障上,结果干净利落:AUC 1.000,三个窗口 全部检出,惊讶度在故障起始后的第一个块就越过阈值——五 秒。误差飙升至基线的一百倍,并在约二十个块内回落,与故障的 实际持续时长相吻合。在最短的压力突升故障(十四到二十二秒)上, 三个窗口检出两个:漏检的是最短的一个,在仪表盘上留下的特征过于 微弱——误差始终低于阈值的一半。必须如实说明:围绕这个基准二十 年的文献都采用专门的方法,有监督的或统计的,且都在故障样本上训 练过;我们的模型一个故障样本都没见过,六个窗口中五个即刻识别。
演示:实时运行的传感节点
最好的评判方式是亲眼看它工作。交互式演示把 2001 年 11 月 17 日真 实的两个小时——包含五次故障的那段——以实时流的形式重放:模型 所见的仪表盘(原始帧,而非重建)、带阈值的惊讶度曲线、触发的报 警。以真实速度播放,它和现实一样持续两小时;以 240× 播放,三十 秒即可看完。这是对一个挂在阀门上的传感节点将会如何行事的总预 演:没有云,没有标签,只有一个会感到惊讶的模型。
尚缺什么
三个明确声明的局限。第一:评估只覆盖了三个执行器中的一个、四 种故障类型中的两种——其余阀门和其余故障还在等待各自的训练。 第二:短促的压力突升仍是弱点;加强它的途径是更细的时间粒度,或 对压力更敏感的仪表。第三:那个决定一切的数字——把模型挂在阀门 上运行需要多少硬件——目前还只是粗略估算(GPU 上每块三毫秒, 笔记本 CPU 上约五十毫秒,而块本身是五秒),必须在真实受限硬件 上实测。这是本研究路线的下一个实验。
但方向是对的:在仿真电厂中行之有效的同一套配方,在真实遥测上 同样成立,而且得出的数字是维护工程师用得上的。一个小型世界模型, 只在正常运行数据上训练,就可以守在一个部件旁边站岗。剩下要做的, 是测量承载它的硬件究竟能小到什么程度。
注释与参考
这是一个系列的第四部分:前几部分分别是理论、对他人模型的验证、 仿真工厂。 模型是 LeWorldModel (Maes et al., 2026),建立在 LeJEPA (Balestriero & LeCun, 2025)之上;训练使用公开的 le-wm 代码,基于 stable-worldmodel。 数据是 DAMADICS 基准测试(Bartyś & Syfert,《DAMADICS Benchmark Definition》, 2002),记录于卢布林糖厂。
方法说明:5 秒块(1 Hz 下 5 个采样点);帧为块均值的仪表盘; 动作 = 控制器输出的 5 个数值,在训练集上标准化;惊讶度 = 预测潜 在表示(3 块历史 + 动作)与下一真实帧的潜在表示之间的平方误差; 阈值 = 30 个无故障对照窗口上的均值 + 3σ,在稳态块上估计;延迟 = 故障起始后第一个误差超过阈值的块,以 5 秒块计;训练结束时的验 证损失为 0.024,已连续三个 epoch 处于平台期。