arXiv:2605.09081cs.LGcs.AI2026-05中稿 · ICML被引 1

首个工业时序数据通用预训练数据集,支持跨设备零样本迁移。

FactoryNet: A Large-Scale Dataset toward Industrial Time-Series Foundation Models

论文配图:FactoryNet: A Large-Scale Dataset toward Industrial Time-Series Foundation Models
图 1 · 摘自论文原文
  • 提出S-E-F-C统一表征框架,将各类工控系统映射到相同语义空间。
  • 涵盖5100万条数据、27类异常,实现跨设备零样本迁移与高效检测。
  • 适合工业AI研究者、智能制造开发者使用,推动工业大模型发展。

我们提出首个面向工业时序数据的通用预训练语料库FactoryNet。该数据集包含5100万条数据,覆盖23000次端到端任务执行(其中13300次为真实数据,9800次为合成数据),涉及六种设备形态,采用统一的S-E-F-C(设定值、努力值、反馈值、上下文)表征架构,实现鲁棒的零样本跨设备迁移与高参数效率的异常检测。数据集涵盖27类标注异常类型,包含健康基线和反事实对,覆盖机器人操作与加工领域。跨设备迁移实验表明,在考虑偏倚的评估指标下,模型在选定源-目标对上展现出公平的迁移能力;24个符合架构的信号即达到与高维基线相当的异常检测性能。FactoryNet作为持续增长的多设备数据集,旨在推动工业基础模型的发展。

原文摘要 · Abstract (English)

We introduce the first universal pretraining corpus for industrial time-series data: FactoryNet. 51M datapoints across 23k end-to-end task executions (13.3k real, 9.8k synthetic) on six embodiments, unified by a shared schema that enables robust zero-shot cross-embodiment transfer and highly parameter-efficient anomaly detection. We introduce a novel schema: Setpoint, Effort, Feedback, Context (S-E-F-C) underlying the whole pipeline that maps any actuated system into a common representational frame. The corpus spans 27 annotated anomaly types alongside healthy baselines and counterfactual pairs across robotic manipulation and machining domains. Cross-embodiment transfer experiments yield positive results: under bias-aware metrics our model demonstrates fair cross-embodiment transfer capabilities on the evaluated source-target pair, while 24 schema-aligned signals achieves competitive anomaly detection performance compared to high-dimensional baselines. We release FactoryNet as a growing, multi-embodiment dataset to drive progress toward industrial foundation models.

工业数据时序模型预训练异常检测

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。