arXiv:2605.26161cs.LGcs.AI2026-05被引 1

检测时间序列大模型训练数据污染,发现异常快速适应的样本

TSFMAudit: Data Contamination Auditing in Forecasting Time Series Foundation Models

  • 通过微调探针的适应动态识别数据污染
  • 在187个数据集上验证,比10个基线更准确
  • 首个针对时间序列大模型的污染审计方法

时间序列基础模型(TSFMs)正越来越多地在大规模语料上预训练,引发担忧:评估数据集可能在预训练阶段已被暴露,导致性能估计过于乐观。对时间序列而言,审计此类污染极具挑战性,因为信号连续且异质,常缺乏语料文档支持。据我们所知,这是首个研究TSFM预训练污染审计的工作。本文形式化了该问题,并提出基于探针适应动态的TSFMAudit方法。核心思路是:污染表现为异常高效的适应——在微调探针后,污染数据集表现出更快的损失下降和更小的主干参数移动。我们在6个TSFMs和187个数据集上进行评估,使用已知训练来源证据作为监督,并与10个从大语言模型文献中适配的基线方法对比。

原文摘要 · Abstract (English)

Time series foundation models (TSFMs) are increasingly pretrained on large corpora, raising concerns that evaluation datasets may have been exposed during pretraining and thus yield overly optimistic performance estimates. Auditing such contamination is challenging in time series because signals are continuous and heterogeneous, and often lack corpus documentation. To the best of our knowledge, this is the first work to study pretraining contamination auditing for TSFMs. We formalize the problem of pretraining contamination auditing for TSFMs and propose TSFMAudit, a method based on probe adaptation dynamics. Our key intuition is that contamination manifests as unusually efficient adaptation: after a fine tuning probe, contaminated datasets tend to exhibit faster loss reduction with smaller backbone movement. We evaluate TSFMAudit on 6 TSFMs and 187 datasets using documented training source evidence as supervision, and compare against 10 competitive baselines adapted from the LLM literature.

时间序列数据污染模型审计

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。