arXiv:2503.05775cs.LGstat.ML2025-03中稿 · publication in IEE…被引 2

无真实数据时,用分布相似性评估时间序列插补效果。

Evaluation of Missing Data Imputation for Time Series Without Ground Truth

  • 用Wasserstein距离和Jensen-Shannon散度衡量插补后数据分布与原始数据一致性。
  • 实验验证两指标在无真实标签场景下可有效区分不同插补方法性能。
  • 适合5G等缺乏真实缺失数据的工业场景中模型评估。

时间序列缺失数据处理对第五代移动通信(5G)网络管理等应用中的机器学习模型精度与可靠性至关重要。传统插补验证依赖真实数据,但此类数据通常不可得。本文提出利用Wasserstein距离(WD)和Jensen-Shannon散度(JSD)两个统计指标,在无需真实值的情况下评估插补质量。这些指标通过比较插补数据与原始数据的分布一致性,反映其内在结构匹配程度。我们在多种插补方法上应用并测试了该评估框架,结果表明,WD与JSD能有效评估缺失数据插补质量,尤其适用于真实数据不可获取的场景。

原文摘要 · Abstract (English)

The challenge of handling missing data in time series is critical for maintaining the accuracy and reliability of machine learning (ML) models in applications like fifth generation mobile communication (5G) network management. Traditional methods for validating imputation rely on ground truth data, which is inherently unavailable. This paper addresses this limitation by introducing two statistical metrics, the wasserstein distance (WD) and jensen-shannon divergence (JSD), to evaluate imputation quality without requiring ground truth. These metrics assess the alignment between the distributions of imputed and original data, providing a robust method for evaluating imputation performance based on internal structure and data consistency. We apply and test these metrics across several imputation techniques. Results demonstrate that WD and JSD are effective metrics for assessing the quality of missing data imputation, particularly in scenarios where ground truth data is unavailable.

时间序列插补评估无真值

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。