arXiv:2607.08915cs.LG2026-07

让GNN学会识别数据缺失模式,显著提升不完整数据的预测性能。

Pattern-Aware Graph Neural Networks for Handling Missing Data

论文配图:Pattern-Aware Graph Neural Networks for Handling Missing Data
图 1 · 摘自论文原文
  • 将缺失特征的位置信息作为显式图节点特征输入GNN
  • 在7个真实数据集上平均提升17%准确率和22%F1值
  • 简单随机嵌入已接近学习型嵌入效果,适合快速部署

真实数据中缺失值普遍存在。传统方法要么丢弃不完整样本,要么使用忽略缺失模式的插补技术,隐含假设缺失是随机的。但缺失模式本身可能携带有用信息。本文提出模式感知图神经网络,将哪些特征缺失的信息与观测值一起编码。采用四种编码策略(学习嵌入、固定随机嵌入、统计特征、分层表示),在七个具有自然缺失结构的UCI数据集上进行实验。所提方法在所有数据集上平均提升17%平衡准确率和22%F1-macro。不同数据集表现差异大:在annealing数据集上平衡准确率提升达80%,而hepatitis和soybean仅提升4-5%。值得注意的是,简单随机模式嵌入(0.650)与学习嵌入(0.663)效果相当,表明区分缺失模式比任务优化更重要。消融实验显示,当具备模式信息时,注意力机制并非必需——仅用均值聚合的模式感知模型达到0.640平衡准确率,接近注意力版本的0.645。

原文摘要 · Abstract (English)

Missing data is ubiquitous in real-world datasets. Traditional methods either discard incomplete samples or apply imputation techniques that ignore potentially informative missingness patterns, implicitly assuming that missingness occurs randomly. However, missingness patterns might provide additional information. We propose pattern-aware graph neural networks that explicitly encode which features are missing alongside observed values. We used four encoding strategies -- learned embeddings, frozen random embeddings, statistical features, and hierarchical representations -- across seven UCI datasets with naturally occurring missingness. Our Pattern-aware methods achieve substantial improvements over baselines, with an average improvement of 17\% in balanced accuracy and 22\% in F1-macro across all datasets. The benefits vary significantly by dataset: annealing shows dramatic improvement (+80\% balanced accuracy), while hepatitis and soybean show minimal gains (+4--5\%). Notably, even simple random pattern embeddings perform comparably to learned embeddings (0.650 vs 0.663 balanced accuracy), suggesting that distinguishing between patterns may be more important than task-specific optimization. Our ablation study reveals that attention mechanisms, while helpful, are not critical when pattern information is available -- simple mean aggregation with pattern awareness achieves 0.640 balanced accuracy compared to 0.645 for attention-based variants.

图神经网络缺失数据模式感知机器学习

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。