arXiv:2607.17178cs.LGcs.AI2026-07

针对回归任务中的数据分布不均问题,提出密度感知的平衡框架。

DADIR: Density-Aware Data-level Imbalanced Regression Framework

论文配图:DADIR: Density-Aware Data-level Imbalanced Regression Framework
图 1 · 摘自论文原文
  • 根据目标空间密度变化自适应划分区域,避免固定分区偏差
  • 在稀疏区域保留特征表示,合成样本更贴近真实结构
  • 无需修改模型架构,适合各类回归任务的轻量级改进

不平衡学习解决数据分布中少数区域被低估的建模问题。尽管分类任务中已有广泛研究,但回归任务因目标变量连续且密度分布异质而更具挑战性。现有数据级方法常依赖固定分区或生成合成样本,未兼顾密度变化与局部特征结构。本文提出DADIR——一种密度感知的数据级不平衡回归框架,包含三个组件:(1) 密度感知自适应分区(DAAP),依据密度变化递归划分目标空间;(2) 密度正则化条件变分自编码器(DR-CVAE),在学习潜在特征的同时保留稀疏区域表征;(3) 潜在空间数据平衡,结合特征级聚类与过采样生成结构一致的合成样本。三者协同提升对少数区域的识别能力,保持稀疏区信息,并生成逼真合成数据。最终平衡数据可直接用于现有回归模型,无需调整网络结构或损失函数。在多个不平衡回归数据集上的实验表明,该方法在少数区域预测性能显著提升,同时整体准确率也得到改善。

原文摘要 · Abstract (English)

Imbalanced learning addresses predictive modeling problems with underrepresented regions of the data distribution. Although widely studied in classification, imbalanced regression remains challenging because of continuous target variables and heterogeneous density distributions. Existing data-level methods often rely on fixed target partitioning or synthetic sample generation without jointly considering density variations and local feature-space structure. We propose DADIR, a Density-Aware Data-level Imbalanced Regression framework that exploits density information throughout the balancing process. DADIR comprises three components: (1) Density-Aware Adaptive Partitioning (DAAP), which recursively partitions the target space according to density variations; (2) a Density-Regularized Conditional Variational Autoencoder (DR-CVAE), which preserves sparse-region representations while learning latent features; and (3) latent-space data balancing, which combines feature-level clustering with oversampling to generate structurally consistent synthetic samples. Together, these components identify minority regions more effectively, preserve sparse-region information, and generate realistic synthetic data. The resulting balanced dataset can be used directly with existing regression models without modifying their architecture or learning objective. Experiments on diverse imbalanced regression datasets demonstrate consistent improvements in predictive performance, particularly in underrepresented regions, while also improving overall accuracy.

回归分析不平衡学习密度感知数据增强

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。