PrivFusion自动对齐多机构医疗数据,保护隐私的同时减少人工干预。
PrivFusion: A Privacy-preserving Multi-Agent Framework for Harmonizing Distributed Datasets

- 用多个智能体分析本地数据,自动聚类相似特征并迭代优化转换方案。
- 在4个异构新冠数据集上验证,显著提升多中心数据对齐效率。
- 适合需要跨机构协作但数据敏感的医疗研究团队使用。
临床数据的增多推动了机器学习应用,但敏感健康信息难以集中聚合。联邦学习(FL)提供了分布式替代方案,但各机构数据差异大,数据调和成为关键却常被忽视的前置步骤。我们提出PrivFusion,一种隐私保护的多智能体框架,在联邦训练前自动调和结构化数据。该框架利用智能体分析本地数据,跨站点聚类语义相似特征,并提供迭代转换建议直至对齐。在四个异构新冠数据集上的评估表明,PrivFusion能有效且高效地实现多站点数据调和,大幅降低人工工作量。
原文摘要 · Abstract (English)
The growing availability of clinical data has increased the use of machine learning, yet centralized data aggregation is often infeasible for sensitive health information. Federated Learning (FL) offers a distributed alternative, but its adoption is limited by substantial heterogeneity across institutional datasets, making harmonization a critical but frequently overlooked prerequisite for multi-site analytics. We introduce PrivFusion, a privacy-preserving multi-agent framework that automates the harmonization of structured datasets prior to federated training. PrivFusion uses agents to analyze local data, cluster semantically similar features across sites, and provide iterative transformation recommendations until alignment is achieved. Evaluation across four heterogeneous COVID-19 datasets demonstrates that PrivFusion effectively and efficiently harmonizes multi-site data while substantially reducing manual effort.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。