arXiv:2506.18194cs.LG2025-06被引 1

用自监督学习预训练聚合物分子图,少标签时也能提升预测性能。

Joint Embedding Predictive Architecture for self-supervised pretraining on polymer molecular graphs

  • 基于联合嵌入预测架构,无标签数据上预训练分子图
  • 标签数据极少时,下游任务性能显著提升
  • 适合数据稀缺的聚合物材料研发场景

机器学习在加速发现具有特定性能的聚合物方面展现出潜力,例如通过属性预测进行虚拟筛选。然而,聚合物机器学习的发展受限于高质量标注数据集的匮乏,而这些数据是训练有监督模型所必需的。本文研究了最新的联合嵌入预测架构(JEPA)在聚合物分子图上的自监督学习应用,旨在探究该自监督策略的预训练能否在标签数据稀缺的情况下提升下游性能。结果表明,基于JEPA的自监督预训练能有效提升聚合物图的下游任务表现,尤其在标签数据极有限时,所有测试数据集均观察到性能改善。

原文摘要 · Abstract (English)

Recent advances in machine learning (ML) have shown promise in accelerating the discovery of polymers with desired properties by aiding in tasks such as virtual screening via property prediction. However, progress in polymer ML is hampered by the scarcity of high-quality labeled datasets, which are necessary for training supervised ML models. In this work, we study the use of the very recent 'Joint Embedding Predictive Architecture' (JEPA), a type of architecture for self-supervised learning (SSL), on polymer molecular graphs to understand whether pretraining with the proposed SSL strategy improves downstream performance when labeled data is scarce. Our results indicate that JEPA-based self-supervised pretraining on polymer graphs enhances downstream performance, particularly when labeled data is very scarce, achieving improvements across all tested datasets.

聚合物材料自监督学习分子图

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。