构建首个高亮度对撞机探测器级数据集,支持机器学习研究
ColliderML: The First Release of an OpenDataDetector High-Luminosity Physics Benchmark Dataset
- 基于标准模型与新物理过程生成百万级模拟事件
- 包含真实堆叠效应和探测器响应,覆盖10类物理过程
- 开源开放,适配机器学习研究,平台兼容性好
我们介绍ColliderML——首个在高亮度大型强子对撞机条件(√s=14 TeV,平均堆叠数μ=200)下,通过完整模拟与数字化处理生成的开放、实验无关的质子-质子碰撞数据集。该数据集包含一百万事件,涵盖十类标准模型与超越标准模型的物理过程,以及大量单粒子样本,均采用先进的下一领头阶矩阵元计算与喷注演化方法生成,引入真实每事件堆叠叠加,并基于已验证的OpenDataDetector几何结构与标准重建流程。此次发布填补了机器学习研究在探测器级数据上的空白,数据通过友好支持机器学习的Hugging Face平台提供。本文介绍了物理覆盖范围、生成与重建流程、数据格式与访问方式,并给出了初步的对撞机物理基准测试。
原文摘要 · Abstract (English)
We introduce ColliderML - a large, open, experiment-agnostic dataset of fully simulated and digitised proton-proton collisions in High-Luminosity Large Hadron Collider conditions ($\sqrt{s}=14$ TeV, mean pile-up $μ= 200$). ColliderML provides one million events across ten Standard Model and Beyond Standard Model processes, plus extensive single-particle samples, all produced with modern next-to-leading order matrix element calculation and showering, realistic per-event pile-up overlay, a validated OpenDataDetector geometry, and standard reconstructions. The release fills a major gap for machine learning (ML) research on detector-level data, provided on the ML-friendly Hugging Face platform. We present physics coverage and the generation, simulation, digitisation and reconstruction pipeline, describe format and access, and initial collider physics benchmarks.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。