构建儿科社交沟通个性化多任务评估基准,保护隐私同时支持学习追踪与临床预测。
BuddyBench: A Privacy-Constrained Multi-Task Benchmark for Pediatric Social-Communication Personalization

- 整合学习轨迹、临床评估与自评数据,建立统一评估框架。
- 包含189名观察组和86名干预组儿童数据,支持知识追踪与因果推断。
- 提供合成数据集,保障隐私且可复现,适合医疗AI研究者使用。
BuddyBench 提出一个面向儿科社交沟通个性化的隐私约束型多任务评估基准。不同于以往以影像、基因或横断面临床表型为主的神经发育数据库,BuddyBench 在统一框架下关联了逐题学习轨迹、标准化临床评估、BuddyPlan自评量表及随机治疗结局。该基准包含两个队列:ND-03为观察队列,覆盖任务1-2,样本量n = 189;ND-02为随机对照试验队列,用于任务3-4,意向治疗分析样本量n = 86。整体支持知识追踪、下一题推荐、临床预测与因果推断,实现行为个性化与临床评价的联动。此外,引入BuddyBench-Sim合成伴侣数据集,确保评估可复现且保护儿童临床记录隐私。基线实验表明各任务均存在有效信号。
原文摘要 · Abstract (English)
BuddyBench introduces a privacy-constrained multi-task benchmark for pediatric social-communication personalization. Unlike existing neurodevelopmental repositories that primarily emphasize imaging, genetics, or cross-sectional clinical phenotyping, BuddyBench links drill-level learning trajectories, standardized clinical assessments, BuddyPlan self-report, and randomized-treatment endpoints within a unified benchmark schema. BuddyBench combines two cohorts: ND-03 is an observational cohort with dense drill coverage for Tasks1-2 (n = 189), and ND-02 is a randomized controlled trial cohort for Tasks3-4 (n = 86 ITT). Together, they support knowledge tracing, next-drill recommendation, clinical prediction, and causal inference, linking behavioral personalization to clinical evaluation. We additionally introduce BuddyBench-Sim, a synthetic companion dataset for reproducible evaluation. Baselines show signal across tasks while keeping pediatric clinical records protected.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。