arXiv:2609.06976cs.LG2026-09

构建糖尿病可穿戴设备数据问答基准,评估大模型长期健康推理能力。

HealthLoopQA: A Context-Aware Question Answering Benchmark for Interpreting Wearable Monitoring Data in Diabetes Care

论文配图:HealthLoopQA: A Context-Aware Question Answering Benchmark for Interpreting Wearable Monitoring Data in Diabetes Care
图 1 · 摘自论文原文
  • 基于11种核心推理能力设计127个任务,覆盖30天长周期分析
  • 引入故障注入模拟测试,验证模型对设备异常的识别能力
  • 发现大模型在长时序推理中存在上下文惰性问题,适合医疗AI研究者

随着医疗可穿戴设备融入慢性病日常管理,有效解读连续监测数据对患者和临床医生理解健康趋势、发现安全事件、做出决策至关重要。尽管大语言模型(LLMs)有望将流式生理数据转化为个性化健康洞察,但评估其在多样化监测任务中的推理能力与分析严谨性仍是一大挑战。现有医学可穿戴设备问答基准多聚焦短期分类或统计摘要,忽视了真实部署中长期模式、治疗与行为背景及潜在系统故障。为此,我们提出HealthLoopQA,一个全面的诊断基准,用于评估LLM在连续糖尿病监测数据上的推理能力。基于全新十一类原子推理能力,HealthLoopQA包含127个任务和超过1,500个问答实例,覆盖过程挖掘、异常检测与预测,时间跨度达30天。为系统评估安全意识,我们在真实数据基础上引入故障注入模拟测试平台,模拟多种设备故障与网络物理攻击,生成生理上合理的危险场景。在提示与智能体框架下评估先进LLMs,发现其在复杂时间模式挖掘中存在严重局限。此外,我们揭示了长上下文提示下的‘上下文惰性’现象,凸显将LLM应用于严格长周期医疗推理的关键开放挑战。

原文摘要 · Abstract (English)

As medical wearables become integrated into daily chronic disease care, effectively interpreting longitudinal monitoring data is essential for patients and clinicians to understand health trends, detect safety-critical events, and make informed decisions. While large language models (LLMs) show promise for transforming this streaming physiological data into personalized health insights, evaluating their reasoning capability and analytical rigor in diverse monitoring tasks remains a fundamental challenge. Existing medical wearable question answering (QA) benchmarks primarily assess short-horizon classification or statistical summaries, largely ignoring the long-term patterns, therapeutic and behavioural contexts, and potential system failures inherent in real-world deployments. To address this, we introduce HealthLoopQA, a comprehensive diagnostic benchmark for evaluating LLM reasoning over continuous diabetes monitoring data. Grounded in a novel taxonomy of eleven atomic reasoning abilities, HealthLoopQA comprises 127 tasks and over 1,500 QA instances spanning process mining, anomaly detection, and prediction over 30-day horizons. To systematically evaluate safety awareness, we complement real-world datasets with a fault-injected simulation testbed modeling diverse device malfunctions and cyber-physical attacks to generate physiologically plausible hazard scenarios. Evaluating state-of-the-art LLMs across prompting and agentic frameworks reveals severe limitations in complex temporal pattern mining. Furthermore, we identify a broader phenomenon of In-context Laziness under long-context prompting, highlighting critical open challenges in deploying LLMs for rigorous long-horizon medical reasoning.

医疗AI长时序推理可穿戴设备大模型评测

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。