arXiv:2602.19158cs.AI2026-02

将医学文献转化为可执行的因果代码,实现可审计的临床推理。

DoAtlas-1: A Causal Compilation Paradigm for Clinical AI

  • 把医学文本证据转为结构化因果对象,明确干预、时间、人群等要素。
  • 在10,000人数据集上验证,查询可执行率达80.5%,标准化准确率98.5%。
  • 适合需要可验证因果分析的临床研究者和AI系统开发者。

医学基础模型虽能生成叙述性解释,却无法量化干预效果、检测证据冲突或验证文献主张,限制了临床可审计性。我们提出因果编译范式,将医学证据从叙述文本转化为可执行代码。该范式将异构研究证据标准化为结构化估计量对象,每个对象明确定义干预对比、效应尺度、时间范围和目标人群,支持六类可执行因果查询:do-演算、反事实推理、时间轨迹、异质效应、机制分解和联合干预。我们基于此构建DoAtlas-1,通过效应标准化、冲突感知图构建和真实世界验证(人类表型项目,10,000名参与者),从754项研究中编译出1,445个效应核。系统达到98.5%的规范化准确率和80.5%的查询可执行率。该范式推动医疗AI从文本生成转向可执行、可审计、可验证的因果推理。

原文摘要 · Abstract (English)

Medical foundation models generate narrative explanations but cannot quantify intervention effects, detect evidence conflicts, or validate literature claims, limiting clinical auditability. We propose causal compilation, a paradigm that transforms medical evidence from narrative text into executable code. The paradigm standardizes heterogeneous research evidence into structured estimand objects, each explicitly specifying intervention contrast, effect scale, time horizon, and target population, supporting six executable causal queries: do-calculus, counterfactual reasoning, temporal trajectories, heterogeneous effects, mechanistic decomposition, and joint interventions. We instantiate this paradigm in DoAtlas-1, compiling 1,445 effect kernels from 754 studies through effect standardization, conflict-aware graph construction, and real-world validation (Human Phenotype Project, 10,000 participants). The system achieves 98.5% canonicalization accuracy and 80.5% query executability. This paradigm shifts medical AI from text generation to executable, auditable, and verifiable causal reasoning.

因果推理医学AI可审计性

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。