arXiv:2605.13292cs.CLcs.AI2026-05ACL

构建首个印地语系多轮医疗对话数据集,助力本地化精准问诊。

IndicMedDialog: A Parallel Multi-Turn Medical Dialogue Dataset for Accessible Healthcare in Indic Languages

论文配图:IndicMedDialog: A Parallel Multi-Turn Medical Dialogue Dataset for Accessible Healthcare in Indic Languages
图 1 · 摘自论文原文
  • 用大模型生成+人工校对构建跨语言多轮医患对话数据
  • 在10种语言上验证模型表现,临床合理性获专家认可
  • 适配小模型量化部署,支持个性化症状追问

现有医疗对话系统多为单轮问答或依赖模板数据,限制了对话真实性和多语言适用性。我们提出IndicMedDialog,一个涵盖英语及九种印地语系语言(阿萨姆语、孟加拉语、古吉拉特语、印地语、马拉地语、旁遮普语、泰米尔语、泰卢固语、乌尔都语)的平行多轮医疗对话数据集。该数据集在MDDial基础上,通过大模型生成合成问诊内容,使用TranslateGemma进行翻译,并经母语者验证,再通过基于脚本的后处理流程修正音素、词汇和字符间距错误。基于此数据集,我们采用参数高效微调方法,对量化的小型语言模型IndicMedLM进行训练,可选患者先验上下文以实现多轮症状采集的个性化。我们在十种语言上评估模型表现,对比零样本多语言基线,并通过医学专家评估验证临床合理性。

原文摘要 · Abstract (English)

Most existing medical dialogue systems operate in a single-turn question--answering paradigm or rely on template-based datasets, limiting conversational realism and multilingual applicability. We introduce IndicMedDialog, a parallel multi-turn medical dialogue dataset spanning English and nine Indic languages: Assamese, Bengali, Gujarati, Hindi, Marathi, Punjabi, Tamil, Telugu, and Urdu. The dataset extends MDDial with LLM-generated synthetic consultations, translated using TranslateGemma, verified by native speakers, and refined through a script-aware post-processing pipeline to correct phonetic, lexical, and character-spacing errors. Building on this dataset, we fine-tune IndicMedLM via parameter-efficient adaptation of a quantized small language model, incorporating optional patient pre-context to personalise multi-turn symptom elicitation. We evaluate against zero-shot multilingual baselines, conduct systematic error analysis across ten languages, and validate clinical plausibility through medical expert evaluation.

医疗对话多语言数据集小模型

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。