用视觉变压器与Mamba融合模型分析眼动数据,提升自闭症诊断准确率。
Hybrid Vision Transformer-Mamba Framework for Autism Diagnosis via Eye-Tracking Analysis
- 结合ViT与Mamba捕捉眼动数据的空间和时间特征
- 在Saliency4ASD数据集上达到96%准确率
- 结果可解释,适合资源有限地区筛查使用
准确的自闭症谱系障碍(ASD)诊断对早期干预至关重要。本研究提出一种融合视觉变压器(ViT)与视觉Mamba的深度学习框架,利用眼动数据检测自闭症。该模型通过基于注意力的融合机制整合视觉、语音和面部线索,捕捉时空动态特征。相比传统手工方法,采用前沿深度学习与可解释AI技术,提升诊断准确率与透明度。在Saliency4ASD数据集上,所提ViT-Mamba模型表现优异,准确率达0.96,F1分数为0.95,灵敏度0.97,特异性0.94。结果表明该模型具备在资源受限或远程临床环境中实现可扩展、可解释的自闭症筛查潜力。
原文摘要 · Abstract (English)
Accurate Autism Spectrum Disorder (ASD) diagnosis is vital for early intervention. This study presents a hybrid deep learning framework combining Vision Transformers (ViT) and Vision Mamba to detect ASD using eye-tracking data. The model uses attention-based fusion to integrate visual, speech, and facial cues, capturing both spatial and temporal dynamics. Unlike traditional handcrafted methods, it applies state-of-the-art deep learning and explainable AI techniques to enhance diagnostic accuracy and transparency. Tested on the Saliency4ASD dataset, the proposed ViT-Mamba model outperformed existing methods, achieving 0.96 accuracy, 0.95 F1-score, 0.97 sensitivity, and 0.94 specificity. These findings show the model's promise for scalable, interpretable ASD screening, especially in resource-constrained or remote clinical settings where access to expert diagnosis is limited.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。