arXiv:2606.08364cs.CVcs.AI2026-06

用自监督ViT模型检测CBCT中的颞下颌关节骨关节炎,仅需部分微调即达高准确率。

Self-Supervised Vision Transformers for CBCT-Based Detection of Temporomandibular Joint Osteoarthritis

论文配图:Self-Supervised Vision Transformers for CBCT-Based Detection of Temporomandibular Joint Osteoarthritis
图 1 · 摘自论文原文
  • 用冻结或部分微调的ViT编码每层CBCT切片,再通过注意力MIL聚合分类
  • 仅微调最后两层变压器块,AUC从0.671提升至0.902,优于所有基线
  • 为低数据医疗影像提供可复用的模型适配策略,适合医学影像研究者

颞下颌关节骨关节炎(TMJ OA)是一种常见退行性病变,其骨性改变在锥形束CT(CBCT)上常不明显,导致自动检测困难。本文研究DINO系列自监督视觉变换器(DINOv1、DINOv2、DINOv2+reg和RAD-DINO)在CBCT上的迁移能力,探讨所需骨干网络适配程度及类型。提出一种基于切片的简单流程:使用冻结或部分微调的视觉变换器(ViT)编码轴向CBCT切片,并通过注意力多实例学习(MIL)进行患者级二分类(OA/正常)。在多源CBCT数据集上系统消融分析不同解冻策略与聚合设计后发现,仅微调最后两个变压器块是关键因素,使AUC从全冻结的DINOv2(0.671)提升至0.902。该结果优于DINOv1(0.867)、DINOv2+reg(0.774)及监督预训练的ImageNet ViT-B/16基线(0.843)。研究为低数据量医疗影像中适配DINO类基础模型提供了实用指导,表明适配策略比骨干选择本身对性能影响更大。

原文摘要 · Abstract (English)

Temporomandibular joint osteoarthritis (TMJ OA) is a prevalent degenerative condition whose osseous changes are often subtle on cone-beam CT (CBCT), making automated detection challenging. We study how well the DINO family of self-supervised vision transformers -- DINOv1, DINOv2, DINOv2+reg, and RAD-DINO (a radiology-pretrained variant) -- transfers to CBCT, asking how much backbone adaptation is needed and of what kind. We propose a simple slice-based pipeline using Vision Transformer (ViT) backbones: axial CBCT slices are encoded per-slice by a frozen or partially adapted ViT and aggregated via attention-based multiple instance learning (MIL) for patient-level binary OA/Normal classification. Through systematic ablation across unfreezing strategies and aggregation designs on a multi-source CBCT dataset, we find that partial unfreezing of the final two transformer blocks is the decisive factor, improving AUC from 0.671 (fully frozen DINOv2) to 0.902. This outperforms DINOv1 (0.867), DINOv2+reg (0.774), and a supervised ImageNet ViT-B/16 baseline (0.843). Our results provide practical guidance for adapting DINO-family foundation models in low-data medical imaging settings, showing that adaptation strategy is a stronger driver of performance than backbone choice alone.

医学影像自监督学习视觉TransformerCBCT

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。