arXiv:2604.05318cs.CL2026-04ACL被引 1

首个跨50种英语方言的有害内容检测基准,揭示现有模型对非标准英语的严重不敏感。

DIA-HARM: Dialectal Disparities in Harmful Content Detection Across 50 English Dialects

论文配图:DIA-HARM: Dialectal Disparities in Harmful Content Detection Across 50 English Dialects
图 1 · 摘自论文原文
  • 构建50种英语方言的有害内容检测数据集D-CUBE,覆盖美英非加太地区
  • 非标准英语内容使检测性能下降1.4%-3.6%,部分模型衰减超33%
  • 多语言模型表现优异,但单语模型在方言输入上几乎失效,适合安全与公平性研究者

有害内容检测模型,尤其是虚假信息分类器,主要基于标准美式英语(SAE)开发和评估,对其方言变异的鲁棒性尚未深入探索。本文提出DIA-HARM,首个评估跨50种英语方言(涵盖美国、英国、非洲、加勒比及亚太地区)虚假信息检测鲁棒性的基准。基于Multi-VALUE的语言学转换方法,构建了核心数据集D-CUBE,包含19.5万条源自既有虚假信息基准的数据样本。对16个检测模型的评估显示:人工生成的方言内容使检测性能下降1.4%-3.6% F1,而AI生成内容保持稳定;微调的Transformer模型显著优于零样本LLM(最佳F1分别为96.6%和78.3%),部分模型在混合内容下出现超过33%的灾难性退化。跨方言迁移分析显示,多语言模型(如mDeBERTa:平均F1 97.2%)泛化能力强,而单语模型(如RoBERTa、XLM-RoBERTa)在方言输入上表现失败。结果表明,当前虚假信息检测系统可能系统性地不利影响全球数亿非标准英语使用者。我们开源了DIA-HARM基准,包括D-CUBE数据集(https://github.com/jsl5710/dia-harm)和评估工具(https://jsl5710.github.io/dia-harm)。

原文摘要 · Abstract (English)

Harmful content detectors, particularly disinformation classifiers, are predominantly developed and evaluated on Standard American English (SAE), leaving their robustness to dialectal variation unexplored. We present DIA-HARM, the first benchmark for evaluating disinformation detection robustness across 50 English dialects spanning U.S., British, African, Caribbean, and Asia-Pacific varieties. Using Multi-VALUE's linguistically grounded transformations, we introduce D-CUBE (Dialectal Disinformation Detection Corpus), a core corpus component of DIA-HARM comprising 195K samples derived from established disinformation benchmarks. Our evaluation of 16 detection models reveals systematic vulnerabilities: human-written dialectal content degrades detection by 1.4-3.6% F1, while AI-generated content remains stable. Fine-tuned transformers substantially outperform zero-shot LLMs (96.6% vs. 78.3% best-case F1), with some models exhibiting catastrophic failures exceeding 33% degradation on mixed content. Cross-dialectal transfer analysis across 2,450 dialect pairs shows that multilingual models (mDeBERTa: 97.2% average F1) generalize effectively, while monolingual models like RoBERTa and XLM-RoBERTa fail on dialectal inputs. These findings demonstrate that current disinformation detectors may systematically disadvantage hundreds of millions of non-SAE speakers worldwide. We release the DIA-HARM benchmark, including the D-CUBE corpus (https://github.com/jsl5710/dia-harm), and evaluation tools (https://jsl5710.github.io/dia-harm).

虚假信息检测方言差异模型鲁棒性公平性

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。