arXiv:2508.11831cs.CLcs.AI2025-08被引 1

跨语言顺序微调提升低资源语言反语检测效果

When Does Language Transfer Help? Sequential Fine-Tuning for Cross-Lingual Euphemism Detection

  • 按语言顺序逐个微调,先高资源后低资源
  • 对约鲁巴语、土耳其语等低资源语言提升显著
  • 适合多语言反语识别且资源稀缺的场景

反语具有文化差异性和语义模糊性,对语言模型构成挑战,尤其在低资源语言中。本文研究通过顺序微调实现跨语言迁移对五种语言(英语、西班牙语、中文、土耳其语、约鲁巴语)反语检测的影响。对比XLM-R和mBERT模型在顺序微调、单语言微调与同时微调下的表现,分析语言对、类型学特征及预训练覆盖度对性能的影响。结果显示,以高资源语言为先导进行顺序微调能显著提升低资源语言的检测效果,尤其对约鲁巴语和土耳其语。XLM-R收益更大但更易受预训练差距和灾难性遗忘影响;mBERT结果更稳定但整体较低。表明顺序微调是提升多语言反语检测性能的简单有效策略,尤其适用于低资源语言。

原文摘要 · Abstract (English)

Euphemisms are culturally variable and often ambiguous, posing challenges for language models, especially in low-resource settings. This paper investigates how cross-lingual transfer via sequential fine-tuning affects euphemism detection across five languages: English, Spanish, Chinese, Turkish, and Yoruba. We compare sequential fine-tuning with monolingual and simultaneous fine-tuning using XLM-R and mBERT, analyzing how performance is shaped by language pairings, typological features, and pretraining coverage. Results show that sequential fine-tuning with a high-resource L1 improves L2 performance, especially for low-resource languages like Yoruba and Turkish. XLM-R achieves larger gains but is more sensitive to pretraining gaps and catastrophic forgetting, while mBERT yields more stable, though lower, results. These findings highlight sequential fine-tuning as a simple yet effective strategy for improving euphemism detection in multilingual models, particularly when low-resource languages are involved.

反语检测跨语言迁移低资源语言顺序微调

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。