arXiv:2505.20264cs.CLcs.AI2025-05EMNLP被引 3
NLP数据多样性测量方法亟待改进,需跨学科视角。
We Need to Measure Data Diversity in NLP -- Better and Broader
- 提出多维度评估框架,融合语义与结构多样性
- 强调现有指标在覆盖范围与敏感性上的不足
- 适合关注数据质量与公平性的研究者参考
尽管NLP数据集中的多样性已受到越来越多关注,但如何衡量这一特性仍缺乏深入探索。本文从概念和方法论层面分析了测量数据多样性的挑战,主张必须引入跨学科视角,以发展更细致、更有效的测量工具。通过反思当前主流指标的局限性,论文呼吁建立能够捕捉语言表达、语境分布与样本结构差异的新范式,从而为构建更具代表性和鲁棒性的NLP系统提供基础支持。
原文摘要 · Abstract (English)
Although diversity in NLP datasets has received growing attention, the question of how to measure it remains largely underexplored. This opinion paper examines the conceptual and methodological challenges of measuring data diversity and argues that interdisciplinary perspectives are essential for developing more fine-grained and valid measures.
数据多样性NLP评估跨学科
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。