提升摘要公平性,让不同群体内容得到均衡呈现。
Fair Summarization: Bridging Quality and Diversity in Extractive Summaries
- 基于聚类与大模型约束,设计两种公平抽取式摘要方法。
- 在多元群体数据上,公平性提升且摘要质量不降。
- 引入质量与公平融合指标,适合关注公平性的研究者。
用户生成内容的多文档摘要中的公平性问题仍是自然语言处理中的关键挑战。现有摘要方法常无法确保不同社会群体的平等代表,导致输出结果存在偏见。本文提出两种新颖的公平抽取式摘要方法:基于聚类的 FairExtract,以及利用 GPT-3.5-turbo 并加入公平性约束的 FairGPT。我们在 Divsumm 数据集(包含白人、西班牙裔、非裔美国人方言推文)上评估这些方法,并与多个基线对比。通过 SUPERT、BLANC、SummaQA、BARTScore、UniEval 等综合质量指标及公平性指标 F 进行评测,结果显示 FairExtract 与 FairGPT 在保持竞争力摘要质量的同时,显著提升了公平性。此外,我们引入复合指标(如 SUPERT+F、BLANC+F),将质量与公平性统一于单一评估框架,更清晰揭示两者间的权衡关系。代码已公开。
原文摘要 · Abstract (English)
Fairness in multi-document summarization of user-generated content remains a critical challenge in natural language processing (NLP). Existing summarization methods often fail to ensure equitable representation across different social groups, leading to biased outputs. In this paper, we introduce two novel methods for fair extractive summarization: FairExtract, a clustering-based approach, and FairGPT, which leverages GPT-3.5-turbo with fairness constraints. We evaluate these methods using Divsumm summarization dataset of White-aligned, Hispanic, and African-American dialect tweets and compare them against relevant baselines. The results obtained using a comprehensive set of summarization quality metrics such as SUPERT, BLANC, SummaQA, BARTScore, and UniEval, as well as a fairness metric F, demonstrate that FairExtract and FairGPT achieve superior fairness while maintaining competitive summarization quality. Additionally, we introduce composite metrics (e.g., SUPERT+F, BLANC+F) that integrate quality and fairness into a single evaluation framework, offering a more nuanced understanding of the trade-offs between these objectives. Our code is available online.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。