用大模型生成假评论数据,提升多语言多领域检测效果
Data Augmentation for Fake Reviews Detection in Multiple Languages and Multiple Domains
- 用大模型生成跨语言跨领域的假评论数据
- 在多个测试集上准确率提升最高达10.9个百分点
- 适合需要低资源场景下提升检测能力的研究者
随着互联网发展,消费者越来越依赖在线评价做购买决策,虚假评论检测成为自然语言处理的重要研究方向。然而,高性能NLP模型依赖大量训练数据,而低资源语言和领域常面临数据不足问题。本文利用大语言模型生成不同领域(图书、餐厅、酒店)和语言(英语、中文)的假评论数据,用于训练检测模型。实验表明,使用增强数据后,模型在DeRev TEST、Amazon TEST、Yelp TEST和DianPing TEST上的准确率分别提升0.3、10.9、8.3和7.2个百分点,显著改善了跨语言跨域的虚假评论检测性能。
原文摘要 · Abstract (English)
With the growth of the Internet, buying habits have changed, and customers have become more dependent on the online opinions of other customers to guide their purchases. Identifying fake reviews thus became an important area for Natural Language Processing (NLP) research. However, developing high-performance NLP models depends on the availability of large amounts of training data, which are often not available for low-resource languages or domains. In this research, we used large language models to generate datasets to train fake review detectors. Our approach was used to generate fake reviews in different domains (book reviews, restaurant reviews, and hotel reviews) and different languages (English and Chinese). Our results demonstrate that our data augmentation techniques result in improved performance at fake review detection for all domains and languages. The accuracy of our fake review detection model can be improved by 0.3 percentage points on DeRev TEST, 10.9 percentage points on Amazon TEST, 8.3 percentage points on Yelp TEST and 7.2 percentage points on DianPing TEST using the augmented datasets.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。