arXiv:2602.17051cs.CLcs.AI2026-02

对比四种跨语言分类方法,提升多语种社交媒体中氢能源话题的识别准确率。

Evaluating Cross-Lingual Classification Approaches Enabling Topic Discovery for Multilingual Social Media Data

  • 用翻译标注数据或统一英文模型来过滤多语言垃圾内容
  • 混合策略在九百万条推文中识别出超10万条相关推文
  • 适合做跨国舆情分析与跨语言信息提取的研究者

多语言社交媒体话语分析仍是自然语言处理的重大挑战,尤其在覆盖多种语言的大规模公共辩论中。本研究以氢能为案例,分析2013至2022年间超过九百万条英语、日语、印地语和韩语推文,进行主题发现。基于关键词的在线采集导致大量无关内容。我们评估四种方法:(1) 将英文标注数据翻译至目标语言,构建各语言专用模型;(2) 将所有语言未标注数据翻译成英文,基于英文标注建立单一模型;(3) 直接使用英语微调的多语言模型处理各语言数据;(4) 结合翻译标注与多语言训练的混合策略。每种方法均用于从噪声数据中过滤氢能源相关推文,并进一步进行主题建模以提取核心议题。结果揭示了翻译与多语言方法间的权衡,为大规模社交媒体跨语言分析提供可操作优化建议。

原文摘要 · Abstract (English)

Analysing multilingual social media discourse remains a major challenge in natural language processing, particularly when large-scale public debates span across diverse languages. This study investigates how different approaches for cross-lingual text classification can support reliable analysis of global conversations. Using hydrogen energy as a case study, we analyse a decade-long dataset of over nine million tweets in English, Japanese, Hindi, and Korean (2013--2022) for topic discovery. The online keyword-driven data collection results in a significant amount of irrelevant content. We explore four approaches to filter relevant content: (1) translating English annotated data into target languages for building language-specific models for each target language, (2) translating unlabelled data appearing from all languages into English for creating a single model based on English annotations, (3) applying English fine-tuned multilingual transformers directly to each target language data, and (4) a hybrid strategy that combines translated annotations with multilingual training. Each approach is evaluated for its ability to filter hydrogen-related tweets from noisy keyword-based collections. Subsequently, topic modeling is performed to extract dominant themes within the relevant subsets. The results highlight key trade-offs between translation and multilingual approaches, offering actionable insights into optimising cross-lingual pipelines for large-scale social media analysis.

跨语言分类主题发现社交媒体分析多语言处理

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。