arXiv:2502.15168cs.CL2025-02ACL被引 1

首个支持多语言的风格嵌入模型,可跨语言分析文本风格。

mStyleDistance: Multilingual Style Embeddings and their Evaluation

  • 用合成数据和对比学习训练九种语言的风格嵌入模型。
  • 在多语言风格基准上表现优于现有模型,跨语言泛化能力强。
  • 适合跨语言文本分析、作者身份验证等任务的研究者使用。

风格嵌入对风格分析与风格迁移很有帮助,但目前仅限英语。我们提出多语言风格距离模型(mStyleDistance),通过合成数据和对比学习,在九种语言上训练风格嵌入。我们构建了多语言STEL-or-Content基准(Wegmann et al., 2022)用于评估嵌入质量,并将其应用于跨语言作者身份验证任务。结果表明,mStyleDistance在多语言风格基准上优于现有模型,且对未见特征和语言具有良好的泛化能力。模型已公开发布于 https://huggingface.co/StyleDistance/mstyledistance。

原文摘要 · Abstract (English)

Style embeddings are useful for stylistic analysis and style transfer; however, only English style embeddings have been made available. We introduce Multilingual StyleDistance (mStyleDistance), a multilingual style embedding model trained using synthetic data and contrastive learning. We train the model on data from nine languages and create a multilingual STEL-or-Content benchmark (Wegmann et al., 2022) that serves to assess the embeddings' quality. We also employ our embeddings in an authorship verification task involving different languages. Our results show that mStyleDistance embeddings outperform existing models on these multilingual style benchmarks and generalize well to unseen features and languages. We make our model publicly available at https://huggingface.co/StyleDistance/mstyledistance .

风格嵌入多语言对比学习作者识别

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。