构建跨语言法律条文检索数据集,助力非华语者获取台湾法律信息
A Cross-Lingual Statutory Article Retrieval Dataset for Taiwan Legal Studies
- 采集英汉双语法律咨询与对应法条,覆盖台湾区民、刑、行三类法律
- 基于大模型的检索方法有效缓解翻译误差,提升跨语言匹配准确率
- 适合法律AI研究者及多语种法律信息服务开发者使用
本文提出一个跨语言法律条文检索(SAR)数据集,旨在提升多语言环境下的法律信息检索能力。该数据集包含以口语化风格呈现的英文法律咨询,配对中文版本及相关法规条文,涵盖台湾地区所有民事、刑事及行政法律。该数据集致力于帮助非母语使用者,尤其是居台外籍人士,更便捷地获取法律信息。我们提出了多种基于大语言模型的检索基线方法,重点解决翻译误差问题并提升跨语言检索性能。本研究为构建包容性法律信息检索系统提供了重要资源。
原文摘要 · Abstract (English)
This paper introduces a cross-lingual statutory article retrieval (SAR) dataset designed to enhance legal information retrieval in multilingual settings. Our dataset features spoken-language-style legal inquiries in English, paired with corresponding Chinese versions and relevant statutes, covering all Taiwanese civil, criminal, and administrative laws. This dataset aims to improve access to legal information for non-native speakers, particularly for foreign nationals in Taiwan. We propose several LLM-based methods as baselines for evaluating retrieval effectiveness, focusing on mitigating translation errors and improving cross-lingual retrieval performance. Our work provides a valuable resource for developing inclusive legal information retrieval systems.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。