arXiv:2410.04589cs.CL2024-10
构建首个口语意大利语通用依存树库,助力自然语言处理研究
Towards the first UD Treebank of Spoken Italian: the KIParla forest
- 基于已有口语语料库构建通用依存标注体系
- 完成首个面向口语意大利语的通用依存树库建设
- 为语音转写与语言理解提供高质量标注数据
本项目旨在通过构建针对口语意大利语的通用依存(Universal Dependencies)树库,丰富现有语言资源。研究基于已有的知名口语语料库KIParla(Mauri等,2019;Ballarè等,2020),该语料库收录了大量真实口语对话数据。通过对该语料进行人工标注和语法结构分析,建立符合通用依存标注标准的树库,支持后续自然语言处理任务如句法分析、语义解析等。此工作填补了口语意大利语在通用依存标注领域的空白,为相关研究提供可靠基础。
原文摘要 · Abstract (English)
The present project endeavors to enrich the linguistic resources available for Italian by constructing a Universal Dependencies treebank for the KIParla corpus (Mauri et al., 2019, Ballarè et al., 2020), an existing and well known resource for spoken Italian.
依存句法口语分析语言资源意大利语
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。