用各国教材构建文化专属问答数据集,提升大模型文化理解力
From National Curricula to Cultural Awareness: Constructing Open-Ended Culture-Specific Question Answering Dataset
- 以各国社会课教材为蓝本,自动化生成文化相关问答对
- 构建34.1万条韩国民俗文化问答数据,覆盖本地社会语境
- 适合需跨文化理解的AI训练,如多语言对话系统
大型语言模型在诸多任务上表现优异,但在不同语言与文化间进展不均,常反映英语主导训练数据中的隐含价值。为实现实际文化对齐,我们提出一种可扩展的方法,以国家社会研究课程为基础构建文化感知监督信号。我们引入CuCu——一个自动化的多智能体大模型框架,将国家教材转化为开放式、文化特定的问答对,用于有监督微调(SFT)。针对韩国国家社会课课程应用CuCu,构建了包含34.1万条开放式问答对的KCaQA数据集。分析与训练实验表明,KCaQA涵盖文化特定主题,且生成回答能扎根于本地社会文化背景。
原文摘要 · Abstract (English)
Large language models (LLMs) achieve strong performance on many tasks, but their progress remains uneven across languages and cultures, often reflecting values latent in English-centric training data. To enable practical cultural alignment, we propose a scalable approach that leverages national social studies curricula as a foundation for culture-aware supervision. We introduce CuCu, an automated multi-agent LLM framework that transforms national textbook curricula into open-ended, culture-specific question-answer pairs for supervised fine-tuning (SFT). Applying CuCu to the Korean national social studies curriculum, we construct KCaQA, comprising 34.1k open-ended QA pairs. Our analyses and training experiments suggest that KCaQA covers culture-specific topics and produces responses grounded in local sociocultural contexts.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。