arXiv:2604.09721cs.IRcs.MM2026-04ACL被引 1

构建多音轨音乐问答基准,评估模型跨音频的比较推理能力。

Jamendo-MT-QA: A Benchmark for Multi-Track Comparative Music Question Answering

  • 基于12,173对音乐片段生成36,519个对比问题,涵盖三类题型。
  • 引入LLM辅助生成与筛选流程,提升问题质量与多样性。
  • 适用于评估音频-语言模型在音乐比较理解上的性能,适合音频认知研究者。

音乐问答(Music-QA)研究长期聚焦单音轨理解,即模型通过标签、描述或元数据回答关于单一音频片段的问题。然而,听众常以比较方式描述音乐,现有基准未系统评估跨音轨的推理能力。本文基于Jamendo-QA数据集,构建了新的多音轨对比音乐问答基准Jamendo-MT-QA。从Jamendo平台的CC授权音乐中,我们生成了36,519个对比问答样本,覆盖12,173对音乐片段,每对包含三类问题:是/否、短答案和句子级问题。我们提出一种基于大语言模型的生成与过滤流水线,确保问题质量。同时,使用自动指标与大语言模型作为裁判(LLM-as-a-Judge)评估代表性音频-语言模型的表现。

原文摘要 · Abstract (English)

Recent work on music question answering (Music-QA) has primarily focused on single-track understanding, where models answer questions about an individual audio clip using its tags, captions, or metadata. However, listeners often describe music in comparative terms, and existing benchmarks do not systematically evaluate reasoning across multiple tracks. Building on the Jamendo-QA dataset, we introduce Jamendo-MT-QA, a dataset and benchmark for multi-track comparative question answering. From Creative Commons-licensed tracks on Jamendo, we construct 36,519 comparative QA items over 12,173 track pairs, with each pair yielding three question types: yes/no, short-answer, and sentence-level questions. We describe an LLM-assisted pipeline for generating and filtering comparative questions, and benchmark representative audio-language models using both automatic metrics and LLM-as-a-Judge evaluation.

音乐问答多音轨对比推理基准测试

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。