arXiv:2601.08764cs.IRcs.SD2026-01被引 4

用融合多模态的语义ID提升生成式音乐推荐准确率

FusID: Modality-Fused Semantic IDs for Generative Music Recommendation

  • 将音频、文本等多模态信息联合编码,生成统一语义表示
  • 零ID冲突,召回率在k=1/5/10/20时全面超越基线
  • 适合需要高精度音乐推荐的系统开发者

生成式推荐系统通过语义ID表示物品取得了显著进展。然而,现有独立处理各模态的方法存在两大缺陷:(1) 模态间冗余降低效率,(2) 忽视跨模态交互限制表征能力。我们提出FusID,一种模态融合的语义ID框架,包含三个关键组件:(i) 多模态融合,联合编码跨模态信息以学习统一表示;(ii) 表示学习,使频繁共现的物品嵌入更接近,同时保持区分性并防止特征冗余;(iii) 产品量化,将融合后的连续嵌入转换为多个离散标记,缓解ID冲突。在多模态下一首歌推荐(即播放列表续接)基准上评估,FusID实现零ID冲突,确保每个标记序列唯一对应一首歌曲,缓解码本利用不足,并在MRR和Recall@k(k = 1, 5, 10, 20)上优于基线方法。

原文摘要 · Abstract (English)

Generative recommendation systems have achieved significant advances by leveraging semantic IDs to represent items. However, existing approaches that tokenize each modality independently face two critical limitations: (1) redundancy across modalities that reduces efficiency, and (2) failure to capture inter-modal interactions that limits item representation. We introduce FusID, a modality-fused semantic ID framework that addresses these limitations through three key components: (i) multimodal fusion that learns unified representations by jointly encoding information across modalities, (ii) representation learning that brings frequently co-occurring item embeddings closer while maintaining distinctiveness and preventing feature redundancy, and (iii) product quantization that converts the fused continuous embeddings into multiple discrete tokens to mitigate ID conflict. Evaluated on a multimodal next-song recommendation (i.e., playlist continuation) benchmark, FusID achieves zero ID conflicts, ensuring that each token sequence maps to exactly one song, mitigates codebook underutilization, and outperforms baselines in terms of MRR and Recall@k (k = 1, 5, 10, 20).

音乐推荐多模态语义ID

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。