对比不同生成式推荐模型在冷启动场景下的表现,揭示真实效果差异。
Cold-Starts in Generative Recommendation: A Reproducibility Study
- 统一冷启动评估协议,系统复现多个生成式推荐模型。
- 发现模型规模与训练策略对冷启动性能影响显著,但结果常被混淆。
- 为新用户和新物品推荐提供可复现的基准测试方案,适合研究者参考。
冷启动推荐仍是动态、开放世界平台的核心挑战,需在交互信号稀疏或缺失的情况下,为新注册用户(用户冷启动)和新引入商品(物品冷启动)进行推荐。近年来基于预训练语言模型(PLMs)的生成式推荐器常被认为可通过商品语义信息(如标题和描述)及有限用户上下文的测试时条件化缓解冷启动问题。然而,冷启动很少作为主要评估设置,且报告的性能提升难以解释,因为模型规模、标识符设计和训练策略等关键设计选择常被同时改变。本文提出一个系统性的可复现性研究,采用统一的冷启动评估协议,对生成式推荐进行了全面复现。
原文摘要 · Abstract (English)
Cold-start recommendation remains a central challenge in dynamic, open-world platforms, requiring models to recommend for newly registered users (user cold-start) and to recommend newly introduced items to existing users (item cold-start) under sparse or missing interaction signals. Recent generative recommenders built on pre-trained language models (PLMs) are often expected to mitigate cold-start by using item semantic information (e.g., titles and descriptions) and test-time conditioning on limited user context. However, cold-start is rarely treated as a primary evaluation setting in existing studies, and reported gains are difficult to interpret because key design choices, such as model scale, identifier design, and training strategy, are frequently changed together. In this work, we present a systematic reproducibility study of generative recommendation under a unified suite of cold-start protocols.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。