arXiv:2601.04455cs.IRcs.AI2026-01

用重排模型当相关性判断器,效果竟比顶级大模型还强。

Re-Rankers as Relevance Judges

  • 把重排模型输出转为真假标签或阈值二分类作为判断依据
  • 在多个数据集上40%~50%情况下超越现有最强LLM判断器
  • 模型会偏好自己和同族重排器,存在明显偏见

利用大语言模型(LLMs)预测相关性判断已展现出良好效果。多数研究将此任务视为独立方向,如设计提示以根据查询和文本段落预测相关性标签。然而,相关性判断本质上属于相关性预测,而该问题在重排任务中已有广泛研究。尽管存在潜在重叠,但极少研究探索复用或改造现有重排方法来预测相关性判断,导致资源浪费与重复开发。为此,我们采用重排模型作为相关性判断器,在TREC-DL 2019至2023数据集上复现8个来自3类家族、参数量从220M到32B的重排模型。设计两种适配策略:(i) 使用重排模型生成的二元标记(如“true”、“false”)作为直接判断;(ii) 通过阈值化将连续重排得分转换为二分类标签。实验表明,两种策略下,重排模型作为判断器在约40%至50%情况下优于UMBRELA——当前最先进的基于LLM的相关性判断器;同时,这些判断器表现出对自身及同族模型的强烈偏好,以及跨家族偏见。

原文摘要 · Abstract (English)

Using large language models (LLMs) to predict relevance judgments has shown promising results. Most studies treat this task as a distinct research line, e.g., focusing on prompt design for predicting relevance labels given a query and passage. However, predicting relevance judgments is essentially a form of relevance prediction, a problem extensively studied in tasks such as re-ranking. Despite this potential overlap, little research has explored reusing or adapting established re-ranking methods to predict relevance judgments, leading to potential resource waste and redundant development. To bridge this gap, we reproduce re-rankers in a re-ranker-as-relevance-judge setup. We design two adaptation strategies: (i) using binary tokens (e.g., "true" and "false") generated by a re-ranker as direct judgments, and (ii) converting continuous re-ranking scores into binary labels via thresholding. We perform extensive experiments on TREC-DL 2019 to 2023 with 8 re-rankers from 3 families, ranging from 220M to 32B, and analyse the evaluation bias exhibited by re-ranker-based judges. Results show that re-ranker-based relevance judges, under both strategies, can outperform UMBRELA, a state-of-the-art LLM-based relevance judge, in around 40% to 50% of the cases; they also exhibit strong self-preference towards their own and same-family re-rankers, as well as cross-family bias.

大模型相关性判断重排模型评估偏见

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。