arXiv:2507.10726cs.IRcs.LG2025-07

通过用户查询共现发现文档间关系,无需标注数据。

Extracting Document Relations from Search Corpus by Marginalizing over User Queries

  • 基于查询共现模式估算文档对的联合概率。
  • 在无标注数据下识别出主题聚类与跨域关联。
  • 适合需要动态组织知识的搜索系统应用。

大规模语料库中理解文档间关系对知识发现和信息组织至关重要。现有方法依赖人工标注或预定义关系体系。本文提出EDR-MQ(通过查询边缘化提取文档关系)框架,利用不同用户查询结果中强相关文档频繁共现的特性,通过边缘化查询集合来估计文档对的联合概率。为支持该方法,我们设计了多重条件检索增强生成(MC-RAG),其后续检索依赖于先前检索内容。通过观察多样查询中的共现模式,EDR-MQ可在无需标注数据或预设本体的情况下,推断文档间关系。实验表明,该方法成功识别出有意义的关系,揭示了传统相似性方法难以发现的主题聚类、证据链及跨领域联系。该查询驱动框架为适应不同用户视角的信息组织提供了实用方案。

原文摘要 · Abstract (English)

Understanding relationships between documents in large-scale corpora is essential for knowledge discovery and information organization. However, existing approaches rely heavily on manual annotation or predefined relationship taxonomies. We propose EDR-MQ (Extracting Document Relations by Marginalizing over User Queries), a novel framework that discovers document relationships through query marginalization. EDR-MQ is based on the insight that strongly related documents often co-occur in results across diverse user queries, enabling us to estimate joint probabilities between document pairs by marginalizing over a collection of queries. To enable this query marginalization approach, we develop Multiply Conditioned Retrieval-Augmented Generation (MC-RAG), which employs conditional retrieval where subsequent document retrievals depend on previously retrieved content. By observing co-occurrence patterns across diverse queries, EDR-MQ estimates joint probabilities between document pairs without requiring labeled training data or predefined taxonomies. Experimental results show that our query marginalization approach successfully identifies meaningful document relationships, revealing topical clusters, evidence chains, and cross-domain connections that are not apparent through traditional similarity-based methods. Our query-driven framework offers a practical approach to document organization that adapts to different user perspectives and information needs.

文档关系无监督查询分析知识图谱

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。