用流网络生成可变长度文本片段,提升语言模型的表达与泛化能力。
Flow of Spans: Generalizing Language Models to Dynamic Span-Vocabulary via GFlowNets
- 构建动态片段词汇,将生成过程建模为有向无环图,突破传统树状结构限制。
- 在文本生成上比Transformer提升12.5% MAUVE得分,在知识密集任务中提高3.5%。
- 适合需要多样性和组合生成能力的任务,如开放域对话与内容创作。
标准自回归语言模型以固定词汇表逐标记生成文本,将标记采样视为动作时形成树状状态空间,限制了灵活性与表达力。近期工作通过采样检索到的文本片段引入动态词汇,但未考虑同一句子可由不同长度片段构成,缺乏对有向无环图(DAG)状态空间的显式建模,导致组合路径探索受限且存在路径偏倚。生成流网络(GFlowNets)擅长高效探索与泛化于状态空间,尤其适用于具有DAG结构的情况。然而,已有基于GFlowNets的语言模型仍局限于标记级操作,固守树状空间,未能发挥其潜力。本文提出流片段(Flow of SpanS, FOSS),一种针对片段生成的原理性GFlowNets框架。FOSS通过灵活分割检索文本构建动态片段词汇,确保状态空间为DAG结构,使GFlowNets能够探索多样化组合路径并提升泛化能力。结合专用奖励模型,FOSS生成文本兼具多样性与高质量。实验表明,相比Transformer,FOSS在文本生成上提升高达12.5%的MAUVE分数,在知识密集型任务中取得3.5%的性能增益,持续优于现有最先进方法。扩展实验进一步证明,随着模型规模、数据量和检索语料库丰富度增加,FOSS优势依然保持,超越强基线。
原文摘要 · Abstract (English)
Standard autoregressive language models generate text token-by-token from a fixed vocabulary, inducing a tree-structured state space when viewing token sampling as an action, which limits flexibility and expressiveness. Recent work introduces dynamic vocabulary by sampling retrieved text spans but overlooks that the same sentence can be composed of spans of varying lengths, lacking explicit modeling of the directed acyclic graph (DAG) state space. This leads to restricted exploration of compositional paths and is biased toward the chosen path. Generative Flow Networks (GFlowNets) are powerful for efficient exploring and generalizing over state spaces, particularly those with a DAG structure. However, prior GFlowNets-based language models operate at the token level and remain confined to tree-structured spaces, limiting their potential. In this work, we propose Flow of SpanS (FOSS), a principled GFlowNets framework for span generation. FoSS constructs a dynamic span vocabulary by segmenting the retrieved text flexibly, ensuring a DAG-structured state space, which allows GFlowNets to explore diverse compositional paths and improve generalization. With specialized reward models, FoSS generates diverse, high-quality text. Empirically, FoSS improves MAUVE scores by up to 12.5% over Transformer on text generation and achieves 3.5% gains on knowledge-intensive tasks, consistently outperforming state-of-the-art methods. Scaling experiments further demonstrate FoSS benefits from larger models, more data, and richer retrieval corpora, retaining its advantage over strong baselines.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。