让大模型生成目标直接搜索,提升文本与代码多样性与质量。
Output-Space Search: Targeting LLM Generations in a Frozen Encoder-Defined Output Space
- 在冻结编码器定义的3维空间中直接搜索目标输出点。
- 文本生成多样性提升3.1倍,代码优化效果优于传统方法。
- 适合需要高效探索和黑箱优化的生成任务研究者。
我们提出输出空间搜索(OS-Search),将大语言模型生成转化为端点搜索。外层循环在由冻结编码器定义的三维输出空间Z中选取目标z*,并使用基于序列级强化学习训练的检索增强策略,在标准自回归解码下生成使坐标接近z*的输出。该方法可在不依赖路径依赖的词元/程序搜索前提下,实现Z空间内的并行扫描与黑箱优化。在故事生成任务中,对Z空间(文本)进行扫描,其大模型评分多样性是提示链(prompt-chaining)的3.1倍;在代码生成任务中,基于贝叶斯优化在Z空间(代码)上进行优化,在相同推理预算下提升了未暴露给控制器的目标函数表现,同时保持代码有效性。
原文摘要 · Abstract (English)
We introduce Output-Space Search (OS-Search), which turns LLM generation into endpoint search. An outer loop selects a target z* in a frozen encoder-defined 3D output space Z, and a retrieval-grounded policy trained with sequence-level RL generates outputs whose coordinates land near z* under standard autoregressive decoding. This enables parallel sweeps and black-box optimization in Z without path-dependent token/program search. On stories, sweeping Z (text) yields 3.1x higher LLM-scored diversity than prompt-chaining. On code, Bayesian optimization over Z (code) improves an objective withheld from the controller under matched inference budgets while preserving validity.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。