arXiv:2503.12880cs.CLcs.AI2025-03NeurIPS被引 17

解决文本生成可视化中的模糊问题,通过分步推理提升准确率。

nvBench 2.0: Resolving Ambiguity in Text-to-Visualization through Stepwise Reasoning

  • 构建分步推理框架,让模型逐步澄清模糊查询意图。
  • 在7878个模糊查询上,新模型性能超越所有基线。
  • 适合研究自然语言与数据可视化的交互设计者。

文本到可视化(Text2VIS)使用户能通过自然语言生成可视化图表,提升数据洞察可及性。然而,文本描述常存在歧义,导致系统理解偏差。为此,我们提出nvBench 2.0,一个针对模糊查询的新型基准测试集,包含7,878条自然语言查询和24,076张对应可视化图表,源自153个领域的780张表格。该数据集通过受控的模糊注入流程构建:从明确的可视化出发,反向生成模糊查询,并保留每条查询与可视化之间的分步推理路径。我们评估多种大语言模型在模糊场景下的表现,并提出Step-Text2Vis模型,基于nvBench 2.0进行分步偏好优化训练。实验表明,Step-Text2Vis在所有基线中表现最优,确立了模糊文本生成可视化的新基准。代码与数据已开源。

原文摘要 · Abstract (English)

Text-to-Visualization (Text2VIS) enables users to create visualizations from natural language queries, making data insights more accessible. However, Text2VIS faces challenges in interpreting ambiguous queries, as users often express their visualization needs in imprecise language. To address this challenge, we introduce nBench 2.0, a new benchmark designed to evaluate Text2VIS systems in scenarios involving ambiguous queries. nvBench 2.0 includes 7,878 natural language queries and 24,076 corresponding visualizations, derived from 780 tables across 153 domains. It is built using a controlled ambiguity-injection pipeline that generates ambiguous queries through a reverse-generation workflow. By starting with unambiguous seed visualizations and selectively injecting ambiguities, the pipeline yields multiple valid interpretations for each query, with each ambiguous query traceable to its corresponding visualization through step-wise reasoning paths. We evaluate various Large Language Models (LLMs) on their ability to perform ambiguous Text2VIS tasks using nBench 2.0. We also propose Step-Text2Vis, an LLM-based model trained on nvBench 2.0, which enhances performance in ambiguous scenarios through step-wise preference optimization. Our results show that Step-Text2Vis outperforms all baselines, setting a new state-of-the-art for ambiguous Text2VIS tasks. Our source code and data are available at https://nvbench2.github.io/

文本生成可视化大模型推理

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。