用逻辑规则增强多智能体框架,实现可靠且全面的跨模态可视化生成。
MultiVis-Agent: A Multi-Agent Framework with Logic Rules for Reliable and Comprehensive Cross-Modal Data Visualization
- 引入四层逻辑规则框架,以数学约束引导大模型推理而非替代其决策。
- 在挑战性任务上达75.63%可视化得分,任务完成率99.58%,代码执行成功率94.56%。
- 适合需要高可靠性与多轮迭代的复杂可视化场景,如科研、报告自动化。
真实世界的可视化任务涉及复杂多模态需求,超越简单文本到图表生成,需参考图像、代码示例及迭代优化。现有系统存在单模态输入、一次性生成和僵化流程等根本缺陷。尽管基于大模型的方法对此类需求有潜力,但面临灾难性失败和无限循环等可靠性问题。为此,我们提出MultiVis-Agent,一种融合逻辑规则的多智能体框架,用于可靠且全面的多模态、多场景可视化生成。该方法构建四层逻辑规则框架,提供系统可靠性数学保障的同时保持灵活性。不同于传统规则系统,我们的逻辑规则为数学约束,仅引导大模型推理而不取代其能力。我们形式化了从基础生成到迭代优化的四种可视化任务场景,并构建MultiVis-Bench基准,涵盖超1000个案例用于多模态可视化评估。大量实验表明,本方法在挑战性任务上取得75.63%的可视化得分,显著优于基线(57.54%-62.79%),任务完成率达99.58%,代码执行成功率94.56%(无逻辑规则时为74.48%和65.10%),有效解决自动化可视化生成中的复杂性与可靠性难题。
原文摘要 · Abstract (English)
Real-world visualization tasks involve complex, multi-modal requirements that extend beyond simple text-to-chart generation, requiring reference images, code examples, and iterative refinement. Current systems exhibit fundamental limitations: single-modality input, one-shot generation, and rigid workflows. While LLM-based approaches show potential for these complex requirements, they introduce reliability challenges including catastrophic failures and infinite loop susceptibility. To address this gap, we propose MultiVis-Agent, a logic rule-enhanced multi-agent framework for reliable multi-modal and multi-scenario visualization generation. Our approach introduces a four-layer logic rule framework that provides mathematical guarantees for system reliability while maintaining flexibility. Unlike traditional rule-based systems, our logic rules are mathematical constraints that guide LLM reasoning rather than replacing it. We formalize the MultiVis task spanning four scenarios from basic generation to iterative refinement, and develop MultiVis-Bench, a benchmark with over 1,000 cases for multi-modal visualization evaluation. Extensive experiments demonstrate that our approach achieves 75.63% visualization score on challenging tasks, significantly outperforming baselines (57.54-62.79%), with task completion rates of 99.58% and code execution success rates of 94.56% (vs. 74.48% and 65.10% without logic rules), successfully addressing both complexity and reliability challenges in automated visualization generation.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。