arXiv:2508.06916cs.CV2025-08AAAI被引 16

让AI通过多轮对话一步步理解并生成连贯图像,解决反复修改不一致问题。

Talk2Image: A Multi-Agent System for Multi-Turn Image Generation and Editing

论文配图:Talk2Image: A Multi-Agent System for Multi-Turn Image Generation and Editing
图 1 · 摘自论文原文
  • 用多个专用智能体协作,拆解用户指令并分步执行
  • 多轮对话中保持意图一致,图像编辑更连贯
  • 适合需要反复调整的创意设计、交互式绘图场景

文本到图像生成推动了多媒体应用的发展,但多数方法局限于单轮任务,难以应对迭代式多轮创作。现有对话系统虽尝试弥补此差距,但采用单智能体顺序模式常导致意图漂移和编辑不连贯。为此,我们提出Talk2Image,一种面向多轮对话的多智能体系统,用于交互式图像生成与编辑。该系统集成三大核心组件:从对话历史中解析用户意图、跨专业智能体的任务分解与协同执行,以及基于多视角评估机制的反馈驱动优化。实验表明,Talk2Image在可控性、连贯性和用户满意度上均优于现有基线,在多轮图像生成与编辑任务中表现更优。

原文摘要 · Abstract (English)

Text-to-image generation tasks have driven remarkable advances in diverse media applications, yet most focus on single-turn scenarios and struggle with iterative, multi-turn creative tasks. Recent dialogue-based systems attempt to bridge this gap, but their single-agent, sequential paradigm often causes intention drift and incoherent edits. To address these limitations, we present Talk2Image, a novel multi-agent system for interactive image generation and editing in multi-turn dialogue scenarios. Our approach integrates three key components: intention parsing from dialogue history, task decomposition and collaborative execution across specialized agents, and feedback-driven refinement based on a multi-view evaluation mechanism. Talk2Image enables step-by-step alignment with user intention and consistent image editing. Experiments demonstrate that Talk2Image outperforms existing baselines in controllability, coherence, and user satisfaction across iterative image generation and editing tasks.

图像生成多智能体对话系统交互设计

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。