arXiv:2607.23600cs.CV2026-07

提出连续融合空间,实现红外可见光图像的精细可控融合。

ConFusion: Continuous Fusion Space Learning for Fine-Grained Controllable Infrared and Visible Image Fusion

论文配图:ConFusion: Continuous Fusion Space Learning for Fine-Grained Controllable Infrared and Visible Image Fusion
图 1 · 摘自论文原文
  • 用高斯条件调制变量实现连续空间的细粒度控制
  • 在多个指标上达到当前最优,支持实例级调控
  • 适合需要精准图像融合的视觉任务使用者

可控红外-可见光图像融合旨在以灵活的区域感知方式整合互补的热成像与结构信息,生成适应不同用户需求和下游任务的融合图像。然而,现有方法通常依赖预定义的离散控制条件,导致控制空间稀疏,难以满足细粒度调节需求。为此,本文提出ConFusion框架,通过高斯条件下的空间感知调制学习连续融合空间,实现实例级细粒度可控的红外-可见光图像融合。该框架采用双分支结构,在联合重建与文本引导语义对齐下解耦模态无关与模态特定表示。结合基于Grounded SAM的实例掩码与高斯条件调制变量,通过掩码引导的特定特征调制器实现实例级细粒度调制;同时,文本驱动的不变特征增强器提升语义一致性与融合效果。推理阶段,多模态大语言模型将用户意图解析为实例级调制变量以指导融合过程。大量实验表明,ConFusion在融合质量与下游任务中均取得领先性能,且支持细粒度可控融合。代码已开源。

原文摘要 · Abstract (English)

Controllable infrared-visible image fusion aims to integrate complementary thermal and structural information with flexible region-aware modulation, producing fused images that adapt to diverse user requirements and downstream tasks. However, existing methods typically rely on predefined discrete control conditions, leading to a sparse space that fails to support fine-grained modulation demands. To address this, we propose ConFusion, a novel framework that learns the continuous fusion space via Gaussian-conditioned spatial-aware modulation, enabling instance-level fine-grained controllable infrared and visible image fusion. ConFusion employs a dual-branch architecture to disentangle modality-invariant and modality-specific representations under joint reconstruction and text-guided semantic alignment. Gaussian-conditioned instance modulation variables coupled with Grounded SAM-based instance masks guide instance-level fine-grained modulation through the Mask-Guided Specific Feature Modulator, while the Text-Driven Invariant Feature Enhancer improves semantic consistency and enhances fusion. During inference, the multimodal large language model parses user intents into instance-level modulation variables to guide image fusion. Extensive experiments show that ConFusion achieves state-of-the-art performance across multiple metrics in both fusion quality and downstream tasks, while supporting fine-grained controllable image fusion. Our code is available at https://github.com/HeyufeiAnto/Confusion

图像融合可控生成多模态细粒度控制

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。