arXiv:2605.30359cs.NEcs.DC2026-05

用诊断驱动的进化方法自动优化GPU内核,提升正确率与性能。

Kernel Foundry: A Diagnosis-driven Evolutionary Kernel Optimizer with Multi-Experts

论文配图:Kernel Foundry: A Diagnosis-driven Evolutionary Kernel Optimizer with Multi-Experts
图 1 · 摘自论文原文
  • 结合专家引导与检索增强初始化,启动多岛进化搜索
  • 在KernelBench上实现最高100%正确率,优于强基线
  • 适合需要高效可靠GPU内核的编译器与系统研发人员

生成高性能的GPU内核仍具挑战性,需兼顾正确性与硬件感知优化。尽管大语言模型(LLMs)在代码生成方面展现出潜力,但常无法产出既正确又高效的内核。我们提出Kernel Foundry,一种诊断驱动的演化框架,用于自动优化GPU内核。该方法融合专家引导、检索增强初始化与多岛演化搜索,通过结构化诊断反馈迭代优化候选内核。集中式经验库积累可复用的优化知识以指导后续演化,同时设有显式机制防止绕过内核级计算的作弊行为。在KernelBench上的实验表明,该方法持续提升正确性与性能,最高达Level~2的100%正确率。

原文摘要 · Abstract (English)

Generating high-performance GPU kernels remains challenging due to the need for both correctness and hardware-aware optimization. While large language models (LLMs) show promise in code generation, they often fail to produce kernels that are both correct and efficient. We propose Kernel Foundry, a diagnosis-driven evolutionary framework for automatic GPU kernel optimization. Our method combines expert-guided, retrieval-augmented initialization with a multi-island evolutionary search, where candidate kernels are iteratively refined using structured diagnostic feedback. A centralized experience library accumulates reusable optimization knowledge to guide subsequent evolution, while explicit mechanisms prevent cheating behaviors that bypass kernel-level computation. Experiments on KernelBench show that our method consistently improves both correctness and performance over strong baselines, achieving up to 100% correctness on Level~2.

GPU优化演化算法内核生成

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。