博士生张真瑜的一篇学术论文被IEEE ICCD 2026录用

近日,博士生张真瑜为第一作者、戴鸿君教授为通讯作者的论文《KernGraft: Compiler-Admitted Optimization Guidance from Expert GPU Kernels》被IEEE International Conference on Computer Design(IEEE ICCD 2026)正式接收。

IEEE ICCD创办于1982年,旨在推动大规模集成计算系统设计领域的研究与交流,至今已有四十余年历史。会议长期关注计算机体系结构、编译器与软件系统、电子设计自动化、验证与测试以及电路设计等方向,是计算机系统与设计领域具有重要影响力的国际学术会议。

论文聚焦于高性能GPU算子优化知识难以被编译器复用这一问题。专家编写的 Triton、CUDA kernel 中包含算法组织、状态管理、数值计算、内存访问和硬件映射等大量优化经验,但这些知识通常与具体代码实现绑定。当硬件平台或编译后端发生变化时,开发者往往需要重新分析和实现相似的优化策略。

针对这一问题,论文提出了 KernGraft 框架,将专家 GPU kernel 视为优化“证据”,而不是直接复用的实现。KernGraft 利用大语言模型从专家代码、性能反馈和硬件信息中提取优化假设,再通过编译器的准入机制进行验证和结构化,形成 OptGuide 优化指导。最终的合法性判断、优化搜索、实现选择以及 CUDA 代码生成仍由编译器自主完成。


实验覆盖 20 个 Triton 风格的专家 GPU kernel,包括归一化、Softmax、位置编码、Split-K reduction 和线性计算等典型算子,并在 NVIDIA RTX 5090D 和 H100 GPU 上进行测试。结果表明,KernGraft 生成的 CUDA kernel 相比实现的中位性能分别达到 1.537× 和 1.351×;在 H100 固定后端对照实验中,20 个 kernel 中有 19 个获得超过 1.10× 的性能提升,表明结构化优化指导能够有效影响编译器的算法组织和硬件映射决策。

该研究为专家 GPU 算子优化经验的复用提供了一种新的技术路径,使原本隐含在高性能代码中的优化知识能够转化为编译器可验证、可消费的结构化指导,同时保持最终实现选择权由编译器掌握。未来,团队将进一步探索该方法在更多算子类型和硬件平台上的应用,推动智能化 GPU 算子编译与优化技术发展。