跳到正文
原文
Berkeley AI Research·· 2026-07-29精选AI 评分75

K-Search:将CUDA内核优化经验自动迁移至Apple Silicon

From CUDA to MLX: How K-Search Brings Decades of Kernel Expertise to Apple Silicon

AI 导读

IBM Research基于K-Search框架开发结构化CUDA-to-MLX翻译层,将CUDA内核优化知识自动迁移至Apple Silicon。在Attention内核上达到原生MLX 0.97倍性能,在Mamba SSM内核上预填充速度较社区实现提升20倍。

推荐理由

提出跨平台内核优化思路,将CUDA经验自动迁移至Apple Silicon,在Mamba SSM上实现20倍预填充加速。

来源:Berkeley AI Research · bair.berkeley.edu