Berkeley AI Research·· 2026-07-29
K-Search 如何将 CUDA 内核专业知识迁移至 Apple Silicon
From CUDA to MLX: How K-Search Brings Decades of Kernel Expertise to Apple Silicon
SI 导读
K-Search 框架扩展了 MLX 后端,通过结构化翻译层将 CUDA 内核知识自动适配为 Apple Silicon 的高性能内核。该方法在 Apple Silicon 上达到接近专家水平的性能,相比原生 MLX Attention 内核实现 0.97x 加速,并在 Mamba SSM 内核上较社区 mlx-lm 实现获得最高 20x 的 prefill 加速。
SI 评分42
来源:Berkeley AI Research · bair.berkeley.edu