跳到正文
原文
Berkeley AI Research·· 2026-07-29

K-Search 如何将 CUDA 内核专业知识迁移至 Apple Silicon

From CUDA to MLX: How K-Search Brings Decades of Kernel Expertise to Apple Silicon

SI 导读

K-Search 框架扩展了 MLX 后端,通过结构化翻译层将 CUDA 内核知识自动适配为 Apple Silicon 的高性能内核。该方法在 Apple Silicon 上达到接近专家水平的性能,相比原生 MLX Attention 内核实现 0.97x 加速,并在 Mamba SSM 内核上较社区 mlx-lm 实现获得最高 20x 的 prefill 加速。

SI 评分42

来源:Berkeley AI Research · bair.berkeley.edu

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有