Berkeley AI Research·· 2026-07-29AI 评分51
K-Search 如何将数十年 CUDA 内核经验迁移到 Apple Silicon
From CUDA to MLX: How K-Search Brings Decades of Kernel Expertise to Apple Silicon
AI 导读
K-Search 扩展了 MLX 后端,并用结构化 CUDA-to-MLX 转译知识优化 Apple Silicon 内核。Attention 内核达到原生 MLX Attention 的 0.97 倍速度;在 M1 Max 上,Mamba SSM 内核的 prefill 速度最高约为社区版 mlx-lm 的 20 倍,decode 表现则相近。
来源:Berkeley AI Research · bair.berkeley.edu