K-Search 如何将数十年 CUDA 内核经验迁移到 Apple Silicon 的 MLX
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 扩展 MLX,并构建 CUDA 到 MLX 翻译层,在 Apple Silicon 上达到接近专家水平的内核性能。
推荐理由:原文展示 CUDA 优化知识如何转成 MLX 架构策略,并给出注意力与 Mamba 预填充的实测对比,便于理解跨硬件内核优化如何迁移。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 扩展 MLX,并构建 CUDA 到 MLX 翻译层,在 Apple Silicon 上达到接近专家水平的内核性能。
推荐理由:原文展示 CUDA 优化知识如何转成 MLX 架构策略,并给出注意力与 Mamba 预填充的实测对比,便于理解跨硬件内核优化如何迁移。
Berkeley AI Research 团队提出 GRASP,一种用于学习世界模型的梯度规划器,通过状态提升、状态噪声和动作梯度替代脆弱状态梯度,使长时程规划更可行。在 Push-T 上,GRASP 在 H=40 至 H=80 的成功率分别为 59.0%、43.4%、26.2%、16.0%、10.4%,中位成功时间分别为 8.5s、15.2s、49.1s、79.9s、58.9s。
推荐理由:原文给出长时程世界模型规划的可迁移方法,用状态提升、噪声探索和动作梯度替代脆弱状态梯度,降低优化脆弱性。