Import AI 470:机器没有权利、SPADE 自动化环境生成与 Hawkeye 构建更好 GPU 内核
Import AI 470(https://importai.substack.com/p/import-ai-470-no-rights-for-machines)汇总了 METR 的 AI 加速研究、SPADE 环境生成框架、Hawkeye GPU 内核优化和 Google DeepMind 的 AlphaEvolve 矩阵乘法进展。
Import AI 470(https://importai.substack.com/p/import-ai-470-no-rights-for-machines)汇总了 METR 的 AI 加速研究、SPADE 环境生成框架、Hawkeye GPU 内核优化和 Google DeepMind 的 AlphaEvolve 矩阵乘法进展。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 扩展 MLX,并构建 CUDA 到 MLX 翻译层,在 Apple Silicon 上达到接近专家水平的内核性能。
推荐理由:原文展示 CUDA 优化知识如何转成 MLX 架构策略,并给出注意力与 Mamba 预填充的实测对比,便于理解跨硬件内核优化如何迁移。