GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 103.9M 个 GitHub pull request 分布构建,包含 219 个公开 pull request。
推荐理由:原文给出 ReviewBench 的公开数据、评分规则、指标切片和 Copilot 离线到线上对照,便于比较不同代码审查智能体的强弱与偏好选择。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 103.9M 个 GitHub pull request 分布构建,包含 219 个公开 pull request。
推荐理由:原文给出 ReviewBench 的公开数据、评分规则、指标切片和 Copilot 离线到线上对照,便于比较不同代码审查智能体的强弱与偏好选择。
GitHub 提出三项技能,帮助开发者适应 AI 改变的工作方式:指导 AI 智能体、评估 AI 输出、用 AI 解决更大问题。GitHub Copilot 的 Rubber Duck agent 用第二个模型批评计划、代码和测试。开发者可把更多实现交给 AI,把时间用于客户问题、架构权衡和技术决策。
GitHub Copilot app 的 canvases 允许用户通过 /create-canvas 用自然语言生成共享自定义界面。该界面可由用户和 agent 双向更新,并保存为 extension 供团队共享或个人复用。Awesome Copilot 社区也提供现成 canvas extensions,可安装后让 agent 按工作流定制。
推荐理由:原文说明 Copilot app 的画布可由自然语言生成并支持用户与智能体双向更新,读者可将其迁移到现有自定义工作流场景。
GitHub Copilot app 的 canvas 提供可替代聊天的自定义界面,它是一个在应用内运行的全栈应用,可让 agent 与应用内服务双向通信。文章用 Connect 4、Winget、SQLite 和开发工作流示例,说明自定义界面可减少 token 消耗并让用户更少介入。
GitHub Security Lab 开源了 Fuzzing Taskflow,一个基于 GitHub Security Lab Taskflow Agent 的 C/C++ 自动 fuzzing 流水线。
推荐理由:原文展示 GitHub Security Lab 将 LLM 智能体的决策与 MCP 工具的执行分离,把 C/C++ 项目 fuzzing 中的 harness 编写、覆盖率追踪、crash triage 和漏洞报告生成交给开源自动化流水线。
GitHub Copilot app 重建了合并请求视图,使超大 PR 也能流畅打开和滚动。它处理了 2,200 个文件、超过 100 万行变更和 400 多条行内评论的极端案例,并把代码行几何与动态评论块几何分开。团队用延迟测量、滚动锚定和自动测量循环避免高度变化造成跳动。
Google Research 介绍 MilleMiglia,一个用于生成中程物流真实基准的 C++ 实例生成器。它针对连接区域配送中心的中程运输,生成真实且保护隐私的模拟数据。源码和文档可在 GitHub 获取。
GitHub Podcast 最新一集拆解五个 AI 开发热门观点,给出关于代码审查、AI 使用、MCP、Skills 与 RAG 的实用判断。文章认为 AI 生成代码仍需按风险审查,MCP 提供标准接口、Skills 提供流程上下文、RAG 用于补充模型外信息,三者可在同一工作流共存。
Google DeepMind 发布 AlphaGenome Atlas,提供人类基因组 9 billion 个单核苷酸变异的预测,并推出 AVI 评分。该资源是 1-petabyte 数据集,比 AlphaFold Database 大 30 倍以上,覆盖数百种人和小鼠细胞类型与组织。
推荐理由:原文给出覆盖 9 billion 个单核苷酸变异的预测资源与 AVI 评分,帮助研究者快速排序并解释基因组变异的相关分子影响。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 扩展 MLX,并构建 CUDA 到 MLX 翻译层,在 Apple Silicon 上达到接近专家水平的内核性能。
推荐理由:原文展示 CUDA 优化知识如何转成 MLX 架构策略,并给出注意力与 Mamba 预填充的实测对比,便于理解跨硬件内核优化如何迁移。
Berkeley AI Research 在 NeurIPS 2025 论文中提出用互信息直接评估和优化成像系统信息量的框架。该方法从噪声测量和噪声模型估计信息,在彩色摄影、射电天文、无透镜成像和显微成像四个领域预测下游性能。IDEAL 通过信息估计的梯度反馈优化成像参数,无需训练解码器,在彩色滤光片设计中匹配端到端优化性能并降低内存和计算需求。