跳到正文
  1. Google DeepMind78

    Google DeepMind 发布 EmbeddingGemma 2 开放轻量多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,这是一个 740M 参数的开放轻量多模态嵌入模型。它基于 Gemma 4 架构,采用 Apache 2.0 许可,支持文本、代码、图像、视频和音频统一嵌入,并提供 8K token 上下文窗口。

    推荐理由:原文给出 740M 参数、8K 上下文窗口、MRL 截断维度和端侧内存占用,便于判断本地多模态检索可用性。

  1. GitHub Blog · AI & ML71

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 103.9M 个 GitHub pull request 分布构建,包含 219 个公开 pull request。

    推荐理由:原文给出 ReviewBench 的公开数据、评分规则、指标切片和 Copilot 离线到线上对照,便于比较不同代码审查智能体的强弱与偏好选择。

  1. Hugging Face Blog75

    Microsoft ThinkingBox 通过 Hugging Face 开放智能体数据库终态评测

    Microsoft ThinkingBox 现已通过 Hugging Face 开放,用数据库终态和副作用评测 AI 智能体,而不是只看最终回复或工具调用。ThinkingBox-Bench 覆盖 507 个有状态业务工作流,每个任务重复 20 次,并报告 pass@1、pass@20 和 observed 20/20。失败诊断显示约 79.9% 的失败来自工具使用,而不是推理。

    推荐理由:原文给出以数据库终态和副作用评测智能体的方法,读者可据此检查工具调用之外的真实结果与多次运行稳定性。

  1. Google Research66

    Google 发布下一代基于 TEE 的可验证联邦学习系统

    Google 发布下一代联邦学习系统,用 TEE 提供可验证和可审计的数据匿名化保证,Gboard 已采用。Gboard 已部署英语和日语 next word prediction 模型,获得更强隐私保证和更高准确率,训练时间也显著缩短。访问策略发布到 Rekor 公共透明日志,KMS 只向匹配策略的 TEE 工作负载提供解密密钥。

    推荐理由:Google 用 TEE 构建可验证联邦学习系统,把训练逻辑放入可远程证明的执行环境,Gboard 已用于英语和日语 next word prediction,并带来更强隐私保证与更高准确率。

  1. Google DeepMind67

    Google DeepMind 发布 SynthID Bio 合成生物学水印工具

    Google DeepMind 发布 SynthID Bio,将 SynthID 水印技术用于合成生物学,把不可感知签名嵌入蛋白序列和 3D 结构。湿实验中水印蛋白保持结合功能,可帮助 DNA 合成筛查和公共数据库标注。官方将开源代码和体外数据,并向研究社区发布权重。https://deepmind.google/blog/introducing-synthid-bio/

    推荐理由:原文展示水印蛋白在湿实验中保持结合功能,为人工智能生成生物设计的来源验证和 DNA 合成筛查提供可落地路径。

  1. GitHub Blog · AI & ML72

    GitHub Security Lab Taskflow Agent 实现 AI 驱动 fuzzing

    GitHub Security Lab 开源了 Fuzzing Taskflow,一个基于 GitHub Security Lab Taskflow Agent 的 C/C++ 自动 fuzzing 流水线。

    推荐理由:原文展示 GitHub Security Lab 将 LLM 智能体的决策与 MCP 工具的执行分离,把 C/C++ 项目 fuzzing 中的 harness 编写、覆盖率追踪、crash triage 和漏洞报告生成交给开源自动化流水线。

  1. Microsoft Research63

    Microsoft Research 为 Physical AI Toolchain 增加机器人推理卸载能力

    Microsoft Research 在 Physical AI Toolchain 中新增机器人推理卸载能力,可用 Kubernetes 工具将推理部署到边缘或云端 GPU。

    推荐理由:原文比较了机载 GPU 与边缘或云端推理在移动操作任务中的表现,并量化了任务成功率、延迟和电池寿命差异。

  1. Microsoft Research62

    Microsoft Research 的 RetroChimera 提升小分子规模化合成预测

    Microsoft Research 在 Nature 发表 RetroChimera,开源实现与权重,GitHub 可访问。模型组合 R-SMILES 2 与 NeuralLoc,用学习式集成排序生成逆合成预测。盲测中博士级化学家偏好其反应预测,10 个挑战目标的多步路线成功 9 个,高于 de novo 5、editing 4 和 NeuralSym 2。

    推荐理由:原文给出 Nature 论文中的双模型集成、盲测偏好和开源入口,读者可据此判断逆合成预测如何进入可复用的研究工具。

  1. Berkeley AI Research65

    K-Search 如何将数十年 CUDA 内核经验迁移到 Apple Silicon 的 MLX

    IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 扩展 MLX,并构建 CUDA 到 MLX 翻译层,在 Apple Silicon 上达到接近专家水平的内核性能。

    推荐理由:原文展示 CUDA 优化知识如何转成 MLX 架构策略,并给出注意力与 Mamba 预填充的实测对比,便于理解跨硬件内核优化如何迁移。

已经到底了