跳到正文
10月7日周三
10月5日周一
  1. GitHub Blog · AI & ML71

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 103.9M 个 GitHub pull request 分布构建,包含 219 个公开 pull request。

    推荐理由:原文给出 ReviewBench 的公开数据、评分规则、指标切片和 Copilot 离线到线上对照,便于比较不同代码审查智能体的强弱与偏好选择。

10月4日周日
  1. Hugging Face Blog75

    Microsoft ThinkingBox 通过 Hugging Face 开放智能体数据库终态评测

    Microsoft ThinkingBox 现已通过 Hugging Face 开放,用数据库终态和副作用评测 AI 智能体,而不是只看最终回复或工具调用。ThinkingBox-Bench 覆盖 507 个有状态业务工作流,每个任务重复 20 次,并报告 pass@1、pass@20 和 observed 20/20。失败诊断显示约 79.9% 的失败来自工具使用,而不是推理。

    推荐理由:原文给出以数据库终态和副作用评测智能体的方法,读者可据此检查工具调用之外的真实结果与多次运行稳定性。

9月29日周二
  1. Microsoft Research60

    Microsoft Research 发布 Quine:面向生物学复杂性的 AI 研究系统

    Microsoft Research 发布 Quine,一个面向生物学复杂性的 AI 研究系统。与 Broad Institute of Harvard and MIT 合作,Quine 在胰腺癌细胞状态研究中预测并优先排序数千个化合物,并在多个湿实验验证高排名候选,从缩小搜索空间到优先少数候选只花一个周末。

    推荐理由:原文展示了多模态生物学世界模型如何与湿实验闭环结合,为人工智能辅助药物筛选提供可迁移的研究范式。

  2. Microsoft Research35

    Microsoft Research Asia – Singapore 一周年:如何推进研究、合作与人才以产生现实影响

    Microsoft Research Asia – Singapore 自 2025 年 7 月 24 日开放以来,作为微软首个东南亚研究实验室,推进前沿 AI 研究、合作与人才培养。其多模态医疗 AI 与自进化诊断智能体已在新加坡医疗生态中部署和扩展。实验室还与 EDB、IMDA 等合作,对齐 National AI Strategy 2.0。

9月24日周四
  1. GitHub Blog · AI & ML53

    GitHub Copilot app 如何渲染超大合并请求

    GitHub Copilot app 重建了合并请求视图,使超大 PR 也能流畅打开和滚动。它处理了 2,200 个文件、超过 100 万行变更和 400 多条行内评论的极端案例,并把代码行几何与动态评论块几何分开。团队用延迟测量、滚动锚定和自动测量循环避免高度变化造成跳动。

9月21日周一
  1. Microsoft Research62

    Microsoft Research 的 RetroChimera 提升小分子规模化合成预测

    Microsoft Research 在 Nature 发表 RetroChimera,开源实现与权重,GitHub 可访问。模型组合 R-SMILES 2 与 NeuralLoc,用学习式集成排序生成逆合成预测。盲测中博士级化学家偏好其反应预测,10 个挑战目标的多步路线成功 9 个,高于 de novo 5、editing 4 和 NeuralSym 2。

    推荐理由:原文给出 Nature 论文中的双模型集成、盲测偏好和开源入口,读者可据此判断逆合成预测如何进入可复用的研究工具。

9月1日周二