跳到正文
  1. AWS Machine Learning Blog73

    Claude Haiku 5.5 在 AWS 上线

    Claude Haiku 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 可用,多数任务成本比 Claude Haiku 4.5 低约 75%。

    推荐理由:原文给出亚马逊云 Bedrock 可用入口和约 75% 成本下降,读者可据此评估高量子智能体与编码类生产工作负载的取舍空间。

  1. Hugging Face Blog76

    Nemotron 通过微调在 IOI 与 IMO 取得两项金牌级结果

    Nemotron 通过 SFT、RL 与生成验证修正系统在 IOI 2026 和 IMO 2026 达到金牌水平。IOI 2026 使用 Nemotron-3-Ultra-CC 得 535.4/600,IMO 2026 得 30/42,均超过金牌阈值。

    推荐理由:原文给出 Nemotron 通过监督微调、强化学习与生成验证修正循环达到金牌水平的可复现训练配方,读者可迁移到同类任务。

  2. OpenAI News73

    OpenAI 在 ChatGPT 全球推出 GPT-6 与面向所有人的 Intelligent UI

    OpenAI 正在全球范围内通过 ChatGPT 推出 GPT-6,并搭载 Intelligent UI。该更新提供更快响应、视觉内容和可直接探索使用的交互体验。

    推荐理由:OpenAI 官方说明 GPT-6 随 ChatGPT 在全球范围上线,并加入可交互的 Intelligent UI 与视觉内容,便于读者判断当前新模型如何影响日常使用体验。

  3. Google DeepMind78

    Google DeepMind 发布 EmbeddingGemma 2 开放轻量多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,这是一个 740M 参数的开放轻量多模态嵌入模型。它基于 Gemma 4 架构,采用 Apache 2.0 许可,支持文本、代码、图像、视频和音频统一嵌入,并提供 8K token 上下文窗口。

    推荐理由:原文给出 740M 参数、8K 上下文窗口、MRL 截断维度和端侧内存占用,便于判断本地多模态检索可用性。

  1. Mistral AI76

    Mistral 发布 Mistral Large 4 公开预览

    Mistral 发布 Mistral Large 4 公开预览,提供 1 trillion 参数、52 billion 激活参数的原生多模态开放权重模型。预览 API 已在 Mistral Studio 开放,权重将于本月底发布,并重点展示网络安全、编码、智能体工作流和多模态理解能力。详情见 https://mistral.ai/news/mistral-large-4/。

    推荐理由:原文给出开放权重模型在网络安全、编码和智能体工作流上的基准对比,便于判断其自部署与主权 AI 落地价值。

  1. GitHub Blog · AI & ML71

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 103.9M 个 GitHub pull request 分布构建,包含 219 个公开 pull request。

    推荐理由:原文给出 ReviewBench 的公开数据、评分规则、指标切片和 Copilot 离线到线上对照,便于比较不同代码审查智能体的强弱与偏好选择。

  1. Hugging Face Blog75

    Microsoft ThinkingBox 通过 Hugging Face 开放智能体数据库终态评测

    Microsoft ThinkingBox 现已通过 Hugging Face 开放,用数据库终态和副作用评测 AI 智能体,而不是只看最终回复或工具调用。ThinkingBox-Bench 覆盖 507 个有状态业务工作流,每个任务重复 20 次,并报告 pass@1、pass@20 和 observed 20/20。失败诊断显示约 79.9% 的失败来自工具使用,而不是推理。

    推荐理由:原文给出以数据库终态和副作用评测智能体的方法,读者可据此检查工具调用之外的真实结果与多次运行稳定性。

  1. Hugging Face Blog63

    Ai2 开源 AstaBrief 8B:Asta 快速科学报告生成模型

    Ai2 开源 AstaBrief 8B,该模型基于 Qwen3-8B,把研究问题和检索文献片段转为带引用报告,并作为 Asta 的 Fast mode 与 Claude-powered Thinking mode 并行。

    推荐理由:原文给出 AstaBrief 8B 的训练数据、评测指标、速度对比和本地部署入口,读者可判断开源小模型如何进入科学报告生成流程。

  2. Google Research66

    Google 发布下一代基于 TEE 的可验证联邦学习系统

    Google 发布下一代联邦学习系统,用 TEE 提供可验证和可审计的数据匿名化保证,Gboard 已采用。Gboard 已部署英语和日语 next word prediction 模型,获得更强隐私保证和更高准确率,训练时间也显著缩短。访问策略发布到 Rekor 公共透明日志,KMS 只向匹配策略的 TEE 工作负载提供解密密钥。

    推荐理由:Google 用 TEE 构建可验证联邦学习系统,把训练逻辑放入可远程证明的执行环境,Gboard 已用于英语和日语 next word prediction,并带来更强隐私保证与更高准确率。

  3. NVIDIA Blog63

    NVIDIA Blackwell GPU 如何加速 OpenAI GPT-6 Astra Ultrafast

    GPT-6 Astra Ultrafast 现已在 OpenAI API 和符合条件的 ChatGPT Work、Codex 用户中可用,运行于 NVIDIA Blackwell GPU。

    推荐理由:原文把 Ultrafast 相对标准模式的 token 生成速度优势落到编码智能体的工具调用循环,读者可据此判断低延迟对开发工作流的影响。

  1. Google DeepMind75

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,后续将面向开发者、企业和消费者推出。

    推荐理由:原文给出 Gemini 4 Argon 的 1M 输出上限、企业基准表现、网络安全防御定位和分阶段开放路径,便于判断它对复杂工作流的影响。

  1. Google DeepMind67

    Google DeepMind 发布 SynthID Bio 合成生物学水印工具

    Google DeepMind 发布 SynthID Bio,将 SynthID 水印技术用于合成生物学,把不可感知签名嵌入蛋白序列和 3D 结构。湿实验中水印蛋白保持结合功能,可帮助 DNA 合成筛查和公共数据库标注。官方将开源代码和体外数据,并向研究社区发布权重。https://deepmind.google/blog/introducing-synthid-bio/

    推荐理由:原文展示水印蛋白在湿实验中保持结合功能,为人工智能生成生物设计的来源验证和 DNA 合成筛查提供可落地路径。

  2. Hugging Face Blog66

    Hugging Face 推出 Open TTS Leaderboard 评测多语言 TTS 与语音克隆

    Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源多语言 TTS 与语音克隆模型。它使用 Qwen3 ASR 计算 WER/CER,并用 RTXf、TTFA 和 WavLM SIM 衡量生成速度与音色相似度,默认按 Seed TTS Eval 与 CV3 Eval 的英文 macro-average WER 排名。

    推荐理由:Hugging Face 推出 Open TTS Leaderboard,用可懂度、生成速度和音色相似度指标评估开源多语言 TTS,让模型比较从数周投票缩短到数小时,并保留人工偏好入口。

  1. Microsoft Research60

    Microsoft Research 发布 Quine:面向生物学复杂性的 AI 研究系统

    Microsoft Research 发布 Quine,一个面向生物学复杂性的 AI 研究系统。与 Broad Institute of Harvard and MIT 合作,Quine 在胰腺癌细胞状态研究中预测并优先排序数千个化合物,并在多个湿实验验证高排名候选,从缩小搜索空间到优先少数候选只花一个周末。

    推荐理由:原文展示了多模态生物学世界模型如何与湿实验闭环结合,为人工智能辅助药物筛选提供可迁移的研究范式。

  1. GitHub Blog · AI & ML63

    GitHub Copilot app 入门:如何用 canvases 构建自定义工作流

    GitHub Copilot app 的 canvases 允许用户通过 /create-canvas 用自然语言生成共享自定义界面。该界面可由用户和 agent 双向更新,并保存为 extension 供团队共享或个人复用。Awesome Copilot 社区也提供现成 canvas extensions,可安装后让 agent 按工作流定制。

    推荐理由:原文说明 Copilot app 的画布可由自然语言生成并支持用户与智能体双向更新,读者可将其迁移到现有自定义工作流场景。

  1. Google Research63

    Google Research 提出 AI video co-director 框架,用于自动化连贯长视频生成

    Google Research 提出 AI video co-director,一个基于 Gemini 和 Veo 的统一多智能体框架,用于自动化连贯长视频生成。

    推荐理由:原文给出基于 Gemini 和 Veo 的多智能体编排方法,展示长视频一致性如何从提示链转向全局优化与闭环修正的生成流程。

  2. GitHub Blog · AI & ML72

    GitHub Security Lab Taskflow Agent 实现 AI 驱动 fuzzing

    GitHub Security Lab 开源了 Fuzzing Taskflow,一个基于 GitHub Security Lab Taskflow Agent 的 C/C++ 自动 fuzzing 流水线。

    推荐理由:原文展示 GitHub Security Lab 将 LLM 智能体的决策与 MCP 工具的执行分离,把 C/C++ 项目 fuzzing 中的 harness 编写、覆盖率追踪、crash triage 和漏洞报告生成交给开源自动化流水线。

  3. Google DeepMind60

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时语音对话结合,在 Gemini Enterprise 提供近实时视觉形象功能。

    推荐理由:原文给出 Gemini Enterprise 可用入口和异步工具调用能力细节,读者可据此判断实时视频对话如何进入企业客服与交互演示。