AINews:OpenAI 发布 722 份数学手稿,称解决 500 个开放数学问题中的 90 个
AINews 汇总 10/5/2026-10/6/2026 的 AI 动态,重点报道 OpenAI 在 GitHub 发布 722 份数学手稿,称解决 500 个开放数学问题中的 90 个。
AINews 汇总 10/5/2026-10/6/2026 的 AI 动态,重点报道 OpenAI 在 GitHub 发布 722 份数学手稿,称解决 500 个开放数学问题中的 90 个。
Google Research 展示 Google Earth AI 的 Population Dynamics Foundation Model (PDFM) 如何作为全球公共卫生的地理空间基础模型概念验证。
Google Research 发布智能体隐私与安全开放问题报告,汇总 50 多位学术和产业人士在 2025 年末纽约 CAPS Workshop 的讨论。报告以 Contextual Integrity 为基础,提出上下文策略引擎、多层防护和动态 Agent Gym 评估环境。
Google 发布下一代联邦学习系统,用 TEE 提供可验证和可审计的数据匿名化保证,Gboard 已采用。Gboard 已部署英语和日语 next word prediction 模型,获得更强隐私保证和更高准确率,训练时间也显著缩短。访问策略发布到 Rekor 公共透明日志,KMS 只向匹配策略的 TEE 工作负载提供解密密钥。
推荐理由:Google 用 TEE 构建可验证联邦学习系统,把训练逻辑放入可远程证明的执行环境,Gboard 已用于英语和日语 next word prediction,并带来更强隐私保证与更高准确率。
ServiceNow CoreAI 的 AutoSynthData 用目标模型失败和更强教师成功生成并验证企业智能体训练任务。在 EnterpriseOps Gym 中,以 Gemma-4-26B-A4B-it 为目标模型,Hybrid 域用 Qwen3.8-27B 作教师,SFT 使 mean Pass@1 提升 7.2 个百分点。
Google Research 提出 Diffusion Controller 框架,将扩散图像生成的去噪过程重构为连续控制问题,用轻量附加网络引导生成。该框架在 Stable Diffusion v1.4 上以 HPS-v2 评估,灰盒版本在 SFT 和 RWL 中胜过 LoRA,白盒版本相对基线达到 90% 胜率。
Google Research 提出 AI video co-director,一个基于 Gemini 和 Veo 的统一多智能体框架,用于自动化连贯长视频生成。
推荐理由:原文给出基于 Gemini 和 Veo 的多智能体编排方法,展示长视频一致性如何从提示链转向全局优化与闭环修正的生成流程。
Microsoft Research 在 Nature 发表 RetroChimera,开源实现与权重,GitHub 可访问。模型组合 R-SMILES 2 与 NeuralLoc,用学习式集成排序生成逆合成预测。盲测中博士级化学家偏好其反应预测,10 个挑战目标的多步路线成功 9 个,高于 de novo 5、editing 4 和 NeuralSym 2。
推荐理由:原文给出 Nature 论文中的双模型集成、盲测偏好和开源入口,读者可据此判断逆合成预测如何进入可复用的研究工具。
RAND 报告认为,美国应采取 Freedom of Action 战略,通过投入资金保留选项,在通往超级智能的不确定路径中保持地缘政治优势。该战略包括建设 human-AI ecosystem、AI-security architecture、改造国家安全体系,并列出七类策略与五大不确定性。研究人员在脑组织减少的小鼠中培养人脑组织块。
Import AI 470(https://importai.substack.com/p/import-ai-470-no-rights-for-machines)汇总了 METR 的 AI 加速研究、SPADE 环境生成框架、Hawkeye GPU 内核优化和 Google DeepMind 的 AlphaEvolve 矩阵乘法进展。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 扩展 MLX,并构建 CUDA 到 MLX 翻译层,在 Apple Silicon 上达到接近专家水平的内核性能。
推荐理由:原文展示 CUDA 优化知识如何转成 MLX 架构策略,并给出注意力与 Mamba 预填充的实测对比,便于理解跨硬件内核优化如何迁移。
ABBEL 提出将摘要作为自然语言 belief states,并用 belief grading 监督其信息内容,以提升 LLM 长程交互效率。在 CollabBench 协作编码中,ABBEL-rec-BG 将 full context 性能差距减少约 50%,训练步数从 100 降到 50,峰值 token 低于 full context。
BAIR 发布自适应并行推理(APR)研究综述,分析模型如何自行决定何时分解子任务、生成多少并行线程以及如何协调。文章比较 self-consistency、Tree-of-Thoughts、MCTS、ParaThinker、GroupThink 和 Hogwild!
Berkeley AI Research 团队提出 GRASP,一种用于学习世界模型的梯度规划器,通过状态提升、状态噪声和动作梯度替代脆弱状态梯度,使长时程规划更可行。在 Push-T 上,GRASP 在 H=40 至 H=80 的成功率分别为 59.0%、43.4%、26.2%、16.0%、10.4%,中位成功时间分别为 8.5s、15.2s、49.1s、79.9s、58.9s。
推荐理由:原文给出长时程世界模型规划的可迁移方法,用状态提升、噪声探索和动作梯度替代脆弱状态梯度,降低优化脆弱性。
Berkeley AI Research 介绍 SPEX 与 ProxySPEX,用稀疏恢复和层次结构从大规模候选交互中识别关键交互。文章展示其在长上下文特征归因、CIFAR-10 数据归因和 MMLU 注意力头剪枝中的应用,ProxySPEX 可用约 10 倍更少消融达到 SPEX 性能。
推荐理由:原文给出两种算法用更少消融发现关键交互,并展示其在长上下文、数据归因和注意力头剪枝中的可迁移方法。
Berkeley AI Research 在 NeurIPS 2025 论文中提出用互信息直接评估和优化成像系统信息量的框架。该方法从噪声测量和噪声模型估计信息,在彩色摄影、射电天文、无透镜成像和显微成像四个领域预测下游性能。IDEAL 通过信息估计的梯度反馈优化成像参数,无需训练解码器,在彩色滤光片设计中匹配端到端优化性能并降低内存和计算需求。