京东官方开源 8B 实时视频-语言交互模型,权重、训练与部署全开源
京东官方开源一个 8B 实时视频-语言交互模型,权重、训练与部署全部开源。该模型面向开发者,支持实时视频与语言交互。
京东官方开源一个 8B 实时视频-语言交互模型,权重、训练与部署全部开源。该模型面向开发者,支持实时视频与语言交互。
Amazon Bedrock AgentCore payments 支持 AI 智能体按推理付费,文中展示 Incarna 与 BlockRun 如何用 x402 完成按次推理结算。
推荐理由:原文给出托管钱包、基础设施限额和 x402 结算流程,读者可据此评估智能体按次付费的工程路径与集成成本。
Claude Haiku 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 可用,多数任务成本比 Claude Haiku 4.5 低约 75%。
推荐理由:原文给出亚马逊云 Bedrock 可用入口和约 75% 成本下降,读者可据此评估高量子智能体与编码类生产工作负载的取舍空间。
Nemotron 通过 SFT、RL 与生成验证修正系统在 IOI 2026 和 IMO 2026 达到金牌水平。IOI 2026 使用 Nemotron-3-Ultra-CC 得 535.4/600,IMO 2026 得 30/42,均超过金牌阈值。
推荐理由:原文给出 Nemotron 通过监督微调、强化学习与生成验证修正循环达到金牌水平的可复现训练配方,读者可迁移到同类任务。
Google DeepMind 发布 EmbeddingGemma 2,这是一个 740M 参数的开放轻量多模态嵌入模型。它基于 Gemma 4 架构,采用 Apache 2.0 许可,支持文本、代码、图像、视频和音频统一嵌入,并提供 8K token 上下文窗口。
推荐理由:原文给出 740M 参数、8K 上下文窗口、MRL 截断维度和端侧内存占用,便于判断本地多模态检索可用性。
电信运营商正基于开放模型构建 AI 战略,NVIDIA 最新 State of AI in Telecommunications 报告显示 89% 受访者认为开源模型和软件重要。
NVIDIA Inception 初创公司正用 AI 覆盖乳腺癌筛查、风险评估和治疗规划,帮助缩小诊疗差距。iSono Health 的 FDA-cleared ATUSA 已商用,每侧约 2 分钟完成 3D 超声,公司称比手持 2D 超声敏感度高 28%。Whiterabbit.ai 的 WRDensity 自动评估乳腺密度,Ataraxis AI 用病理切片预测治疗反应和复发风险。
Google 发布下一代联邦学习系统,用 TEE 提供可验证和可审计的数据匿名化保证,Gboard 已采用。Gboard 已部署英语和日语 next word prediction 模型,获得更强隐私保证和更高准确率,训练时间也显著缩短。访问策略发布到 Rekor 公共透明日志,KMS 只向匹配策略的 TEE 工作负载提供解密密钥。
推荐理由:Google 用 TEE 构建可验证联邦学习系统,把训练逻辑放入可远程证明的执行环境,Gboard 已用于英语和日语 next word prediction,并带来更强隐私保证与更高准确率。
NVIDIA 发布 DGX Spark 64GB 本地 AI 新配置,10月23日由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 提供,起价 $4,999。
推荐理由:64GB 配置让本地智能体与 100B 参数模型可在设备内运行,双机集群可把内存扩展到 128GB。
GPT-6 Astra Ultrafast 现已在 OpenAI API 和符合条件的 ChatGPT Work、Codex 用户中可用,运行于 NVIDIA Blackwell GPU。
推荐理由:原文把 Ultrafast 相对标准模式的 token 生成速度优势落到编码智能体的工具调用循环,读者可据此判断低延迟对开发工作流的影响。
Microsoft Research 在 Physical AI Toolchain 中新增机器人推理卸载能力,可用 Kubernetes 工具将推理部署到边缘或云端 GPU。
推荐理由:原文比较了机载 GPU 与边缘或云端推理在移动操作任务中的表现,并量化了任务成功率、延迟和电池寿命差异。
Google 公布 Private AI Compute 将加入私有服务端持久内存,使 AI 记忆可跨设备保留并保持端侧隐私标准。密钥仅保存在个人设备,云端 secure enclave 临时解密并立即重新加密,确保数据即使对 Google 也不可见。Google 还公布更新技术白皮书、服务器软件防篡改公开记录和独立审计结果。
Microsoft Research 在 Nature 发表 RetroChimera,开源实现与权重,GitHub 可访问。模型组合 R-SMILES 2 与 NeuralLoc,用学习式集成排序生成逆合成预测。盲测中博士级化学家偏好其反应预测,10 个挑战目标的多步路线成功 9 个,高于 de novo 5、editing 4 和 NeuralSym 2。
推荐理由:原文给出 Nature 论文中的双模型集成、盲测偏好和开源入口,读者可据此判断逆合成预测如何进入可复用的研究工具。
Google DeepMind 发布 AlphaGenome Atlas,提供人类基因组 9 billion 个单核苷酸变异的预测,并推出 AVI 评分。该资源是 1-petabyte 数据集,比 AlphaFold Database 大 30 倍以上,覆盖数百种人和小鼠细胞类型与组织。
推荐理由:原文给出覆盖 9 billion 个单核苷酸变异的预测资源与 AVI 评分,帮助研究者快速排序并解释基因组变异的相关分子影响。
Microsoft Research 发布 GigaPath-Flash 与 GigaTIME-Flash,两个开放权重病理基础模型以 Apache 2.0 许可在 HuggingFace 提供。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 扩展 MLX,并构建 CUDA 到 MLX 翻译层,在 Apple Silicon 上达到接近专家水平的内核性能。
推荐理由:原文展示 CUDA 优化知识如何转成 MLX 架构策略,并给出注意力与 Mamba 预填充的实测对比,便于理解跨硬件内核优化如何迁移。
BAIR 发布自适应并行推理(APR)研究综述,分析模型如何自行决定何时分解子任务、生成多少并行线程以及如何协调。文章比较 self-consistency、Tree-of-Thoughts、MCTS、ParaThinker、GroupThink 和 Hogwild!