京东官方开源 8B 实时视频-语言交互模型,权重、训练与部署全开源
京东官方开源一个 8B 实时视频-语言交互模型,权重、训练与部署全部开源。该模型面向开发者,支持实时视频与语言交互。
京东官方开源一个 8B 实时视频-语言交互模型,权重、训练与部署全部开源。该模型面向开发者,支持实时视频与语言交互。
Amazon Bedrock AgentCore payments 支持 AI 智能体按推理付费,文中展示 Incarna 与 BlockRun 如何用 x402 完成按次推理结算。
推荐理由:原文给出托管钱包、基础设施限额和 x402 结算流程,读者可据此评估智能体按次付费的工程路径与集成成本。
Oracle 用 ChatGPT Work 和 Codex 将招聘、工程和运营中的数天工作缩短到几分钟。Oracle 把专家知识转化为快速、可重复的工作流,用于招聘、工程和运营。
LegalOn 将估算的每日 Codex 成本降低 65%,同时保持开发速度。它把 Astra、Sol 和 Luna 匹配到任务,并策略性管理预算。
Claude Haiku 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 可用,多数任务成本比 Claude Haiku 4.5 低约 75%。
推荐理由:原文给出亚马逊云 Bedrock 可用入口和约 75% 成本下降,读者可据此评估高量子智能体与编码类生产工作负载的取舍空间。
Nemotron 通过 SFT、RL 与生成验证修正系统在 IOI 2026 和 IMO 2026 达到金牌水平。IOI 2026 使用 Nemotron-3-Ultra-CC 得 535.4/600,IMO 2026 得 30/42,均超过金牌阈值。
推荐理由:原文给出 Nemotron 通过监督微调、强化学习与生成验证修正循环达到金牌水平的可复现训练配方,读者可迁移到同类任务。
College Planner 将加入 ChatGPT for Teens,帮助青少年管理大学申请。该更新还新增 flashcards、quizzes 和 teen AI council,帮助青少年学习、规划并塑造 AI 未来。
Radisson Hotel Group 与 Accenture 合作,基于 OpenAI 技术构建 ChatGPT 插件,将酒店发现引入 ChatGPT。该插件帮助旅客在规划行程时查找、比较和预订酒店。
OpenAI 正在全球范围内通过 ChatGPT 推出 GPT-6,并搭载 Intelligent UI。该更新提供更快响应、视觉内容和可直接探索使用的交互体验。
推荐理由:OpenAI 官方说明 GPT-6 随 ChatGPT 在全球范围上线,并加入可交互的 Intelligent UI 与视觉内容,便于读者判断当前新模型如何影响日常使用体验。
Google DeepMind 发布 EmbeddingGemma 2,这是一个 740M 参数的开放轻量多模态嵌入模型。它基于 Gemma 4 架构,采用 Apache 2.0 许可,支持文本、代码、图像、视频和音频统一嵌入,并提供 8K token 上下文窗口。
推荐理由:原文给出 740M 参数、8K 上下文窗口、MRL 截断维度和端侧内存占用,便于判断本地多模态检索可用性。
微软研究院播客访谈 Jennifer Neville,讨论 AI 出错与失败如何帮助改进模型。她指出单轮基准表现高的模型在多轮对话中性能会显著下降,长程智能体文档编辑中错误会累积。用户应检查答案、改写请求并给出具体反馈,以推动模型改进。
Google Research 展示 Google Earth AI 的 Population Dynamics Foundation Model (PDFM) 如何作为全球公共卫生的地理空间基础模型概念验证。
电信运营商正基于开放模型构建 AI 战略,NVIDIA 最新 State of AI in Telecommunications 报告显示 89% 受访者认为开源模型和软件重要。
Mistral 发布 Mistral Large 4 公开预览,提供 1 trillion 参数、52 billion 激活参数的原生多模态开放权重模型。预览 API 已在 Mistral Studio 开放,权重将于本月底发布,并重点展示网络安全、编码、智能体工作流和多模态理解能力。详情见 https://mistral.ai/news/mistral-large-4/。
推荐理由:原文给出开放权重模型在网络安全、编码和智能体工作流上的基准对比,便于判断其自部署与主权 AI 落地价值。
Jump Trading 使用 OpenAI 的 ChatGPT 扩展量化研究。其较长运行的 AI 工作流将多个数据源与人工审核结合,用于量化研究。
Google Research 发布智能体隐私与安全开放问题报告,汇总 50 多位学术和产业人士在 2025 年末纽约 CAPS Workshop 的讨论。报告以 Contextual Integrity 为基础,提出上下文策略引擎、多层防护和动态 Agent Gym 评估环境。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 103.9M 个 GitHub pull request 分布构建,包含 219 个公开 pull request。
推荐理由:原文给出 ReviewBench 的公开数据、评分规则、指标切片和 Copilot 离线到线上对照,便于比较不同代码审查智能体的强弱与偏好选择。
NVIDIA Inception 初创公司正用 AI 覆盖乳腺癌筛查、风险评估和治疗规划,帮助缩小诊疗差距。iSono Health 的 FDA-cleared ATUSA 已商用,每侧约 2 分钟完成 3D 超声,公司称比手持 2D 超声敏感度高 28%。Whiterabbit.ai 的 WRDensity 自动评估乳腺密度,Ataraxis AI 用病理切片预测治疗反应和复发风险。
Microsoft ThinkingBox 现已通过 Hugging Face 开放,用数据库终态和副作用评测 AI 智能体,而不是只看最终回复或工具调用。ThinkingBox-Bench 覆盖 507 个有状态业务工作流,每个任务重复 20 次,并报告 pass@1、pass@20 和 observed 20/20。失败诊断显示约 79.9% 的失败来自工具使用,而不是推理。
推荐理由:原文给出以数据库终态和副作用评测智能体的方法,读者可据此检查工具调用之外的真实结果与多次运行稳定性。
Ai2 开源 AstaBrief 8B,该模型基于 Qwen3-8B,把研究问题和检索文献片段转为带引用报告,并作为 Asta 的 Fast mode 与 Claude-powered Thinking mode 并行。
推荐理由:原文给出 AstaBrief 8B 的训练数据、评测指标、速度对比和本地部署入口,读者可判断开源小模型如何进入科学报告生成流程。
GitHub 提出三项技能,帮助开发者适应 AI 改变的工作方式:指导 AI 智能体、评估 AI 输出、用 AI 解决更大问题。GitHub Copilot 的 Rubber Duck agent 用第二个模型批评计划、代码和测试。开发者可把更多实现交给 AI,把时间用于客户问题、架构权衡和技术决策。
Google 发布下一代联邦学习系统,用 TEE 提供可验证和可审计的数据匿名化保证,Gboard 已采用。Gboard 已部署英语和日语 next word prediction 模型,获得更强隐私保证和更高准确率,训练时间也显著缩短。访问策略发布到 Rekor 公共透明日志,KMS 只向匹配策略的 TEE 工作负载提供解密密钥。
推荐理由:Google 用 TEE 构建可验证联邦学习系统,把训练逻辑放入可远程证明的执行环境,Gboard 已用于英语和日语 next word prediction,并带来更强隐私保证与更高准确率。
NVIDIA 发布 DGX Spark 64GB 本地 AI 新配置,10月23日由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 提供,起价 $4,999。
推荐理由:64GB 配置让本地智能体与 100B 参数模型可在设备内运行,双机集群可把内存扩展到 128GB。
ServiceNow CoreAI 的 AutoSynthData 用目标模型失败和更强教师成功生成并验证企业智能体训练任务。在 EnterpriseOps Gym 中,以 Gemma-4-26B-A4B-it 为目标模型,Hybrid 域用 Qwen3.8-27B 作教师,SFT 使 mean Pass@1 提升 7.2 个百分点。
GPT-6 Astra Ultrafast 现已在 OpenAI API 和符合条件的 ChatGPT Work、Codex 用户中可用,运行于 NVIDIA Blackwell GPU。
推荐理由:原文把 Ultrafast 相对标准模式的 token 生成速度优势落到编码智能体的工具调用循环,读者可据此判断低延迟对开发工作流的影响。
Google DeepMind 发布 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,后续将面向开发者、企业和消费者推出。
推荐理由:原文给出 Gemini 4 Argon 的 1M 输出上限、企业基准表现、网络安全防御定位和分阶段开放路径,便于判断它对复杂工作流的影响。
Google DeepMind 发布 SynthID Bio,将 SynthID 水印技术用于合成生物学,把不可感知签名嵌入蛋白序列和 3D 结构。湿实验中水印蛋白保持结合功能,可帮助 DNA 合成筛查和公共数据库标注。官方将开源代码和体外数据,并向研究社区发布权重。https://deepmind.google/blog/introducing-synthid-bio/
推荐理由:原文展示水印蛋白在湿实验中保持结合功能,为人工智能生成生物设计的来源验证和 DNA 合成筛查提供可落地路径。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源多语言 TTS 与语音克隆模型。它使用 Qwen3 ASR 计算 WER/CER,并用 RTXf、TTFA 和 WavLM SIM 衡量生成速度与音色相似度,默认按 Seed TTS Eval 与 CV3 Eval 的英文 macro-average WER 排名。
推荐理由:Hugging Face 推出 Open TTS Leaderboard,用可懂度、生成速度和音色相似度指标评估开源多语言 TTS,让模型比较从数周投票缩短到数小时,并保留人工偏好入口。
Google Research 提出 Diffusion Controller 框架,将扩散图像生成的去噪过程重构为连续控制问题,用轻量附加网络引导生成。该框架在 Stable Diffusion v1.4 上以 HPS-v2 评估,灰盒版本在 SFT 和 RWL 中胜过 LoRA,白盒版本相对基线达到 90% 胜率。
Microsoft Research 发布 Quine,一个面向生物学复杂性的 AI 研究系统。与 Broad Institute of Harvard and MIT 合作,Quine 在胰腺癌细胞状态研究中预测并优先排序数千个化合物,并在多个湿实验验证高排名候选,从缩小搜索空间到优先少数候选只花一个周末。
推荐理由:原文展示了多模态生物学世界模型如何与湿实验闭环结合,为人工智能辅助药物筛选提供可迁移的研究范式。
Microsoft Research Asia – Singapore 自 2025 年 7 月 24 日开放以来,作为微软首个东南亚研究实验室,推进前沿 AI 研究、合作与人才培养。其多模态医疗 AI 与自进化诊断智能体已在新加坡医疗生态中部署和扩展。实验室还与 EDB、IMDA 等合作,对齐 National AI Strategy 2.0。
GitHub Copilot app 的 canvases 允许用户通过 /create-canvas 用自然语言生成共享自定义界面。该界面可由用户和 agent 双向更新,并保存为 extension 供团队共享或个人复用。Awesome Copilot 社区也提供现成 canvas extensions,可安装后让 agent 按工作流定制。
推荐理由:原文说明 Copilot app 的画布可由自然语言生成并支持用户与智能体双向更新,读者可将其迁移到现有自定义工作流场景。
GitHub Copilot app 的 canvas 提供可替代聊天的自定义界面,它是一个在应用内运行的全栈应用,可让 agent 与应用内服务双向通信。文章用 Connect 4、Winget、SQLite 和开发工作流示例,说明自定义界面可减少 token 消耗并让用户更少介入。
Google Research 提出 AI video co-director,一个基于 Gemini 和 Veo 的统一多智能体框架,用于自动化连贯长视频生成。
推荐理由:原文给出基于 Gemini 和 Veo 的多智能体编排方法,展示长视频一致性如何从提示链转向全局优化与闭环修正的生成流程。
GitHub Security Lab 开源了 Fuzzing Taskflow,一个基于 GitHub Security Lab Taskflow Agent 的 C/C++ 自动 fuzzing 流水线。
推荐理由:原文展示 GitHub Security Lab 将 LLM 智能体的决策与 MCP 工具的执行分离,把 C/C++ 项目 fuzzing 中的 harness 编写、覆盖率追踪、crash triage 和漏洞报告生成交给开源自动化流水线。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时语音对话结合,在 Gemini Enterprise 提供近实时视觉形象功能。
推荐理由:原文给出 Gemini Enterprise 可用入口和异步工具调用能力细节,读者可据此判断实时视频对话如何进入企业客服与交互演示。
GitHub Copilot app 重建了合并请求视图,使超大 PR 也能流畅打开和滚动。它处理了 2,200 个文件、超过 100 万行变更和 400 多条行内评论的极端案例,并把代码行几何与动态评论块几何分开。团队用延迟测量、滚动锚定和自动测量循环避免高度变化造成跳动。
Microsoft Research 在 Physical AI Toolchain 中新增机器人推理卸载能力,可用 Kubernetes 工具将推理部署到边缘或云端 GPU。
推荐理由:原文比较了机载 GPU 与边缘或云端推理在移动操作任务中的表现,并量化了任务成功率、延迟和电池寿命差异。
Google 公布 Private AI Compute 将加入私有服务端持久内存,使 AI 记忆可跨设备保留并保持端侧隐私标准。密钥仅保存在个人设备,云端 secure enclave 临时解密并立即重新加密,确保数据即使对 Google 也不可见。Google 还公布更新技术白皮书、服务器软件防篡改公开记录和独立审计结果。
Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言创建全新声音并用 30 秒样本复刻。
推荐理由:原文给出两款 Gemini 3.8 TTS 模型的声音复刻、逐行导演与开放入口,便于判断其进入多语言配音和语音智能体工作流的方式。