Google DeepMind 发布 EmbeddingGemma 2 开放轻量多模态嵌入模型
Google DeepMind 发布 EmbeddingGemma 2,这是一个 740M 参数的开放轻量多模态嵌入模型。它基于 Gemma 4 架构,采用 Apache 2.0 许可,支持文本、代码、图像、视频和音频统一嵌入,并提供 8K token 上下文窗口。
推荐理由:原文给出 740M 参数、8K 上下文窗口、MRL 截断维度和端侧内存占用,便于判断本地多模态检索可用性。
Google DeepMind 发布 EmbeddingGemma 2,这是一个 740M 参数的开放轻量多模态嵌入模型。它基于 Gemma 4 架构,采用 Apache 2.0 许可,支持文本、代码、图像、视频和音频统一嵌入,并提供 8K token 上下文窗口。
推荐理由:原文给出 740M 参数、8K 上下文窗口、MRL 截断维度和端侧内存占用,便于判断本地多模态检索可用性。
Mistral 发布 Mistral Large 4 公开预览,提供 1 trillion 参数、52 billion 激活参数的原生多模态开放权重模型。预览 API 已在 Mistral Studio 开放,权重将于本月底发布,并重点展示网络安全、编码、智能体工作流和多模态理解能力。详情见 https://mistral.ai/news/mistral-large-4/。
推荐理由:原文给出开放权重模型在网络安全、编码和智能体工作流上的基准对比,便于判断其自部署与主权 AI 落地价值。
Google DeepMind 发布 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,后续将面向开发者、企业和消费者推出。
推荐理由:原文给出 Gemini 4 Argon 的 1M 输出上限、企业基准表现、网络安全防御定位和分阶段开放路径,便于判断它对复杂工作流的影响。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源多语言 TTS 与语音克隆模型。它使用 Qwen3 ASR 计算 WER/CER,并用 RTXf、TTFA 和 WavLM SIM 衡量生成速度与音色相似度,默认按 Seed TTS Eval 与 CV3 Eval 的英文 macro-average WER 排名。
推荐理由:Hugging Face 推出 Open TTS Leaderboard,用可懂度、生成速度和音色相似度指标评估开源多语言 TTS,让模型比较从数周投票缩短到数小时,并保留人工偏好入口。
Microsoft Research 发布 Quine,一个面向生物学复杂性的 AI 研究系统。与 Broad Institute of Harvard and MIT 合作,Quine 在胰腺癌细胞状态研究中预测并优先排序数千个化合物,并在多个湿实验验证高排名候选,从缩小搜索空间到优先少数候选只花一个周末。
推荐理由:原文展示了多模态生物学世界模型如何与湿实验闭环结合,为人工智能辅助药物筛选提供可迁移的研究范式。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时语音对话结合,在 Gemini Enterprise 提供近实时视觉形象功能。
推荐理由:原文给出 Gemini Enterprise 可用入口和异步工具调用能力细节,读者可据此判断实时视频对话如何进入企业客服与交互演示。
Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言创建全新声音并用 30 秒样本复刻。
推荐理由:原文给出两款 Gemini 3.8 TTS 模型的声音复刻、逐行导演与开放入口,便于判断其进入多语言配音和语音智能体工作流的方式。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,用于近实时语音智能体和复杂任务。
推荐理由:原文给出两款近实时语音模型的基准成绩与开放入口,读者可据此判断语音智能体部署成本、能力边界和可用性。