跳到正文
  1. AWS Machine Learning Blog73

    Claude Haiku 5.5 在 AWS 上线

    Claude Haiku 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 可用,多数任务成本比 Claude Haiku 4.5 低约 75%。

    推荐理由:原文给出亚马逊云 Bedrock 可用入口和约 75% 成本下降,读者可据此评估高量子智能体与编码类生产工作负载的取舍空间。

  1. Hugging Face Blog75

    Microsoft ThinkingBox 通过 Hugging Face 开放智能体数据库终态评测

    Microsoft ThinkingBox 现已通过 Hugging Face 开放,用数据库终态和副作用评测 AI 智能体,而不是只看最终回复或工具调用。ThinkingBox-Bench 覆盖 507 个有状态业务工作流,每个任务重复 20 次,并报告 pass@1、pass@20 和 observed 20/20。失败诊断显示约 79.9% 的失败来自工具使用,而不是推理。

    推荐理由:原文给出以数据库终态和副作用评测智能体的方法,读者可据此检查工具调用之外的真实结果与多次运行稳定性。

  1. GitHub Blog · AI & ML72

    GitHub Security Lab Taskflow Agent 实现 AI 驱动 fuzzing

    GitHub Security Lab 开源了 Fuzzing Taskflow,一个基于 GitHub Security Lab Taskflow Agent 的 C/C++ 自动 fuzzing 流水线。

    推荐理由:原文展示 GitHub Security Lab 将 LLM 智能体的决策与 MCP 工具的执行分离,把 C/C++ 项目 fuzzing 中的 harness 编写、覆盖率追踪、crash triage 和漏洞报告生成交给开源自动化流水线。

  2. Google DeepMind60

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时语音对话结合,在 Gemini Enterprise 提供近实时视觉形象功能。

    推荐理由:原文给出 Gemini Enterprise 可用入口和异步工具调用能力细节,读者可据此判断实时视频对话如何进入企业客服与交互演示。

  1. Google DeepMind75

    Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking

    Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,用于近实时语音智能体和复杂任务。

    推荐理由:原文给出两款近实时语音模型的基准成绩与开放入口,读者可据此判断语音智能体部署成本、能力边界和可用性。

  1. Mistral AI73

    Mistral 发布 Agentic Search,提升 AI 系统搜索准确率与效率

    Mistral 发布 Agentic Search,作为复杂文档检索层,让模型搜索、导航和验证信息,并在 FinanceBench 与 OfficeQA Pro 上提升准确率。

    推荐理由:原文给出 Mistral Agentic Search 在 FinanceBench 与 OfficeQA Pro 上相对一次性 RAG 的准确率、延迟和 token 变化,便于判断企业复杂文档检索改造的实际价值与适用边界。

已经到底了