Claude Haiku 5.5 在 AWS 上线
Claude Haiku 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 可用,多数任务成本比 Claude Haiku 4.5 低约 75%。
推荐理由:原文给出亚马逊云 Bedrock 可用入口和约 75% 成本下降,读者可据此评估高量子智能体与编码类生产工作负载的取舍空间。
Claude Haiku 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 可用,多数任务成本比 Claude Haiku 4.5 低约 75%。
推荐理由:原文给出亚马逊云 Bedrock 可用入口和约 75% 成本下降,读者可据此评估高量子智能体与编码类生产工作负载的取舍空间。
Microsoft ThinkingBox 现已通过 Hugging Face 开放,用数据库终态和副作用评测 AI 智能体,而不是只看最终回复或工具调用。ThinkingBox-Bench 覆盖 507 个有状态业务工作流,每个任务重复 20 次,并报告 pass@1、pass@20 和 observed 20/20。失败诊断显示约 79.9% 的失败来自工具使用,而不是推理。
推荐理由:原文给出以数据库终态和副作用评测智能体的方法,读者可据此检查工具调用之外的真实结果与多次运行稳定性。
Airbnb CTO Ahmad Al-Dahle 表示公司采用 inside-out AI,先用 AI 加速内部产品开发,再改造宾客体验。他称 60% 代码由 AI 生成,AI 解决约一半客服工单。内部上下文图谱 Everest 支持机场接送服务约六周开发。
GitHub Security Lab 开源了 Fuzzing Taskflow,一个基于 GitHub Security Lab Taskflow Agent 的 C/C++ 自动 fuzzing 流水线。
推荐理由:原文展示 GitHub Security Lab 将 LLM 智能体的决策与 MCP 工具的执行分离,把 C/C++ 项目 fuzzing 中的 harness 编写、覆盖率追踪、crash triage 和漏洞报告生成交给开源自动化流水线。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时语音对话结合,在 Gemini Enterprise 提供近实时视觉形象功能。
推荐理由:原文给出 Gemini Enterprise 可用入口和异步工具调用能力细节,读者可据此判断实时视频对话如何进入企业客服与交互演示。
GitHub Podcast 最新一集拆解五个 AI 开发热门观点,给出关于代码审查、AI 使用、MCP、Skills 与 RAG 的实用判断。文章认为 AI 生成代码仍需按风险审查,MCP 提供标准接口、Skills 提供流程上下文、RAG 用于补充模型外信息,三者可在同一工作流共存。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,用于近实时语音智能体和复杂任务。
推荐理由:原文给出两款近实时语音模型的基准成绩与开放入口,读者可据此判断语音智能体部署成本、能力边界和可用性。
Mistral 发布 Agentic Search,作为复杂文档检索层,让模型搜索、导航和验证信息,并在 FinanceBench 与 OfficeQA Pro 上提升准确率。
推荐理由:原文给出 Mistral Agentic Search 在 FinanceBench 与 OfficeQA Pro 上相对一次性 RAG 的准确率、延迟和 token 变化,便于判断企业复杂文档检索改造的实际价值与适用边界。