Nemotron 通过微调在 IOI 与 IMO 取得两项金牌级结果
Nemotron 通过 SFT、RL 与生成验证修正系统在 IOI 2026 和 IMO 2026 达到金牌水平。IOI 2026 使用 Nemotron-3-Ultra-CC 得 535.4/600,IMO 2026 得 30/42,均超过金牌阈值。
推荐理由:原文给出 Nemotron 通过监督微调、强化学习与生成验证修正循环达到金牌水平的可复现训练配方,读者可迁移到同类任务。
Nemotron 通过 SFT、RL 与生成验证修正系统在 IOI 2026 和 IMO 2026 达到金牌水平。IOI 2026 使用 Nemotron-3-Ultra-CC 得 535.4/600,IMO 2026 得 30/42,均超过金牌阈值。
推荐理由:原文给出 Nemotron 通过监督微调、强化学习与生成验证修正循环达到金牌水平的可复现训练配方,读者可迁移到同类任务。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 103.9M 个 GitHub pull request 分布构建,包含 219 个公开 pull request。
推荐理由:原文给出 ReviewBench 的公开数据、评分规则、指标切片和 Copilot 离线到线上对照,便于比较不同代码审查智能体的强弱与偏好选择。
Microsoft ThinkingBox 现已通过 Hugging Face 开放,用数据库终态和副作用评测 AI 智能体,而不是只看最终回复或工具调用。ThinkingBox-Bench 覆盖 507 个有状态业务工作流,每个任务重复 20 次,并报告 pass@1、pass@20 和 observed 20/20。失败诊断显示约 79.9% 的失败来自工具使用,而不是推理。
推荐理由:原文给出以数据库终态和副作用评测智能体的方法,读者可据此检查工具调用之外的真实结果与多次运行稳定性。
Ai2 开源 AstaBrief 8B,该模型基于 Qwen3-8B,把研究问题和检索文献片段转为带引用报告,并作为 Asta 的 Fast mode 与 Claude-powered Thinking mode 并行。
推荐理由:原文给出 AstaBrief 8B 的训练数据、评测指标、速度对比和本地部署入口,读者可判断开源小模型如何进入科学报告生成流程。
GitHub Security Lab 开源了 Fuzzing Taskflow,一个基于 GitHub Security Lab Taskflow Agent 的 C/C++ 自动 fuzzing 流水线。
推荐理由:原文展示 GitHub Security Lab 将 LLM 智能体的决策与 MCP 工具的执行分离,把 C/C++ 项目 fuzzing 中的 harness 编写、覆盖率追踪、crash triage 和漏洞报告生成交给开源自动化流水线。