Simon Willison 引用 Carson Gross:AI 工具时代编程仍是可行职业
Simon Willison 引用 Carson Gross 的观点:计算机编程的核心是用计算机解决问题,并控制解决过程中的复杂度。Carson Gross 认为 AI 工具出现后,掌握这些能力仍会保持价值,编程将继续是可行职业。
Simon Willison 引用 Carson Gross 的观点:计算机编程的核心是用计算机解决问题,并控制解决过程中的复杂度。Carson Gross 认为 AI 工具出现后,掌握这些能力仍会保持价值,编程将继续是可行职业。
LegalOn 将估算的每日 Codex 成本降低 65%,同时保持开发速度。它把 Astra、Sol 和 Luna 匹配到任务,并策略性管理预算。
Tw93 复盘 Mole 从开源 CLI 做到付费 Mac 应用的过程,称用户反馈塑造了产品方向。Mole CLI 不到一年获得 60K star、发布 50 多个版本、121 位开发者贡献,桌面版付费而 CLI 继续开源免费。Mole 将清理项分为可再生、重建代价高和不可替代三档,并默认保护模型与会话记录。
Claude Haiku 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 可用,多数任务成本比 Claude Haiku 4.5 低约 75%。
推荐理由:原文给出亚马逊云 Bedrock 可用入口和约 75% 成本下降,读者可据此评估高量子智能体与编码类生产工作负载的取舍空间。
Nemotron 通过 SFT、RL 与生成验证修正系统在 IOI 2026 和 IMO 2026 达到金牌水平。IOI 2026 使用 Nemotron-3-Ultra-CC 得 535.4/600,IMO 2026 得 30/42,均超过金牌阈值。
推荐理由:原文给出 Nemotron 通过监督微调、强化学习与生成验证修正循环达到金牌水平的可复现训练配方,读者可迁移到同类任务。
Mistral 发布 Mistral Large 4 公开预览,提供 1 trillion 参数、52 billion 激活参数的原生多模态开放权重模型。预览 API 已在 Mistral Studio 开放,权重将于本月底发布,并重点展示网络安全、编码、智能体工作流和多模态理解能力。详情见 https://mistral.ai/news/mistral-large-4/。
推荐理由:原文给出开放权重模型在网络安全、编码和智能体工作流上的基准对比,便于判断其自部署与主权 AI 落地价值。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 103.9M 个 GitHub pull request 分布构建,包含 219 个公开 pull request。
推荐理由:原文给出 ReviewBench 的公开数据、评分规则、指标切片和 Copilot 离线到线上对照,便于比较不同代码审查智能体的强弱与偏好选择。
GitHub 提出三项技能,帮助开发者适应 AI 改变的工作方式:指导 AI 智能体、评估 AI 输出、用 AI 解决更大问题。GitHub Copilot 的 Rubber Duck agent 用第二个模型批评计划、代码和测试。开发者可把更多实现交给 AI,把时间用于客户问题、架构权衡和技术决策。
Airbnb CTO Ahmad Al-Dahle 表示公司采用 inside-out AI,先用 AI 加速内部产品开发,再改造宾客体验。他称 60% 代码由 AI 生成,AI 解决约一半客服工单。内部上下文图谱 Everest 支持机场接送服务约六周开发。
GPT-6 Astra Ultrafast 现已在 OpenAI API 和符合条件的 ChatGPT Work、Codex 用户中可用,运行于 NVIDIA Blackwell GPU。
推荐理由:原文把 Ultrafast 相对标准模式的 token 生成速度优势落到编码智能体的工具调用循环,读者可据此判断低延迟对开发工作流的影响。
Google DeepMind 发布 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,后续将面向开发者、企业和消费者推出。
推荐理由:原文给出 Gemini 4 Argon 的 1M 输出上限、企业基准表现、网络安全防御定位和分阶段开放路径,便于判断它对复杂工作流的影响。
Import AI 474 汇总了 AI 研究动态,包括柏拉图心智空间论文、Google 太空 TPU 计划、智谱自改进基础设施和 Periodic Labs 的 AI 科学家模型。
GitHub Copilot app 的 canvas 提供可替代聊天的自定义界面,它是一个在应用内运行的全栈应用,可让 agent 与应用内服务双向通信。文章用 Connect 4、Winget、SQLite 和开发工作流示例,说明自定义界面可减少 token 消耗并让用户更少介入。
GitHub Podcast 最新一集拆解五个 AI 开发热门观点,给出关于代码审查、AI 使用、MCP、Skills 与 RAG 的实用判断。文章认为 AI 生成代码仍需按风险审查,MCP 提供标准接口、Skills 提供流程上下文、RAG 用于补充模型外信息,三者可在同一工作流共存。
Mistral 分享其帮助欧洲能源运营商将 40,000 行 Fortran 77 储层模拟器代码迁移到 C++ 的案例,总代码 300,000 行。项目先建立数值一致性校验和文档化流程,再用规划、编码、测试、审查智能体按模块迁移,并保留人工审查。
推荐理由:原文给出先建立数值一致性校验,再按模块运行规划、编码、测试和审查智能体的方法,适合复杂遗留代码迁移参考。
Import AI 470(https://importai.substack.com/p/import-ai-470-no-rights-for-machines)汇总了 METR 的 AI 加速研究、SPADE 环境生成框架、Hawkeye GPU 内核优化和 Google DeepMind 的 AlphaEvolve 矩阵乘法进展。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 扩展 MLX,并构建 CUDA 到 MLX 翻译层,在 Apple Silicon 上达到接近专家水平的内核性能。
推荐理由:原文展示 CUDA 优化知识如何转成 MLX 架构策略,并给出注意力与 Mamba 预填充的实测对比,便于理解跨硬件内核优化如何迁移。