Google 发布 Gemini 4 Argon,称其为迄今最强模型
Google 母公司 Alphabet 发布 Gemini 4 Argon,称其可处理编码、研究和写作等任务,并专门针对防御性网络安全工作训练,能够自主发现、验证并修补关键软件漏洞。
Google 母公司 Alphabet 发布 Gemini 4 Argon,称其可处理编码、研究和写作等任务,并专门针对防御性网络安全工作训练,能够自主发现、验证并修补关键软件漏洞。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首发仅向 Fairwind 计划的政府用户与受信任网络防御者开放,Google 称将完善护栏后再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准成绩、定价与第三方评测分歧,可对照同期 Astra 判断前沿模型竞争格局。
Google 发布 Gemini 4 Argon,宣称在编码、知识工作和网络安全方面性能领先,但目前仅限内部及有限测试,尚未对外开放使用。
Simon Willison 在旧金山 Fort Mason 现场直播 OpenAI DevDay 2026 主题演讲。
推荐理由:以现场直播形式完整记录了 OpenAI DevDay 的发布节奏与演示细节,适合观察其智能体与开发者生态的落地方向。
OpenAI 发布 GPT-6.1 Sol,主打接近 Astra 的智能水平,覆盖编码、电脑操作和专业工作场景,标准 API 输入与输出 token 价格均为 Astra 的五分之一。原文未给出更多参数、基准或开放细节。
推荐理由:OpenAI 以 Astra 五分之一的价格推出面向编码与电脑操作的新模型,可据此比较其定位与成本取舍。
AINews 汇总了 9/24-9/25 期间的 AI 动态,指出 Opus 5.5 本周发布后社区反响积极,尤其在讲解视频类任务上占据时间线焦点。据汇总,Opus 5.5 在 SimpleBench 上以 88.4% 领先,被评测者列为 Anthropic 目前最佳视觉模型,成本比 Fable 5.1 低约 60%。
GitHub Copilot 应用重建了 pull request 视图,用一个包含 2200 个文件、超 100 万行改动和 400 多条行内评论的开源 PR 验证性能。其将文档高度拆成确定性代码几何与动态评论块几何两部分,代码行高预先精确计算,评论高度则惰性测量、有界修正并锚定到文件和行,避免滚动跳变。
GitHub Podcast 最新一期逐条拆解了五个 AI 开发热梗:"不用读 AI 生成的代码"要看你能否解释并负责结果;"不用 AI 就不被录用"更应看判断力;Skills 与 MCP 解决不同问题,前者是可读的 Markdown 封装经验,后者提供工具与数据的标准接口;RAG 也并未消亡,缺了检索会浪费 token、拖慢速度并更容易给出不完整答案。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,跨 128 个 PR 分批合入 main 而非一次性切换。
推荐理由:GitHub Copilot 运行时的 Rust 迁移复盘,给出原地原子替换、跨会话协作与缓存策略的可迁移工程方法。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器代码迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值一致性校验框架,再用 Vibe CLI 派出上百个智能体解析调用树并整理文档;迁移时采用编码、测试、审查智能体加人工卡点的结构化流程,首个冲刺完成 30 万行中的 4 万行。
Import AI 469 期介绍了新基准 DiG-bench,其包含 70 款规则与目标均隐藏的探索类游戏,公开 21 款并设七档难度,Opus 5 与搭配 Claude Code 的 Fable 5 表现最佳,仅这两者在 Tier 7 取得 0.2 成功率,而人类可达 100%。