Google 发布 Gemini 4 Argon,称其为迄今最强模型
Google 母公司 Alphabet 发布 Gemini 4 Argon,称其可处理编码、研究和写作等任务,并专门针对防御性网络安全工作训练,能够自主发现、验证并修补关键软件漏洞。
Google 母公司 Alphabet 发布 Gemini 4 Argon,称其可处理编码、研究和写作等任务,并专门针对防御性网络安全工作训练,能够自主发现、验证并修补关键软件漏洞。
Tavus 推出 Griffin,公司称其为首个 Human Interaction Model(HIM),可在接收和生成视频的同时处理语音、面部表情、语气、手势与停顿。
Amazon Web Services 发布开源决策模型 Strands Decider 2B,用于在预设选项中做选择并给出置信度,速度高、成本低,小到可在本地运行。
AI2 发布 Olmo-core 3,这是其大语言模型训练框架的一次重要升级,重新设计了开源 MoE 训练系统,目标是把 MoE 训练扩展到万亿参数规模并保持计算效率。
推荐理由:原文给出 MoE 训练栈的关键改动和对比数据,可看到开源训练基础设施在效率上的取舍。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首发仅向 Fairwind 计划的政府用户与受信任网络防御者开放,Google 称将完善护栏后再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准成绩、定价与第三方评测分歧,可对照同期 Astra 判断前沿模型竞争格局。
Google 发布 Gemini 4 Argon,这是其七个多月来首个前沿模型,先开放给 Fairwind 计划下的可信网络防御方及内部团队,之后才向 API 付费客户和 Google AI Ultra 订阅者开放,时间未定。
推荐理由:呈现 Gemini 4 Argon 与 GPT-6、Claude 系列在独立基准、token 消耗和价格上的横向对比,可用于判断其性价比位置。
Google 发布新一代前沿模型 Gemini 4 Argon,称其在软件工程、法律金融等企业知识工作以及网络安全防御等复杂工作流中达到前沿水平,但初期仅向一组可信网络安全人员开放,并称正在参与美国政府的前置模型访问自愿流程、逐步扩大访问。
推荐理由:Google 在发布旗舰模型的同时限制访问范围并同步强化安全防护,可作为观察前沿模型发布节奏与安全门槛变化的样本。
Google 发布 Gemini 4 Argon,宣称在编码、知识工作和网络安全方面性能领先,但目前仅限内部及有限测试,尚未对外开放使用。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御方开放,随后逐步扩展至开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:官方给出 Gemini 4 Argon 的基准得分、输出上限与分阶段开放路径,便于判断其在编码与企业任务上的位置。
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可见签名嵌入生物代码,使其不仅在数字模型上可验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:DeepMind 把水印做进蛋白质序列与 AlphaFold 3 权重,为 DNA 合成筛查提供了一条可自动验证的来源信号。
Simon Willison 指出 GPT 6.1 Sol 以约五分之一的价格提供接近 Astra 的智能水平。该文发布于 2026 年 9 月 29 日,涉及 OpenAI、生成式 AI 与大语言模型等话题。原文未披露具体参数、基准分数或定价细节。
NVIDIA 发布表格数据开源基础模型 Kumo Tabular,可在单次前向传播中完成分类与回归预测,无需训练、调参和特征工程。
推荐理由:文章完整披露了表格基础模型的预训练数据构造与架构设计,可据此判断免训练推理在表格任务上的可行性边界。
Microsoft Research 发布面向生物学复杂性的 AI 研究系统 Quine,由跨模态生物学世界模型与连接科学工具、文献、湿实验和研究者的交互式 harness 组成。
推荐理由:原文给出 Quine 的多模态世界模型与湿实验验证结果,并开放 Fellows 申请,可据此判断生物学 AI 研究系统的落地路径。
OpenAI 发布 GPT-6.1 Sol,主打接近 Astra 的智能水平,覆盖编码、电脑操作和专业工作场景,标准 API 输入与输出 token 价格均为 Astra 的五分之一。原文未给出更多参数、基准或开放细节。
推荐理由:OpenAI 以 Astra 五分之一的价格推出面向编码与电脑操作的新模型,可据此比较其定位与成本取舍。
AINews 汇总了 9/24-9/25 期间的 AI 动态,指出 Opus 5.5 本周发布后社区反响积极,尤其在讲解视频类任务上占据时间线焦点。据汇总,Opus 5.5 在 SimpleBench 上以 88.4% 领先,被评测者列为 Anthropic 目前最佳视觉模型,成本比 Fable 5.1 低约 60%。
Anthropic 发布 Claude Sonnet 5.5,官方称其运行速度快 30% 以上、多数工作成本最多降低 30%,定价与 Sonnet 5 相同但各项基准表现更好。
推荐理由:作者用同一套提示词横评 Sonnet 5.5 与 Opus 5.5,读者可借实测细节判断它的编码能力与免费档定位。
H 公司发布 Holo4 系列智能体模型,包含 27B dense 和 35B-A3B MoE 两个尺寸,均可通过 H Models API 调用,同时开源基于 Nemotron 3 Nano Omni 后训练得到的 Holotron4 Nano。
推荐理由:Holo4 用同一套权重打通 GUI、代码、MCP 与 API,公开了完整轨迹,读者可据此评估通用计算机智能体的跨界面路线。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 基础上把近实时视频生成与语音对话原生结合,让企业智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。
推荐理由:原文给出了实时视频形象与语音对话的原生耦合方式,读者可据此判断企业级实时多模态交互的落地形态。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码实现设备端最高 3.13 倍、H100 上最高 2.66 倍解码加速,端到端最高提升 2.62 倍和 2.27 倍。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演指导,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:原文给出两款 TTS 模型的能力差异、基准排名和开放入口,读者可据此判断语音生成在创作与规模化场景中的分工。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,分别面向规模化低成本场景和高复杂度多步推理任务。
推荐理由:官方给出语音对话模型的两档定位与多语言、后台调用工具等能力细节,可供开发者判断接入场景。
Google DeepMind 推出 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模超过 AlphaFold Database 30 倍,今日起通过网站门户、AlphaGenome API 和 Google Antigravity 技能向学术研究免费开放。
推荐理由:读者可据此了解 9 亿单核苷酸变异预测数据集如何把 AlphaGenome 的预测能力扩展到全基因组检索。
Google DeepMind 与 Google Research 发布全球天气 AI 模型 WeatherNext 3,直接学习实时卫星观测,逐小时生成预报,温度等关键地表变量分辨率达 5 公里,整体比上一代 WeatherNext 2 精细约五倍。
推荐理由:官方披露了实时卫星数据训练、逐小时刷新与降水精度提升的具体数字,可用于对比上一代全球天气模型。
微软研究院发布 GigaPath-Flash 和 GigaTIME-Flash,用蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干替换原有模型,以 Apache 2.0 许可开源。