Latent Space 对话 MIT 的 Alex Zhang:从 KernelBench 到递归语言模型 RLM
MIT 研究者 Alex Zhang 在 Latent Space 播客中讲述其在 GPU kernel、KernelBench 与递归语言模型(RLM)上的工作。
MIT 研究者 Alex Zhang 在 Latent Space 播客中讲述其在 GPU kernel、KernelBench 与递归语言模型(RLM)上的工作。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)做产品获客漏斗个性化,七周线上 A/B 测试中某一客群的漏斗末端转化率取得高个位数相对提升,另一客群则无改善,问题出在内容而非模型。方案对申请、提交、审批三个阶段各跑一个 LinUCB 模型并线性组合其 UCB 分数,以行为信号向量替代固定分群,示例代码已开源。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI 系统 Ataraxos,以 15 胜 1 负 4 平击败被视为史上最强的 Stratego 选手 Pim Niemeijer,训练仅用 16 块 GPU、花费数千美元。
OpenAI 称其阻止了一场针对模型推理链的蒸馏提取行动,该行动于 7 月 1 日低量启动,7 月 24 至 25 日激增至来自 4000 多名用户的 16000 次请求,涉及 15000 多个关联账户,7 月 28 日前已被完全关闭。
推荐理由:事件披露了推理蒸馏攻击的完整时间线和攻击手法,读者可了解前沿模型推理链被提取的现实风险。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首发仅向 Fairwind 计划的政府用户与受信任网络防御者开放,Google 称将完善护栏后再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准成绩、定价与第三方评测分歧,可对照同期 Astra 判断前沿模型竞争格局。
Google 发布 Gemini 4 Argon,这是其七个多月来首个前沿模型,先开放给 Fairwind 计划下的可信网络防御方及内部团队,之后才向 API 付费客户和 Google AI Ultra 订阅者开放,时间未定。
推荐理由:呈现 Gemini 4 Argon 与 GPT-6、Claude 系列在独立基准、token 消耗和价格上的横向对比,可用于判断其性价比位置。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码实现设备端最高 3.13 倍、H100 上最高 2.66 倍解码加速,端到端最高提升 2.62 倍和 2.27 倍。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扩展并蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次前向的查询 fan-out。该方法在 Gemma3-4B 和 Qwen3-4B 上微调,绕过测试时 CoT 推理 token 的开销,同时满足多样性、覆盖度等集合级属性,相关论文已被 ICML 2026 收录。
METR 分析发现 AI 对科学进步的加速并不均匀:2026 年各项目与 NVD、OSV 等漏洞库的报告速率较 2025 年大幅加快,数学领域 arXiv 投稿在部分方向不到 12 个月翻倍但价值难以量化,AI 研究自身的算法进展则未见可测量加速。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大语言模型的拓扑推理能力,涵盖连续性、分离、顺序、包围与打结五类任务,并区分静态推理与交互规划两个层级。测试显示,当前闭源与开源模型在静态识别上表现明显优于交互规划,且均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧保留结构约束时才有帮助。
Berkeley Sky Lab 团队扩展了演化式 kernel 搜索框架 K-Search,新增 MLX 后端和结构化 CUDA-to-MLX 翻译层,可将已有 CUDA kernel 作为知识库自动适配为 Apple Silicon 上的高性能 kernel。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的交互摘要建模为自然语言“信念状态”,并通过信念评分(belief grading)监督其内容,从而替代完整交互历史作为智能体的工作上下文。
伯克利 AI 研究团队梳理了并行推理领域进展,指出主流方法多由外部固定并行结构,而非让模型自行决定何时分解任务、开启多少线程及如何协调。文章涵盖 Self-consistency、Best-of-N、Tree/Graph of Thoughts、MCTS 及 ParaThinker、GroupThink、Hogwild! Inference,并分析 ThreadWeaver 等自适应并行推理方向。
GRASP 是一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现时间并行优化、在状态迭代中注入随机性以探索、并重塑梯度让动作获得干净信号,避免经由高维视觉模型的脆弱"状态-输入"梯度。该方法由 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun、Amir Bar 等参与提出,针对长视野规划中优化病态、非贪心局部极小值与高维潜空间失效模式问题。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,利用稀疏性和低阶性将 LLM 交互识别转化为稀疏恢复问题,可在特征、数据和模型组件归因中高效发现关键交互。