跳到正文

全部动态

今日 10 条
9月24日周四
  1. GitHub Blog · AI & ML24

    GitHub Copilot 应用如何渲染超大型 pull request

    GitHub Copilot 应用重建了 pull request 视图,用一个包含 2200 个文件、超 100 万行改动和 400 多条行内评论的开源 PR 验证性能。其将文档高度拆成确定性代码几何与动态评论块几何两部分,代码行高预先精确计算,评论高度则惰性测量、有界修正并锚定到文件和行,避免滚动跳变。

9月23日周三
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演指导,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:原文给出两款 TTS 模型的能力差异、基准排名和开放入口,读者可据此判断语音生成在创作与规模化场景中的分工。

  2. NVIDIA Blog8

    NVIDIA 验证工程师 Sakeena Fiza 如何保障 AI 硬件大规模落地

    NVIDIA 验证工程师 Sakeena Fiza 负责在数据中心系统实验室中,于产品量产前逐层验证从板卡到机架再到集群的硬件可靠性。她曾见证 NVIDIA Rubin GPU 首次在系统层面被识别,称那一刻全球首次实现 Rubin GPU 系统级枚举。她表示验证团队要成为"产品的第一批客户",在客户之前发现高速信号、散热余量与供电完整性等问题。

9月22日周二
9月21日周一
9月19日周六
  1. Google Research27

    Google Research 推出 MilleMiglia:面向中距离物流的真实实例生成器

    Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,可为中距离(middle-mile)物流生成真实且保护隐私的基准数据,代码与文档已在 GitHub 开源。该工具针对中距离运输的多商品流特性,建模货物在配送中心间的换车、分拣与时间窗衔接,而这一环节此前因企业网络拓扑与需求数据敏感、缺乏公开高质量数据,研究投入远少于首末公里配送。

9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解五大 AI 热梗:AI 生成的代码要不要读、RAG 是否已死、Skills 是否杀死 MCP

    GitHub Podcast 最新一期逐条拆解了五个 AI 开发热梗:"不用读 AI 生成的代码"要看你能否解释并负责结果;"不用 AI 就不被录用"更应看判断力;Skills 与 MCP 解决不同问题,前者是可读的 Markdown 封装经验,后者提供工具与数据的标准接口;RAG 也并未消亡,缺了检索会浪费 token、拖慢速度并更容易给出不完整答案。

9月17日周四
  1. GitHub Blog · AI & ML69

    GitHub 用 Copilot 把 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,跨 128 个 PR 分批合入 main 而非一次性切换。

    推荐理由:GitHub Copilot 运行时的 Rust 迁移复盘,给出原地原子替换、跨会话协作与缓存策略的可迁移工程方法。

9月16日周三
  1. Google Research35

    Google Research 提出 Retrieve-for-Train:用离线 RL 加速复杂 AI 搜索查询扩展

    Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扩展并蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次前向的查询 fan-out。该方法在 Gemma3-4B 和 Qwen3-4B 上微调,绕过测试时 CoT 推理 token 的开销,同时满足多样性、覆盖度等集合级属性,相关论文已被 ICML 2026 收录。

9月12日周六
  1. GitHub Blog · AI & ML30

    GitHub 如何用 Copilot 把营销活动运营变成代码

    GitHub 日本和韩国区营销负责人把活动运营流程交给 GitHub Copilot:整个活动由单个 GitHub Issue 驱动,配合 Issue forms 做报名表单、用 label 触发 GitHub Actions 工作流。活动设置从原本手工耗时一两天变为自动完成,每天早上还会自动筛选报名者并在结束后自行收尾,所依赖的是活动平台 API 与 CRM 官方 CLI 这类可脚本化的入口。

9月11日周五
9月10日周四
9月9日周三
  1. Mistral AI50

    Mistral 如何用 AI 智能体迁移 4 万行 Fortran 77 遗留代码

    Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器代码迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值一致性校验框架,再用 Vibe CLI 派出上百个智能体解析调用树并整理文档;迁移时采用编码、测试、审查智能体加人工卡点的结构化流程,首个冲刺完成 30 万行中的 4 万行。

9月8日周二
  1. Google DeepMind72

    Google DeepMind 发布 AlphaGenome Atlas,预测人类基因组全部单字母变异

    Google DeepMind 推出 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模超过 AlphaFold Database 30 倍,今日起通过网站门户、AlphaGenome API 和 Google Antigravity 技能向学术研究免费开放。

    推荐理由:读者可据此了解 9 亿单核苷酸变异预测数据集如何把 AlphaGenome 的预测能力扩展到全基因组检索。

9月4日周五
  1. Google Research25

    Google 研究:跨人群多基因风险评分的迁移学习

    Google 研究团队评估了迁移学习能否改善非欧洲人群的多基因风险评分(PRS),用 UK Biobank 约数十万欧洲样本向 Biobank Japan 近 20 万日本样本迁移,覆盖 BMI、血压、血脂等 8 项临床性状。结果显示,目标人群样本达 15k 以上时,纯目标人群模型反超混合欧洲数据的模型;欧洲数据仅在目标样本极少(如 5,000)时有增益,且增益窗口随性状遗传相关性而异。

9月3日周四
  1. Google DeepMind76

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 与 Google Research 发布全球天气 AI 模型 WeatherNext 3,直接学习实时卫星观测,逐小时生成预报,温度等关键地表变量分辨率达 5 公里,整体比上一代 WeatherNext 2 精细约五倍。

    推荐理由:官方披露了实时卫星数据训练、逐小时刷新与降水精度提升的具体数字,可用于对比上一代全球天气模型。

9月1日周二
8月25日周二
  1. Mistral AI35

    Mistral 与 HUMAIN 达成战略合作,推进沙特及中东主权 AI

    Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案在沙特及中东地区的部署,合作规模达数亿欧元。双方将聚焦网络安全与语音领域,并开发阿拉伯语表现强劲的前沿模型;Mistral 还将探索使用 HUMAIN 的数据中心基础设施,双方计划在沙特面向受监管行业推出联合市场策略。

8月21日周五
8月20日周四
  1. Mistral AI61

    Mistral 发布 Agentic Search 检索层

    Mistral 发布 Agentic Search,作为让 AI 系统在复杂文档中导航、阅读和验证信息的检索层,通过 Mistral Search Toolkit 和 Studio、Vibe 中的 Libraries 提供。

    推荐理由:官方给出多步检索循环的五工具设计与两组基准数字,读者可据此判断检索层如何替代一次性 RAG。

8月13日周四
  1. Microsoft Research32

    MindTopo 基准揭示 VLM 的空间推理能力短板

    Microsoft Research 推出 MindTopo 基准,用于评测多模态大语言模型的拓扑推理能力,涵盖连续性、分离、顺序、包围与打结五类任务,并区分静态推理与交互规划两个层级。测试显示,当前闭源与开源模型在静态识别上表现明显优于交互规划,且均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧保留结构约束时才有帮助。

8月11日周二
7月29日周三
7月26日周日
7月7日周二
  1. Berkeley AI Research31

    智能免费时代的数据系统:为智能体、由智能体、属于智能体

    伯克利 EPIC Data Lab 提出,推理成本正快速趋近于零,GPT-4 级能力已从 2023 年初的约 $30/百万 token 降至不足 $1,部分厂商低于 $0.10。作者由此提出三类新挑战:为智能体重设计的数据系统、支撑成千上万智能体长期任务与共识的数据系统,以及由智能体直接合成、需可验证可信的数据系统。

7月1日周三
5月8日周五
  1. Berkeley AI Research36

    自适应并行推理:高效推理扩展的下一范式

    伯克利 AI 研究团队梳理了并行推理领域进展,指出主流方法多由外部固定并行结构,而非让模型自行决定何时分解任务、开启多少线程及如何协调。文章涵盖 Self-consistency、Best-of-N、Tree/Graph of Thoughts、MCTS 及 ParaThinker、GroupThink、Hogwild! Inference,并分析 ThreadWeaver 等自适应并行推理方向。

4月20日周一
  1. Berkeley AI Research36

    GRASP:面向世界模型的梯度规划器,实现更长视野规划

    GRASP 是一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现时间并行优化、在状态迭代中注入随机性以探索、并重塑梯度让动作获得干净信号,避免经由高维视觉模型的脆弱"状态-输入"梯度。该方法由 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun、Amir Bar 等参与提出,针对长视野规划中优化病态、非贪心局部极小值与高维潜空间失效模式问题。

3月13日周五
1月10日周六
  1. Berkeley AI Research28

    伯克利提出基于信息量的成像系统设计框架,可预测四大成像领域性能

    伯克利 AI 研究院提出一种基于互信息的成像系统评估与优化框架,仅用含噪测量值和噪声模型即可量化测量所含信息量,无需任务专用解码器。在 NeurIPS 2025 论文中,该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域均能预测解码器性能,优化后的设计达到端到端方法水平,且内存与算力需求更低。