ServiceNow CoreAI 的 AutoSynthData:为企业智能体生成训练数据
ServiceNow CoreAI 推出 AutoSynthData,利用目标模型的失败案例与更强教师的成功轨迹定位能力缺口,再生成并校验新任务用于后训练。系统从评测中提炼「能力规格卡」指导生成器造题,不泄露原始 prompt、实体或验证器细节,并随模型提升动态调整课程。该流程已在 EnterpriseOps Gym 数据集上演示。
ServiceNow CoreAI 推出 AutoSynthData,利用目标模型的失败案例与更强教师的成功轨迹定位能力缺口,再生成并校验新任务用于后训练。系统从评测中提炼「能力规格卡」指导生成器造题,不泄露原始 prompt、实体或验证器细节,并随模型提升动态调整课程。该流程已在 EnterpriseOps Gym 数据集上演示。
Graphite 研究分析前沿模型写作习惯后发现,Claude Opus 5.5 最爱用"dependable"(比人类样本高 23 倍)和"this matters"(高 116 倍),OpenAI Astra 则偏好"another dimension"与"not simply X"式修正性表述(超人类 100 倍)。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI 系统 Ataraxos,以 15 胜 1 负 4 平击败被视为史上最强的 Stratego 选手 Pim Niemeijer,训练仅用 16 块 GPU、花费数千美元。
研究团队开发的 Ataraxos 在与四届世界冠军 Niemeijer 的对局中取得 85% 的有效胜率,成为人类在 Stratego 上最后优势被打破的标志。
微软研究院开发了一套端到端机器学习系统,为美国本土66,935座变电站生成30-60分钟前的空间天气风险预测。该系统结合AE与Dst指数预报、地质电导率和电网数据,在评估期内检测到近80%的重大空间天气事件;其中Dst模型在峰值活动时段有62.2%的小时数优于Burton方程。
Google DeepMind 团队发表论文,提出基于 SynthID 的蛋白质水印方案 SynthIDBio,可在不损害蛋白质功能的前提下,把水印氨基酸嵌入由 ProteinMPNN 设计的蛋白质序列中。
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可见签名嵌入生物代码,使其不仅在数字模型上可验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:DeepMind 把水印做进蛋白质序列与 AlphaFold 3 权重,为 DNA 合成筛查提供了一条可自动验证的来源信号。
Anthropic Frontier Red Team 在内部 Binary Exploitation benchmark 的 100 个随机任务上评测多个模型,发现 GLM-5.3 在 4% 的试验中实现完整的控制流劫持,Claude Mythos Preview 为 6%。
Google Research 提出 Diffusion Controller 框架,把图像生成的去噪过程重构为连续控制问题,通过一个轻量"转向阻尼"网络在冻结基座模型的前提下动态调整生成轨迹。
Hugging Face 博客发布论文 ProvenanceGuard,一个运行在黑盒 MCP 智能体之上的生成后验证层,专门识别"跨来源混淆"——即内容属实但归错来源的说法。
Google Research 发布一套面向长视频生成的多智能体框架,包括 AI video co-director、CANVAS、A²RD 和 VQQA,构建在 Gemini 与 Veo 之上,用于解决多镜头叙事中的语义漂移、特征漂移和内容崩塌问题。
微软研究院对移动机械臂操作负载做了系统性测量,发现将物理 AI 推理卸载到边缘或云端 GPU 可提升任务成功率与响应速度,并显著延长机器人续航。
微软在 Nature 发表逆合成预测框架 RetroChimera,并开源其实现与权重。该模型融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,通过学习式重排序整合两者互补优势。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,可为中距离(middle-mile)物流生成真实且保护隐私的基准数据,代码与文档已在 GitHub 开源。该工具针对中距离运输的多商品流特性,建模货物在配送中心间的换车、分拣与时间窗衔接,而这一环节此前因企业网络拓扑与需求数据敏感、缺乏公开高质量数据,研究投入远少于首末公里配送。
Google Research 公布一项新研究实验,让教育者利用生成式 UI(GenUI)动态生成贴合教学目标与课程的互动式引导模拟,并已向可信测试教师群体获得初步正面反馈。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扩展并蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次前向的查询 fan-out。该方法在 Gemma3-4B 和 Qwen3-4B 上微调,绕过测试时 CoT 推理 token 的开销,同时满足多样性、覆盖度等集合级属性,相关论文已被 ICML 2026 收录。
Google Research 提出 ToolGrad,一种“答案优先”的工具调用数据集生成范式:先生成 ground-truth 工具链,再反推用户 prompt,从而以更低成本生成更复杂的长程工具调用数据。
Google DeepMind 发布论文,让 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作求解 71 道数学题,并为它们提供公共公告板、私信和共享知识库三种协作渠道。
Google 研究团队评估了迁移学习能否改善非欧洲人群的多基因风险评分(PRS),用 UK Biobank 约数十万欧洲样本向 Biobank Japan 近 20 万日本样本迁移,覆盖 BMI、血压、血脂等 8 项临床性状。结果显示,目标人群样本达 15k 以上时,纯目标人群模型反超混合欧洲数据的模型;欧洲数据仅在目标样本极少(如 5,000)时有增益,且增益窗口随性状遗传相关性而异。
Google 与 HHMI Janelia 等机构在 Cell 发表完整雄性果蝇中枢神经系统连接组图谱,含超 166,000 个神经元和 1.25 亿个突触连接,为迄今神经元数量最多的脑图谱。
METR 分析发现 AI 对科学进步的加速并不均匀:2026 年各项目与 NVD、OSV 等漏洞库的报告速率较 2025 年大幅加快,数学领域 arXiv 投稿在部分方向不到 12 个月翻倍但价值难以量化,AI 研究自身的算法进展则未见可测量加速。
Microsoft Research 发布 Skala 1.1,训练数据量较前代增加 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol,计算成本仅相当于 meta-GGA 泛函。
Import AI 469 期介绍了新基准 DiG-bench,其包含 70 款规则与目标均隐藏的探索类游戏,公开 21 款并设七档难度,Opus 5 与搭配 Claude Code 的 Fable 5 表现最佳,仅这两者在 Tier 7 取得 0.2 成功率,而人类可达 100%。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大语言模型的拓扑推理能力,涵盖连续性、分离、顺序、包围与打结五类任务,并区分静态推理与交互规划两个层级。测试显示,当前闭源与开源模型在静态识别上表现明显优于交互规划,且均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧保留结构约束时才有帮助。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者造出可自我维持的 AI 病毒原型:利用开放权重 LLM 在受感染 GPU 上本地推理,漏洞检测成功率约 80%、利用成功率约 53%、自我复制成功率 88%,完整攻击成功率约 37%。
Berkeley Sky Lab 团队扩展了演化式 kernel 搜索框架 K-Search,新增 MLX 后端和结构化 CUDA-to-MLX 翻译层,可将已有 CUDA kernel 作为知识库自动适配为 Apple Silicon 上的高性能 kernel。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的交互摘要建模为自然语言“信念状态”,并通过信念评分(belief grading)监督其内容,从而替代完整交互历史作为智能体的工作上下文。
伯克利 AI 研究团队梳理了并行推理领域进展,指出主流方法多由外部固定并行结构,而非让模型自行决定何时分解任务、开启多少线程及如何协调。文章涵盖 Self-consistency、Best-of-N、Tree/Graph of Thoughts、MCTS 及 ParaThinker、GroupThink、Hogwild! Inference,并分析 ThreadWeaver 等自适应并行推理方向。
GRASP 是一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现时间并行优化、在状态迭代中注入随机性以探索、并重塑梯度让动作获得干净信号,避免经由高维视觉模型的脆弱"状态-输入"梯度。该方法由 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun、Amir Bar 等参与提出,针对长视野规划中优化病态、非贪心局部极小值与高维潜空间失效模式问题。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,利用稀疏性和低阶性将 LLM 交互识别转化为稀疏恢复问题,可在特征、数据和模型组件归因中高效发现关键交互。
伯克利 AI 研究院提出一种基于互信息的成像系统评估与优化框架,仅用含噪测量值和噪声模型即可量化测量所含信息量,无需任务专用解码器。在 NeurIPS 2025 论文中,该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域均能预测解码器性能,优化后的设计达到端到端方法水平,且内存与算力需求更低。