ServiceNow CoreAI 的 AutoSynthData:为企业智能体生成训练数据
ServiceNow CoreAI 推出 AutoSynthData,利用目标模型的失败案例与更强教师的成功轨迹定位能力缺口,再生成并校验新任务用于后训练。系统从评测中提炼「能力规格卡」指导生成器造题,不泄露原始 prompt、实体或验证器细节,并随模型提升动态调整课程。该流程已在 EnterpriseOps Gym 数据集上演示。
ServiceNow CoreAI 推出 AutoSynthData,利用目标模型的失败案例与更强教师的成功轨迹定位能力缺口,再生成并校验新任务用于后训练。系统从评测中提炼「能力规格卡」指导生成器造题,不泄露原始 prompt、实体或验证器细节,并随模型提升动态调整课程。该流程已在 EnterpriseOps Gym 数据集上演示。
GPT-6 Astra Ultrafast 现已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中上线,运行于 NVIDIA Blackwell GPU 之上。
推荐理由:通过 8x 提速和 API 可用性两个事实,读者能判断这一版本对编码智能体循环的实际影响。
AWS Professional Services 用四个智能体在 Amazon Bedrock AgentCore 上构建云迁移模式,基于 Strands Agents SDK 运行,将单应用的 IaC 开发时间从 3 至 4 周缩短至分钟级。
Amazon Quick 推出 Live Data in Apps,AI 构建的应用可在用户每次打开时实时查询受治理的 Quick Sight 数据集,取代发布时固化的静态快照。查询以查看者身份执行,自动沿用原有行级和列级安全规则,仅支持已认证的 Quick 用户,每位查看者首次使用需按数据集授权。SPICE 和 Direct Query 两种数据集模式均受支持。
AWS 发布教程,演示如何将 Amazon S3 Vectors 作为 NVIDIA NeMo Agent Toolkit(NAT)的持久化记忆层,并部署在 Amazon EKS 上。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)做产品获客漏斗个性化,七周线上 A/B 测试中某一客群的漏斗末端转化率取得高个位数相对提升,另一客群则无改善,问题出在内容而非模型。方案对申请、提交、审批三个阶段各跑一个 LinUCB 模型并线性组合其 UCB 分数,以行为信号向量替代固定分群,示例代码已开源。
Amazon Bedrock AgentCore 支持构建"环境感知智能体":S3 文件上传或定时任务等事件触发后,Agent 在 AgentCore Runtime 上自动启动任务,通过单一 ask_human 工具暂停等待人工审批后再继续执行。
AWS 发文介绍为 Claude Platform on AWS(CPonAWS)配置多环境访问的完整方案:在组织中设立专用 AI Services 账户承载订阅,通过跨账户 SigV4 让 AWS 工作负载免密钥调用推理,用 workspace 级 API key 供开发者本地调试,并以 OIDC 联合为外部 CI/CD 环境签发短期凭证。
台湾统一企业集团旗下数字平台 uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词级输出优化,以适配其零售审核策略。该策略按行为(9 类)和主体类型(brand、other、forbidden)两个维度分类互动,微调数据集含 3391 个对话窗口,评估使用 737 个对话窗口的留出测试集。
AI2 发布 Olmo-core 3,这是其大语言模型训练框架的一次重要升级,重新设计了开源 MoE 训练系统,目标是把 MoE 训练扩展到万亿参数规模并保持计算效率。
推荐理由:原文给出 MoE 训练栈的关键改动和对比数据,可看到开源训练基础设施在效率上的取舍。
NVIDIA 提出 AI 工厂回报取决于三个因素:每兆瓦产出、硬件使用寿命和需求广度。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
微软研究院开发了一套端到端机器学习系统,为美国本土66,935座变电站生成30-60分钟前的空间天气风险预测。该系统结合AE与Dst指数预报、地质电导率和电网数据,在评估期内检测到近80%的重大空间天气事件;其中Dst模型在峰值活动时段有62.2%的小时数优于Burton方程。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 开放使用,成为较早交付该平台的云厂商之一;Cognition 是首个在生产负载上运行 Vera Rubin 的客户。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队并直接服务企业客户,计划到 2030 年建成 1 吉瓦欧洲算力。其模型权重完全开放、可运行在客户自有基础设施上,并已与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI 应用,同时与慕尼黑工业大学(TUM)建立研究合作。
H 公司发布 Holo4 系列智能体模型,包含 27B dense 和 35B-A3B MoE 两个尺寸,均可通过 H Models API 调用,同时开源基于 Nemotron 3 Nano Omni 后训练得到的 Holotron4 Nano。
推荐理由:Holo4 用同一套权重打通 GUI、代码、MCP 与 API,公开了完整轨迹,读者可据此评估通用计算机智能体的跨界面路线。
GitHub Copilot 团队提出,chat 只是 LLM 的通用兜底界面,对明确任务应改用 canvas——一种运行在 GitHub Copilot 应用内、无浏览器外壳的全栈小应用,可与 agent 双向通信并在本地执行代码。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码实现设备端最高 3.13 倍、H100 上最高 2.66 倍解码加速,端到端最高提升 2.62 倍和 2.27 倍。
GitHub Copilot 应用重建了 pull request 视图,用一个包含 2200 个文件、超 100 万行改动和 400 多条行内评论的开源 PR 验证性能。其将文档高度拆成确定性代码几何与动态评论块几何两部分,代码行高预先精确计算,评论高度则惰性测量、有界修正并锚定到文件和行,避免滚动跳变。
微软研究院对移动机械臂操作负载做了系统性测量,发现将物理 AI 推理卸载到边缘或云端 GPU 可提升任务成功率与响应速度,并显著延长机器人续航。
NVIDIA 验证工程师 Sakeena Fiza 负责在数据中心系统实验室中,于产品量产前逐层验证从板卡到机架再到集群的硬件可靠性。她曾见证 NVIDIA Rubin GPU 首次在系统层面被识别,称那一刻全球首次实现 Rubin GPU 系统级枚举。她表示验证团队要成为"产品的第一批客户",在客户之前发现高速信号、散热余量与供电完整性等问题。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,可为中距离(middle-mile)物流生成真实且保护隐私的基准数据,代码与文档已在 GitHub 开源。该工具针对中距离运输的多商品流特性,建模货物在配送中心间的换车、分拣与时间窗衔接,而这一环节此前因企业网络拓扑与需求数据敏感、缺乏公开高质量数据,研究投入远少于首末公里配送。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,跨 128 个 PR 分批合入 main 而非一次性切换。
推荐理由:GitHub Copilot 运行时的 Rust 迁移复盘,给出原地原子替换、跨会话协作与缓存策略的可迁移工程方法。
Mistral 宣布与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(beta)由 Mistral 模型驱动,初期覆盖法国和北美用户,英国与德国预计今年晚些时候跟进。
GitHub 日本和韩国区营销负责人把活动运营流程交给 GitHub Copilot:整个活动由单个 GitHub Issue 驱动,配合 Issue forms 做报名表单、用 label 触发 GitHub Actions 工作流。活动设置从原本手工耗时一两天变为自动完成,每天早上还会自动筛选报名者并在结束后自行收尾,所依赖的是活动平台 API 与 CRM 官方 CLI 这类可脚本化的入口。
GitHub Copilot 应用将 diff、终端和浏览器面板内置在同一界面,用户无需在编辑器、终端和浏览器间切换即可完成审查、运行和预览 AI 生成代码的完整闭环。
Mistral 与 Cloudera 宣布合作,将 Mistral 模型集成进 Cloudera 混合数据平台,支持企业在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器代码迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值一致性校验框架,再用 Vibe CLI 派出上百个智能体解析调用树并整理文档;迁移时采用编码、测试、审查智能体加人工卡点的结构化流程,首个冲刺完成 30 万行中的 4 万行。
Google DeepMind 与 Google Research 发布全球天气 AI 模型 WeatherNext 3,直接学习实时卫星观测,逐小时生成预报,温度等关键地表变量分辨率达 5 公里,整体比上一代 WeatherNext 2 精细约五倍。
推荐理由:官方披露了实时卫星数据训练、逐小时刷新与降水精度提升的具体数字,可用于对比上一代全球天气模型。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案在沙特及中东地区的部署,合作规模达数亿欧元。双方将聚焦网络安全与语音领域,并开发阿拉伯语表现强劲的前沿模型;Mistral 还将探索使用 HUMAIN 的数据中心基础设施,双方计划在沙特面向受监管行业推出联合市场策略。
Mistral 发布 Agentic Search,作为让 AI 系统在复杂文档中导航、阅读和验证信息的检索层,通过 Mistral Search Toolkit 和 Studio、Vibe 中的 Libraries 提供。
推荐理由:官方给出多步检索循环的五工具设计与两组基准数字,读者可据此判断检索层如何替代一次性 RAG。
Mistral 宣布 Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行,以匹配数据驻留、监管和延迟要求;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和基于 SLA 的正常运行时间保障。
Berkeley Sky Lab 团队扩展了演化式 kernel 搜索框架 K-Search,新增 MLX 后端和结构化 CUDA-to-MLX 翻译层,可将已有 CUDA kernel 作为知识库自动适配为 Apple Silicon 上的高性能 kernel。
伯克利 EPIC Data Lab 提出,推理成本正快速趋近于零,GPT-4 级能力已从 2023 年初的约 $30/百万 token 降至不足 $1,部分厂商低于 $0.10。作者由此提出三类新挑战:为智能体重设计的数据系统、支撑成千上万智能体长期任务与共识的数据系统,以及由智能体直接合成、需可验证可信的数据系统。
伯克利 AI 研究团队梳理了并行推理领域进展,指出主流方法多由外部固定并行结构,而非让模型自行决定何时分解任务、开启多少线程及如何协调。文章涵盖 Self-consistency、Best-of-N、Tree/Graph of Thoughts、MCTS 及 ParaThinker、GroupThink、Hogwild! Inference,并分析 ThreadWeaver 等自适应并行推理方向。