ServiceNow CoreAI 的 AutoSynthData:为企业智能体生成训练数据
ServiceNow CoreAI 推出 AutoSynthData,利用目标模型的失败案例与更强教师的成功轨迹定位能力缺口,再生成并校验新任务用于后训练。系统从评测中提炼「能力规格卡」指导生成器造题,不泄露原始 prompt、实体或验证器细节,并随模型提升动态调整课程。该流程已在 EnterpriseOps Gym 数据集上演示。
ServiceNow CoreAI 推出 AutoSynthData,利用目标模型的失败案例与更强教师的成功轨迹定位能力缺口,再生成并校验新任务用于后训练。系统从评测中提炼「能力规格卡」指导生成器造题,不泄露原始 prompt、实体或验证器细节,并随模型提升动态调整课程。该流程已在 EnterpriseOps Gym 数据集上演示。
GPT-6 Astra Ultrafast 现已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中上线,运行于 NVIDIA Blackwell GPU 之上。
推荐理由:通过 8x 提速和 API 可用性两个事实,读者能判断这一版本对编码智能体循环的实际影响。
AWS Professional Services 用四个智能体在 Amazon Bedrock AgentCore 上构建云迁移模式,基于 Strands Agents SDK 运行,将单应用的 IaC 开发时间从 3 至 4 周缩短至分钟级。
Amazon Quick 推出 Live Data in Apps,AI 构建的应用可在用户每次打开时实时查询受治理的 Quick Sight 数据集,取代发布时固化的静态快照。查询以查看者身份执行,自动沿用原有行级和列级安全规则,仅支持已认证的 Quick 用户,每位查看者首次使用需按数据集授权。SPICE 和 Direct Query 两种数据集模式均受支持。
AWS 发布教程,演示如何将 Amazon S3 Vectors 作为 NVIDIA NeMo Agent Toolkit(NAT)的持久化记忆层,并部署在 Amazon EKS 上。
OpenAI 探讨先进 AI 为何可能对突破性想法背后的日常工作影响最大,即执行环节可能塑造下一阶段的经济与进步速度。文章围绕这一判断展开分析。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)做产品获客漏斗个性化,七周线上 A/B 测试中某一客群的漏斗末端转化率取得高个位数相对提升,另一客群则无改善,问题出在内容而非模型。方案对申请、提交、审批三个阶段各跑一个 LinUCB 模型并线性组合其 UCB 分数,以行为信号向量替代固定分群,示例代码已开源。
Amazon Bedrock AgentCore 支持构建"环境感知智能体":S3 文件上传或定时任务等事件触发后,Agent 在 AgentCore Runtime 上自动启动任务,通过单一 ask_human 工具暂停等待人工审批后再继续执行。
AWS 发文介绍为 Claude Platform on AWS(CPonAWS)配置多环境访问的完整方案:在组织中设立专用 AI Services 账户承载订阅,通过跨账户 SigV4 让 AWS 工作负载免密钥调用推理,用 workspace 级 API key 供开发者本地调试,并以 OIDC 联合为外部 CI/CD 环境签发短期凭证。
Albertsons 正使用 ChatGPT Enterprise 和 OpenAI API 帮助团队加快工作速度,并让数百万顾客的购物体验更便捷。这是 OpenAI 公布的零售商内部转型案例。
台湾统一企业集团旗下数字平台 uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词级输出优化,以适配其零售审核策略。该策略按行为(9 类)和主体类型(brand、other、forbidden)两个维度分类互动,微调数据集含 3391 个对话窗口,评估使用 737 个对话窗口的留出测试集。
AI2 发布 Olmo-core 3,这是其大语言模型训练框架的一次重要升级,重新设计了开源 MoE 训练系统,目标是把 MoE 训练扩展到万亿参数规模并保持计算效率。
推荐理由:原文给出 MoE 训练栈的关键改动和对比数据,可看到开源训练基础设施在效率上的取舍。
NVIDIA 提出 AI 工厂回报取决于三个因素:每兆瓦产出、硬件使用寿命和需求广度。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
社交俱乐部 The Den 在开设新门店时,用 ChatGPT Work 将拨款申请准备时间从 3 天缩短至 2 小时,酒牌材料从 4 天缩短至 3 小时,每周节省 10-15 小时。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御方开放,随后逐步扩展至开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:官方给出 Gemini 4 Argon 的基准得分、输出上限与分阶段开放路径,便于判断其在编码与企业任务上的位置。
NVIDIA 第 26 届研究生奖学金项目面向全球开放 2027–2028 学年申请,每位学生最高可获 6 万美元资助。该项目支持 AI、机器学习、自动驾驶、计算机图形、机器人、医疗和高性能计算等方向博士生,申请者须已完成至少一年博士阶段学习,截止日期为 2026 年 10 月 30 日,并须在 2027 年暑期参加 NVIDIA 研究办公室的线下实习。
微软研究院开发了一套端到端机器学习系统,为美国本土66,935座变电站生成30-60分钟前的空间天气风险预测。该系统结合AE与Dst指数预报、地质电导率和电网数据,在评估期内检测到近80%的重大空间天气事件;其中Dst模型在峰值活动时段有62.2%的小时数优于Burton方程。
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可见签名嵌入生物代码,使其不仅在数字模型上可验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:DeepMind 把水印做进蛋白质序列与 AlphaFold 3 权重,为 DNA 合成筛查提供了一条可自动验证的来源信号。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 开放使用,成为较早交付该平台的云厂商之一;Cognition 是首个在生产负载上运行 Vera Rubin 的客户。
OpenAI 披露其阻断了一起协同的模型蒸馏行动,该行动旨在提取受保护的模型推理能力。OpenAI 表示正在加强对对抗性蒸馏的防御。
OpenAI 与美国 SBDC 合作,为小企业扩大 AI 实操培训与本地支持,并同步发布一份关于小团队如何使用 AI 的新报告。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源 TTS 模型,让单模型评测耗时从数周投票缩短到数小时。
Google Research 提出 Diffusion Controller 框架,把图像生成的去噪过程重构为连续控制问题,通过一个轻量"转向阻尼"网络在冻结基座模型的前提下动态调整生成轨迹。
NVIDIA 发布表格数据开源基础模型 Kumo Tabular,可在单次前向传播中完成分类与回归预测,无需训练、调参和特征工程。
推荐理由:文章完整披露了表格基础模型的预训练数据构造与架构设计,可据此判断免训练推理在表格任务上的可行性边界。
Microsoft Research 发布面向生物学复杂性的 AI 研究系统 Quine,由跨模态生物学世界模型与连接科学工具、文献、湿实验和研究者的交互式 harness 组成。
推荐理由:原文给出 Quine 的多模态世界模型与湿实验验证结果,并开放 Fellows 申请,可据此判断生物学 AI 研究系统的落地路径。
Hugging Face 博客发布论文 ProvenanceGuard,一个运行在黑盒 MCP 智能体之上的生成后验证层,专门识别"跨来源混淆"——即内容属实但归错来源的说法。
OpenAI DevDay 2026 公布了 20 多项更新,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。
OpenAI 发布 GPT-6.1 Sol,主打接近 Astra 的智能水平,覆盖编码、电脑操作和专业工作场景,标准 API 输入与输出 token 价格均为 Astra 的五分之一。原文未给出更多参数、基准或开放细节。
推荐理由:OpenAI 以 Astra 五分之一的价格推出面向编码与电脑操作的新模型,可据此比较其定位与成本取舍。
OpenAI 发布 dots,一种能够在复杂项目和日常任务中持续推进工作的主动式助手。dots 让工作在向前推进的同时,用户仍能保持掌控。
微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践及生态与人才培养四大方向展开工作,并与新加坡经济发展局(EDB)、IMDA 等机构合作,在医疗、金融、教育等领域推动研究落地。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队并直接服务企业客户,计划到 2030 年建成 1 吉瓦欧洲算力。其模型权重完全开放、可运行在客户自有基础设施上,并已与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI 应用,同时与慕尼黑工业大学(TUM)建立研究合作。
H 公司发布 Holo4 系列智能体模型,包含 27B dense 和 35B-A3B MoE 两个尺寸,均可通过 H Models API 调用,同时开源基于 Nemotron 3 Nano Omni 后训练得到的 Holotron4 Nano。
推荐理由:Holo4 用同一套权重打通 GUI、代码、MCP 与 API,公开了完整轨迹,读者可据此评估通用计算机智能体的跨界面路线。
GitHub Copilot 应用推出 canvases(画布扩展),一种用户与智能体共享的可定制界面,可做成看板、issue 分诊板、发布清单或仪表盘。在 agent 会话中输入 /create-canvas 并用自然语言描述工作流,即可生成界面,无需手写代码或设计布局;画布为双向同步,双方改动即时可见。
GitHub Copilot 团队提出,chat 只是 LLM 的通用兜底界面,对明确任务应改用 canvas——一种运行在 GitHub Copilot 应用内、无浏览器外壳的全栈小应用,可与 agent 双向通信并在本地执行代码。
Google Research 发布一套面向长视频生成的多智能体框架,包括 AI video co-director、CANVAS、A²RD 和 VQQA,构建在 Gemini 与 Veo 之上,用于解决多镜头叙事中的语义漂移、特征漂移和内容崩塌问题。
GitHub Security Lab 发布面向 C/C++ 项目的自主模糊测试流水线 Fuzzing Taskflow,只需给定一个 GitHub 仓库地址,它就会自动识别入口函数、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness、对每次崩溃做归因并生成漏洞报告。
推荐理由:GitHub 安全实验室把模糊测试的覆盖反馈、崩溃归因等重复环节交给 LLM 智能体,读者可了解其任务流与工具分工。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 基础上把近实时视频生成与语音对话原生结合,让企业智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。
推荐理由:原文给出了实时视频形象与语音对话的原生耦合方式,读者可据此判断企业级实时多模态交互的落地形态。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码实现设备端最高 3.13 倍、H100 上最高 2.66 倍解码加速,端到端最高提升 2.62 倍和 2.27 倍。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构。
推荐理由:NVIDIA 与 Google DeepMind 等联合开放 2800 多种病毒的蛋白复合物结构预测数据集,读者可了解其生成方式与开放入口。
Remedy Entertainment 的 CONTROL Resonant 已在 GeForce NOW 首发上线,Ultimate 会员可以 GeForce RTX 5080 级性能串流,支持 DLSS 4、光线追踪、NVIDIA Reflex 与最高 5K HDR,无需 100GB 本地安装。