ServiceNow CoreAI 的 AutoSynthData:为企业智能体生成训练数据
ServiceNow CoreAI 推出 AutoSynthData,利用目标模型的失败案例与更强教师的成功轨迹定位能力缺口,再生成并校验新任务用于后训练。系统从评测中提炼「能力规格卡」指导生成器造题,不泄露原始 prompt、实体或验证器细节,并随模型提升动态调整课程。该流程已在 EnterpriseOps Gym 数据集上演示。
ServiceNow CoreAI 推出 AutoSynthData,利用目标模型的失败案例与更强教师的成功轨迹定位能力缺口,再生成并校验新任务用于后训练。系统从评测中提炼「能力规格卡」指导生成器造题,不泄露原始 prompt、实体或验证器细节,并随模型提升动态调整课程。该流程已在 EnterpriseOps Gym 数据集上演示。
AWS Professional Services 用四个智能体在 Amazon Bedrock AgentCore 上构建云迁移模式,基于 Strands Agents SDK 运行,将单应用的 IaC 开发时间从 3 至 4 周缩短至分钟级。
Amazon Quick 推出 Live Data in Apps,AI 构建的应用可在用户每次打开时实时查询受治理的 Quick Sight 数据集,取代发布时固化的静态快照。查询以查看者身份执行,自动沿用原有行级和列级安全规则,仅支持已认证的 Quick 用户,每位查看者首次使用需按数据集授权。SPICE 和 Direct Query 两种数据集模式均受支持。
AWS 发布教程,演示如何将 Amazon S3 Vectors 作为 NVIDIA NeMo Agent Toolkit(NAT)的持久化记忆层,并部署在 Amazon EKS 上。
Amazon Bedrock AgentCore 支持构建"环境感知智能体":S3 文件上传或定时任务等事件触发后,Agent 在 AgentCore Runtime 上自动启动任务,通过单一 ask_human 工具暂停等待人工审批后再继续执行。
AWS 发文介绍为 Claude Platform on AWS(CPonAWS)配置多环境访问的完整方案:在组织中设立专用 AI Services 账户承载订阅,通过跨账户 SigV4 让 AWS 工作负载免密钥调用推理,用 workspace 级 API key 供开发者本地调试,并以 OIDC 联合为外部 CI/CD 环境签发短期凭证。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 开放使用,成为较早交付该平台的云厂商之一;Cognition 是首个在生产负载上运行 Vera Rubin 的客户。
OpenAI 发布 GPT-6.1 Sol,主打接近 Astra 的智能水平,覆盖编码、电脑操作和专业工作场景,标准 API 输入与输出 token 价格均为 Astra 的五分之一。原文未给出更多参数、基准或开放细节。
推荐理由:OpenAI 以 Astra 五分之一的价格推出面向编码与电脑操作的新模型,可据此比较其定位与成本取舍。
OpenAI 发布 dots,一种能够在复杂项目和日常任务中持续推进工作的主动式助手。dots 让工作在向前推进的同时,用户仍能保持掌控。
微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践及生态与人才培养四大方向展开工作,并与新加坡经济发展局(EDB)、IMDA 等机构合作,在医疗、金融、教育等领域推动研究落地。
H 公司发布 Holo4 系列智能体模型,包含 27B dense 和 35B-A3B MoE 两个尺寸,均可通过 H Models API 调用,同时开源基于 Nemotron 3 Nano Omni 后训练得到的 Holotron4 Nano。
推荐理由:Holo4 用同一套权重打通 GUI、代码、MCP 与 API,公开了完整轨迹,读者可据此评估通用计算机智能体的跨界面路线。
GitHub Copilot 应用推出 canvases(画布扩展),一种用户与智能体共享的可定制界面,可做成看板、issue 分诊板、发布清单或仪表盘。在 agent 会话中输入 /create-canvas 并用自然语言描述工作流,即可生成界面,无需手写代码或设计布局;画布为双向同步,双方改动即时可见。
Google Research 发布一套面向长视频生成的多智能体框架,包括 AI video co-director、CANVAS、A²RD 和 VQQA,构建在 Gemini 与 Veo 之上,用于解决多镜头叙事中的语义漂移、特征漂移和内容崩塌问题。
GitHub Security Lab 发布面向 C/C++ 项目的自主模糊测试流水线 Fuzzing Taskflow,只需给定一个 GitHub 仓库地址,它就会自动识别入口函数、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness、对每次崩溃做归因并生成漏洞报告。
推荐理由:GitHub 安全实验室把模糊测试的覆盖反馈、崩溃归因等重复环节交给 LLM 智能体,读者可了解其任务流与工具分工。
GitHub Podcast 最新一期逐条拆解了五个 AI 开发热梗:"不用读 AI 生成的代码"要看你能否解释并负责结果;"不用 AI 就不被录用"更应看判断力;Skills 与 MCP 解决不同问题,前者是可读的 Markdown 封装经验,后者提供工具与数据的标准接口;RAG 也并未消亡,缺了检索会浪费 token、拖慢速度并更容易给出不完整答案。
Google Research 公布一项新研究实验,让教育者利用生成式 UI(GenUI)动态生成贴合教学目标与课程的互动式引导模拟,并已向可信测试教师群体获得初步正面反馈。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,跨 128 个 PR 分批合入 main 而非一次性切换。
推荐理由:GitHub Copilot 运行时的 Rust 迁移复盘,给出原地原子替换、跨会话协作与缓存策略的可迁移工程方法。
Mistral 宣布与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(beta)由 Mistral 模型驱动,初期覆盖法国和北美用户,英国与德国预计今年晚些时候跟进。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,分别面向规模化低成本场景和高复杂度多步推理任务。
推荐理由:官方给出语音对话模型的两档定位与多语言、后台调用工具等能力细节,可供开发者判断接入场景。
GitHub 日本和韩国区营销负责人把活动运营流程交给 GitHub Copilot:整个活动由单个 GitHub Issue 驱动,配合 Issue forms 做报名表单、用 label 触发 GitHub Actions 工作流。活动设置从原本手工耗时一两天变为自动完成,每天早上还会自动筛选报名者并在结束后自行收尾,所依赖的是活动平台 API 与 CRM 官方 CLI 这类可脚本化的入口。
Google Research 提出 ToolGrad,一种“答案优先”的工具调用数据集生成范式:先生成 ground-truth 工具链,再反推用户 prompt,从而以更低成本生成更复杂的长程工具调用数据。
GitHub Copilot 应用将 diff、终端和浏览器面板内置在同一界面,用户无需在编辑器、终端和浏览器间切换即可完成审查、运行和预览 AI 生成代码的完整闭环。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器代码迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值一致性校验框架,再用 Vibe CLI 派出上百个智能体解析调用树并整理文档;迁移时采用编码、测试、审查智能体加人工卡点的结构化流程,首个冲刺完成 30 万行中的 4 万行。
Mistral 发布 Agentic Search,作为让 AI 系统在复杂文档中导航、阅读和验证信息的检索层,通过 Mistral Search Toolkit 和 Studio、Vibe 中的 Libraries 提供。
推荐理由:官方给出多步检索循环的五工具设计与两组基准数字,读者可据此判断检索层如何替代一次性 RAG。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的交互摘要建模为自然语言“信念状态”,并通过信念评分(belief grading)监督其内容,从而替代完整交互历史作为智能体的工作上下文。
伯克利 EPIC Data Lab 提出,推理成本正快速趋近于零,GPT-4 级能力已从 2023 年初的约 $30/百万 token 降至不足 $1,部分厂商低于 $0.10。作者由此提出三类新挑战:为智能体重设计的数据系统、支撑成千上万智能体长期任务与共识的数据系统,以及由智能体直接合成、需可验证可信的数据系统。