Graphite 研究:Claude Opus 5.5 爱说"this matters",各前沿模型写作痕迹各不相同
Graphite 研究分析前沿模型写作习惯后发现,Claude Opus 5.5 最爱用"dependable"(比人类样本高 23 倍)和"this matters"(高 116 倍),OpenAI Astra 则偏好"another dimension"与"not simply X"式修正性表述(超人类 100 倍)。
Graphite 研究分析前沿模型写作习惯后发现,Claude Opus 5.5 最爱用"dependable"(比人类样本高 23 倍)和"this matters"(高 116 倍),OpenAI Astra 则偏好"another dimension"与"not simply X"式修正性表述(超人类 100 倍)。
Google 发布 Gemini 4 Argon,这是其七个多月来首个前沿模型,先开放给 Fairwind 计划下的可信网络防御方及内部团队,之后才向 API 付费客户和 Google AI Ultra 订阅者开放,时间未定。
推荐理由:呈现 Gemini 4 Argon 与 GPT-6、Claude 系列在独立基准、token 消耗和价格上的横向对比,可用于判断其性价比位置。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源 TTS 模型,让单模型评测耗时从数周投票缩短到数小时。
Anthropic 发布 Claude Sonnet 5.5,官方称其运行速度快 30% 以上、多数工作成本最多降低 30%,定价与 Sonnet 5 相同但各项基准表现更好。
推荐理由:作者用同一套提示词横评 Sonnet 5.5 与 Opus 5.5,读者可借实测细节判断它的编码能力与免费档定位。
英国 AI Security Institute(AISI)正使用 EvalEval 的 Every Eval Ever schema 和 Evaluation Cards 平台公开评测结果。
Google Research 提出 ToolGrad,一种“答案优先”的工具调用数据集生成范式:先生成 ground-truth 工具链,再反推用户 prompt,从而以更低成本生成更复杂的长程工具调用数据。
Import AI 469 期介绍了新基准 DiG-bench,其包含 70 款规则与目标均隐藏的探索类游戏,公开 21 款并设七档难度,Opus 5 与搭配 Claude Code 的 Fable 5 表现最佳,仅这两者在 Tier 7 取得 0.2 成功率,而人类可达 100%。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大语言模型的拓扑推理能力,涵盖连续性、分离、顺序、包围与打结五类任务,并区分静态推理与交互规划两个层级。测试显示,当前闭源与开源模型在静态识别上表现明显优于交互规划,且均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧保留结构约束时才有帮助。
Import AI 第 468 期收录了智库 IFP 提出的 23 条“低遗憾”政策建议,分属 7 个类别,用于帮助政策制定者应对 AI 研发进一步自动化的风险。MIT 与 Columbia 的论文《Racing to Ruin》分析认为,竞争对手之间实现协调减速的关键变量是技术开发的透明度以及对对方理性、可信的建模。