Graphite 研究:Claude Opus 5.5 爱说"this matters",各前沿模型写作痕迹各不相同
Graphite 研究分析前沿模型写作习惯后发现,Claude Opus 5.5 最爱用"dependable"(比人类样本高 23 倍)和"this matters"(高 116 倍),OpenAI Astra 则偏好"another dimension"与"not simply X"式修正性表述(超人类 100 倍)。
Graphite 研究分析前沿模型写作习惯后发现,Claude Opus 5.5 最爱用"dependable"(比人类样本高 23 倍)和"this matters"(高 116 倍),OpenAI Astra 则偏好"another dimension"与"not simply X"式修正性表述(超人类 100 倍)。
Google Research 提出 ToolGrad,一种“答案优先”的工具调用数据集生成范式:先生成 ground-truth 工具链,再反推用户 prompt,从而以更低成本生成更复杂的长程工具调用数据。
Import AI 469 期介绍了新基准 DiG-bench,其包含 70 款规则与目标均隐藏的探索类游戏,公开 21 款并设七档难度,Opus 5 与搭配 Claude Code 的 Fable 5 表现最佳,仅这两者在 Tier 7 取得 0.2 成功率,而人类可达 100%。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大语言模型的拓扑推理能力,涵盖连续性、分离、顺序、包围与打结五类任务,并区分静态推理与交互规划两个层级。测试显示,当前闭源与开源模型在静态识别上表现明显优于交互规划,且均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧保留结构约束时才有帮助。