跳到正文

#推理

今日 1 条
今天10月2日周五
  1. AWS Machine Learning Blog32

    Amazon Payments 如何用 SageMaker AI 上的上下文多臂老虎机优化获客漏斗转化

    Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)做产品获客漏斗个性化,七周线上 A/B 测试中某一客群的漏斗末端转化率取得高个位数相对提升,另一客群则无改善,问题出在内容而非模型。方案对申请、提交、审批三个阶段各跑一个 LinUCB 模型并线性组合其 UCB 分数,以行为信号向量替代固定分群,示例代码已开源。

9月24日周四
9月16日周三
  1. Google Research35

    Google Research 提出 Retrieve-for-Train:用离线 RL 加速复杂 AI 搜索查询扩展

    Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扩展并蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次前向的查询 fan-out。该方法在 Gemma3-4B 和 Qwen3-4B 上微调,绕过测试时 CoT 推理 token 的开销,同时满足多样性、覆盖度等集合级属性,相关论文已被 ICML 2026 收录。

8月13日周四
  1. Microsoft Research32

    MindTopo 基准揭示 VLM 的空间推理能力短板

    Microsoft Research 推出 MindTopo 基准,用于评测多模态大语言模型的拓扑推理能力,涵盖连续性、分离、顺序、包围与打结五类任务,并区分静态推理与交互规划两个层级。测试显示,当前闭源与开源模型在静态识别上表现明显优于交互规划,且均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧保留结构约束时才有帮助。

7月29日周三
7月26日周日
5月8日周五
  1. Berkeley AI Research36

    自适应并行推理:高效推理扩展的下一范式

    伯克利 AI 研究团队梳理了并行推理领域进展,指出主流方法多由外部固定并行结构,而非让模型自行决定何时分解任务、开启多少线程及如何协调。文章涵盖 Self-consistency、Best-of-N、Tree/Graph of Thoughts、MCTS 及 ParaThinker、GroupThink、Hogwild! Inference,并分析 ThreadWeaver 等自适应并行推理方向。

4月20日周一
  1. Berkeley AI Research36

    GRASP:面向世界模型的梯度规划器,实现更长视野规划

    GRASP 是一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现时间并行优化、在状态迭代中注入随机性以探索、并重塑梯度让动作获得干净信号,避免经由高维视觉模型的脆弱"状态-输入"梯度。该方法由 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun、Amir Bar 等参与提出,针对长视野规划中优化病态、非贪心局部极小值与高维潜空间失效模式问题。

3月13日周五