新智元报道 编辑:桃子好困 错误奖励,也能让 AI 推理开挂!最新研究证明,伪奖励让 LLM 推理性能暴涨 24.6%,一举颠覆传统的 RL 训练认知。 今早的一篇爆火论文,彻底颠覆了人们对「强化学习」的传统认知。 仅用随机奖励,甚至是错误答案,也能让 AI 在数学推理中性能暴涨! 来自华盛顿大学、 本文链接