梦晨鹭羽发自凹非寺 量子位 | 公众号 QbitAI 复刻 DeepSeek-R1 的长思维链推理,大模型强化学习新范式 RLIF 成热门话题。 UC Berkeley 团队共同一作Xuandong Zhao把这项成果称为:大模型无需接触真实答案,仅通过优化自己的信心,就能学会复杂推理。 具体来说, 本文链接