新智元报道 编辑:LRST Time-R1 通过三阶段强化学习提升模型的时间推理能力,其核心是动态奖励机制,根据任务难度和训练进程调整奖励,引导模型逐步提升性能,最终使 3B 小模型实现全面时间推理能力,超越 671B 模型。 时间,是我们日常生活中最基础的概念。 但对于大语言模型(LLM)来说,它 本文链接