百灵大模型团队发布 Ring-2.5-1T-Zero,探索在不使用人工标注推理数据的情况下,把可验证奖励强化学习扩展到 1 万亿参数。团队把高质量思维链拆为可理解性、可复现性和效率三个维度,不再只看最终答案正确率。 百灵大模型团队发布 Ring-2.5-1T-Zero,探索在不使用人工标注推理数据的 本文链接