新智元报道 最近,Apple 联合 Hasso Plattner 研究所发表论文,在 9 个基座模型、11 种语言上做了超过 200 组 GRPO 强化学习推理训练实验。 https://arxiv.org/pdf/2608.13698 结果显示,用中文做推理训练,与英语训练的性能差距只有 1.1 本文链接