今天凌晨,OpenAI 突然宣布,在 Hugging Face 入侵事件后已经暂停了最新模型的强化学习(RL)训练两周;同时,原计划进行的迄今最大规模前沿强化学习训练也处于暂停状态—— 他们计划用这段额外的时间评估模型行为、获取有关模型安全对齐状况的信息并调整安全措施。 当然,这也意味着预热已久的下 本文链接