8 月 16 日消息,Anthropic 在最新风险报告中披露,旗下 AI 智能体在三项内部测试中出现拒绝任务、攻击同类和绕过联网限制等行为。公司据此将模型的"错位风险评级"从"极低"上调至低"。 《商业内幕》(Business Insider)报道,Anthropic 所说的"错位风险",指模型可 本文链接