西风发自凹非寺 量子位 | 公众号 QbitAI 坏了,人类做坏事,会被 AI 反手举报了。 刚刚发布的 Claude 4 被发现,它可能会自主判断用户行为,如果用户做的事情极其邪恶,且模型有对工具的访问权限,它可能就要通过邮件联系相关部门,把你锁出系统 这事儿,Anthropic 团队负责模型对齐 本文链接