新智元报道 多模态大模型的物体幻觉,长期被归因于语言先验。 先看下面两组对话。 第一组,一张只有小狗的照片,问模型「图中有椅子吗」,它答「没有,图中是一只狗」,完全正确; 第二组,另一张照片,问「图中有餐桌吗」,模型却言之凿凿地回答「有一张餐桌,还有一个男孩站在它前面」,而画面里根本没有餐桌。 这就 本文链接