新智元报道 编辑:LRS 知识无法完全编入模型参数,学会搜索也是 AI 的必备技能! 在大型语言模型(LLM)的加持下,与视觉结合的多模态任务,如图像描述、视觉问答(VQA)和开放词汇目标识别(open-vocabulary object detection)等都取得了重大进展。 不过目前视觉语言模 本文链接