一个北大投稿发送至凹非寺 量子位公众号 QbitAI 训完 130 亿参数通用视觉语言大模型,只需 3 天! 北大和中山大学团队又出招了——在最新研究中,研究团队提出了一种构建统一的图片和视频表征的框架。 利用这种框架,可以大大减少 VLM(视觉语言大模型)在训练和推理过程中的开销。 具体而言,团队 本文链接