昆仑万维 2050 全球研究院、新加坡国立大学、新加坡南洋理工大学团队联合发布开源了 Vitron 通用像素级视觉多模态大语言模型。 Vitron 支持从视觉理解到视觉生成、从低层次到高层次的一系列视觉任务,包括静态图像和动态视频内容进行全面的理解、生成、分割等任务。同时,Vitron 也解决了图像 本文链接