微软研究院最近开源了 Visual ChatGPT,一个聊天机器人系统,可以根据人类的文本提示生成和处理图像。该系统将 OpenAI 的 ChatGPT 与 22 种不同的视觉基础模型(VFM)相结合,可以支持多模态交互。 arXiv 上的一篇论文对该系统进行了描述。用户可以通过输入文本或上传图片与 本文链接