新智元报道 编辑:LRS 一个模型处理多模态,谷歌用 AudioPaLM 给出答案。 大型语言模型以其强大的性能及通用性,带动了一批多模态的大模型开发,如音频、视频等。 语言模型的底层架构大多是基于 Transformer,且以解码器为主,所以无需过多调整模型架构即可适应其他序列模态。 最近,谷歌发 本文链接