语音合成这条赛道,最近越来越像早期的大语言模型:模型一个比一个强大,底层路线却远没有收敛。 有人选择非自回归的扩散,一次并行生成整段声音,但是这种方法只适合离线使用; 有人沿用大语言模型最熟悉的方式,把语音压成离散 Token,再逐个自回归预测,但是语音毕竟不是一个一个的词,这样的做法会有一个无法打 本文链接