新智元报道 在语音助手、多用户共享的家庭助理等长期对话场景中,模型需要跨越多次会话记住用户的信息,但现有评测常遭遇两大难题: 一是语音中的关键信息不止于文字,说话人身份、语气和背景声只存在于音频信号里,转写后即丢失,而现有基准大多只考词汇内容; 二是真实交互分布在相隔一段时间的多个会话中,现有基准却 本文链接