新智元报道 想象一下这个场景:一场多人线上会议,有人说话时画面自动聚焦到发言者;一段综艺素材,后期系统能自动识别谁在讲话并生成字幕;一段监控录像,系统能在人群中持续追踪正在说话的那个人。 这些功能背后依赖的是同一项技术——音视频说话人追踪(Audio-Visual Speaker Tracking) 本文链接