金磊整理自凹非寺 量子位 | 公众号 QbitAI 一个新的 Benchmark,竟让大模型在复杂视频推理这事儿上统统不及格! 这就是腾讯 ARC Lab 和香港城市大学最新推出的 Video-Holmes—— 如其名,它可以说是视频推理界的“福尔摩斯测试”,通过让多模态大模型参与“推理杀人凶手”, 本文链接