新智元报道 编辑:乔杨好困 在基准测试上频频屠榜的大模型们,竟然被一道简单的逻辑推理题打得全军覆没?最近,研究机构 LAION 的几位作者共同发表了一篇文章,以「爱丽丝梦游仙境」为启发涉及了一系列简单的推理问题,揭示了 LLM 基准测试的盲区。 一道简单的逻辑问题,竟让几乎所有的 LLM 全军覆没? 本文链接