新智元报道 编辑:KingHZ AI 能写论文、画图、考高分,但连「看表读时间」「今天是星期几」都错得离谱?最新研究揭示了背后惊人的认知缺陷,提醒我们:AI 很强大,但精确推理还离不开人类。 有些任务对人类来说轻而易举,但 AI 频频出错。 比如,单词「strawberry」中有几个字母「r」一度难
新智元报道 编辑:LRS 理想中的多模态大模型应该是什么样?十所顶尖高校联合发布 General-Level 评估框架和 General-Bench 基准数据集,用五级分类制明确了多模态通才模型的能力标准。当前多模态大语言模型在任务支持、模态覆盖等方面存在不足,且多数通用模型未能超越专家模型,真正的
新智元报道 编辑:Aeneas 定慧 太震撼了,有开发者代码实证后发现,谷歌 AlphaEvolve 的矩阵乘法突破,被证明为真!Claude 辅助下,他成功证明,它果然仅用了 48 次乘法,就正确完成了4×4 矩阵的乘法运算。接下来,可以坐等 AlphaEvolve 更「奇点」的发现了。 就在刚刚
新智元报道 编辑:KingHZ 在基本物理任务上,前沿 AI 模型仍会失败!ML 研究院的测试案例显示白领将被 Ai 替代,而制造业等蓝领工作不受影响。未来已来,只是分布得不均匀。 基于 AI 研究、机器人以及实际制造等过往经验,Adam Karvonen 在零件制造任务上,测评了顶尖模型的表现。
新智元报道 编辑:Aeneas 犀牛 就在刚刚,智源研究员联合多所高校开放三款向量模型,以大优势登顶多项测试基准。其中,BGE-Code-v1 直接击穿代码检索天花板,百万行级代码库再也不用怕了! 检索增强技术在代码及多模态场景中的发挥着重要作用,而向量模型是检索增强体系中的重要组成部分。 针对这一
新智元报道 编辑:KingHZ DeepSeek-R1 引爆了 LLM 推理革命,人们几乎形成了共识:推理能力越强,LLM 越好。但多位华人参与的研究揭示:思维链 CoT 分散模型「注意力」,可能是性能崩塌的导火索。 DeepSeek-R1 火了,推理模型火了,思维链(Chain-of-Though
斗鱼发布 2025 年第一季度财报。本季度斗鱼总收入 9.47 亿元,其中创新业务、广告及其他收入 3.83 亿元,同比增长 60.2%;毛利润为 1.14 亿元,同比增长 4.1%,环比增长 62.6%;运营亏损为 2610 万元,同比减少 84.3%;调整后净亏损为 2090 万元,同比缩窄 7
一项研究首次揭示了肺活量从童年到老年的演变过程。学术界此前认为,人体肺功能在 20 至 25 岁达到顶峰,之后趋于稳定,并于成年后期随着肺部衰老而开始衰退。然而,这一模型是基于并未覆盖全生命周期的研究建立的。相比之下,新研究采用了“加速队列设计”,即将多项队列研究数据整合以覆盖所需年龄范围。 研究显
文 | 周天财经,作者 | 晏川 很少有人能预见到哪吒汽车会在短短几年内经历如此戏剧性的命运转折。 凭借亲民价格,哪吒汽车一度成为汽车市场的黑马,2021 年全年销量突破 6.9 万辆,同比增长超过 360%,在造车新势力中一跃成为销量前五强。2022 年似乎更是哪吒扬帆起航的一年,全年交付 15.