新智元报道 DeepSeek-R1 之后,「让模型想得更久」几乎成了提升推理能力的标准答案。 但对多模态大模型而言,推理 token 更多,并不必然意味着视觉推理更充分。恰恰相反,模型在开头还能准确描述图像,随着生成内容不断累积,后续推理却可能越来越依赖自己写出的文字。 只要早期描述出现一点偏差,错 本文链接