梦晨发自凹非寺量子位 | 公众号 QbitAI 丸辣!辛辛苦苦本地部署的大模型,怎么就是比官方版更笨?? 即使是同一张显卡,一毛一样的权重,推理软件栈的微小差异就让模型在关键位置输出完全不同的 token,甚至导致工具调用彻底失败。 这种陷阱很容易触发,但很难排查,还以为三体人来智子封锁了呢。 Le 本文链接