新智元报道 编辑:LRST 中科院自动化所提出 DipLLM,这是首个在复杂策略游戏 Diplomacy 中基于大语言模型微调的智能体框架,仅用 Cicero 1.5% 的训练数据就实现超越,展现出卓越的策略能力和样本效率。该框架通过自回归分解将复杂决策任务转化为序列化子任务,结合理论支持的均衡策略 本文链接