【ICLR 2025 SynthData Workshop】MasterMind:用算法合成数据赋能 LLM 的决策游戏能力|从决策智能到 LLM 推理视角

摘要

本文解读 ICLR 2025 SynthData Workshop 论文《Empowering LLMs in Decision Games through Algorithmic Data Synthesis》(MasterMind)。该论文提出用算法数据合成为 LLM 生成决策游戏训练语料,融合斗地主(不完全信息)与围棋(复杂多步搜索)两大经典游戏,通过三阶段/四任务课程式后训练让语言模型掌握游戏并提升泛化推理。其特别之处在于把"推理过程"而非"状态-动作对"写进训练数据,并引入对手策略预测头应对不完全信息。实验表明 Mastermind-Dou 动作准确率 90%、对 DouZero 专家胜率 41%,Mastermind-Go 下一状态预测精度 99.44%,且 BIG-Bench Hard 长序列推理任务显著提升,为 LLM 数据合成策略提供了新思路。

视频讲解点击观看 B 站视频

论文基本信息

项目内容
标题(英文)Empowering LLMs in Decision Games through Algorithmic Data Synthesis
标题(中文)用算法合成数据赋能 LLM 的决策游戏能力
作者Haolin Wang, Xueyan Li, Yazhe Niu, Shuai Hu, Hongsheng Li
机构上海人工智能实验室(OpenDILab)· 北京航空航天大学 · 香港中文大学 · 新西伯利亚国立大学
会议ICLR 2025 SynthData Workshop
arXivarXiv:2503.13980
项目网站OpenDILabCommunity/MasterMind(数据集)

背景与动机

为什么 LLM 需要新的推理训练数据?

  • 现状局限:LLM 在代码、数学任务上已表现出较强的推理能力,但面对现实世界的复杂决策仍力不从心——逻辑推理整体不足,缺乏对任务的深度整体理解。
  • 代码与数学数据的短板:结构明确但缺乏不确定性与自然语言多样性;决策游戏数据则天然包含不完全信息、随机性与分阶段推理结构,更接近真实世界。
  • 现有工作的空白:如 ChessGPT 只在单一棋类上做策略-语言桥接;而开源智能体 DouZero(斗地主)、KataGo(围棋)与 LightZero 平台已经证明可以自动生成海量高质量对局数据。
  • 核心观察:决策游戏的推理过程可分阶段拆解(模拟人类逐步推理),且数据可以由智能体自动合成——这让游戏成为代码、数学之外的第三条推理语料路线

研究主线:从问题到结论

Mermaid 图 1

图 9:MasterMind 研究主线:问题→动机→课程设计→结果(Mermaid 流程图)

基准/方法设计

MasterMind 双 agent 架构

  • MasterMind-Dou(斗地主):三阶段推理流水线——① 可行动作预测:基于历史记录与手牌预测 Top-p 候选动作;② 对手策略预测:额外的神经网络头预测对手下一动作,像 in-context learning 一样输入对手样本;③ 最终动作选择:拼接前两步分析生成最终决策。
  • MasterMind-Go(围棋):四任务课程——① 规则层:预测下一状态 $s,a\to s'$;② 状态评估层:用 KataGo 生成领地/点差/胜率分析;③ 自然语言理解层:从棋书提取局面解释;④ 决策层:综合全部信息做最终决策。
  • 防过拟合设计:动态候选动作(DouZero Q 网络 Top-p 概率和 25% 过滤,压缩超过 27000 的合法动作空间)+ 思想链(CoT)训练,让模型关注推理过程而非死记规则。

MasterMind 总体愿景:从斗地主与围棋合成数据到更强的智能体 图 1:通过合成数据精炼 LLM:从斗地主与围棋到更强大的智能体(论文 Fig. 1)

分类全景

Mermaid 图 2

图 10:MasterMind 双域数据/任务分解全景(Mermaid 流程图)

方法细节

数据合成与训练要点

  • 文本化:斗地主卡牌编码为整数(3=3…A=14、2=17、小王=20、大王=30),候选动作离散化;围棋 19×19 棋盘用符号"o"(白)、"#"(黑)、"•"(空)一维序列化,行列标号 A1–T19。
  • 对手建模:规则型、监督学习型、DouZero 三类 agent 生成多样对手数据,按水平标注,保证模型能泛化到新对手。
  • 训练损失:标准 SFT 最大似然 $L_\theta=\frac{1}{N}\sum_{i=1}^{N}\log P_\theta(Y_i|X_i)$;LLaMA-2-7B + LoRA(r=32,α=64),8×A100,3000 步预热。
  • Count 函数:生成阶段程序化计算围棋领地与点差,弥补 LLM 数领地弱点,稳定胜率预测。
  • 数据规模:六个数据集合计约 1.5T tokens(Dou-prob 171 万样本、Go-next-state 15 万样本、Go-analysis 13.9 万样本等)。

MasterMind-Dou 三阶段训练流水线 图 2:LLM 先预测合法动作、再分析对手响应、最后确定最优决策(论文 Fig. 2)

MasterMind-Go 四任务课程流水线 图 3:四个渐进任务生成多样的棋局分析,再转化为文本数据微调 LLM(论文 Fig. 3)

实验设计与结果

评测协议

LLaMA-2-7B 主干,8×A100 训练;斗地主对局每轮重复 100 次、模型固定地主位、农民由开源 agent 扮演;基线包括 0-shot、few-shot、few-shot+similarity、无概率思想链(w/o prob)变体。

Doudizhu 主表(与专家数据对齐)

模型Act. Acc. ↑CoT RL ↑Pred. Acc. ↑
LLaMA-2-7B (0-shot)0%0.520%
LLaMA-2-7B (few-shot)21.18%N/AN/A
few-shot + similarity42.65%N/AN/A
Mastermind-Dou w/o prob78%N/AN/A
Mastermind-Dou with prob90%0.9839%

对局胜率(地主位,100 轮)

模型v.s. RLCard ↑v.s. DouZero ↑
LLaMA-2-7B0%0%
LLaMA-2-7B (few-shot)12%3%
Mastermind-Dou w/o prob78%33%
Mastermind-Dou with prob90%41%
DouZero (Expert)90%43%

Go 代理任务(误差越低越好)

模型s' Acc. ↑Score MAE ↓Winrate MAE ↓expl. RL ↑expl. ppl. ↓
LLaMA-2-7B0%N/AN/A0.2811.45
Single-task99.44%1.805.140.445.23
Multi-task96.08%1.744.490.433.64

泛化与规模效应

  • BBH 泛化:TempSeq 12%→20.4%、Nav 53.6%→60%、Hyper. 51.6%→62.8%(Mastermind-Dou);但 Date 60.4%→22.8% 等短程任务下降(灾难性遗忘)。
  • 跨模型验证:Gemma-2B-Mastermind 76.69% vs Gemma-7B-Mastermind 86.27% Act. Acc.——收益随模型规模增大而更明显。

Mastermind 击败 DouZero 的关键局面复盘 图 4:Mastermind(地主)v.s. DouZero(农民):更主动的出牌策略带来胜利(论文附录 Fig. 9)

DouZero 落败的完整对局关键帧 图 5:DouZero(地主)v.s. DouZero(农民):农民获胜(论文附录 Fig. 8)

围棋下一状态预测三难度示例 图 6:围棋 $s,a\to s'$ 数据示例,难度从左到右递增(论文附录 Fig. 10)

围棋领地与胜率预测示例 图 7:围棋领地估计与胜率预测示例(论文附录 Fig. 11)

围棋步骤式推理四象限 图 8:下棋时的步骤式推理:棋盘状态→领地归属→点差与胜率→局面评述(论文附录 Fig. 6)

结果对比总结

Mermaid 图 3

图 11:斗地主结果对比总结:从 0% 到 90% 与对局胜率(Mermaid 流程图)

关键发现

关键发现

  1. 斗地主从 0 到 90%:训练前 0-shot 动作准确率 0%,Mastermind-Dou 完整版达 90%,对 RLCard 胜率 90%、对 DouZero 胜率 41%(DouZero 自身 43%)。
  2. 推理过程可学:CoT RL 相似度 0.98;消融去掉概率思想链后准确率从 90% 降至 78%——思想链是泛化关键。
  3. 围棋规则理解近乎完美:下一状态预测 99.44%,胜率 MAE ≤5%,解释 Rouge-L 0.44(基线 0.28)。
  4. 非模仿证据:部分局面 Mastermind 用与 DouZero 不同的策略取胜,说明学到的是高层策略而非行为克隆。
  5. 长序列推理迁移:BBH 的 TempSeq 从 12% 提升到 20.4%、Navigation 从 53.6% 到 60%。
  6. 规模正相关:Gemma-7B(86.27%)比 Gemma-2B(76.69%)收益更明显。

局限性

局限性

  • 围棋未做完整对局评测:SFT 学围棋成本高,只用代理任务(状态预测/评估/解释)验证。
  • 灾难性遗忘:BBH 日期任务 60.4%→22.8%、几何任务 19.2%→7.6%——后训练未覆盖的技能被弱化。
  • 数据依赖专家智能体:需要 DouZero/KataGo 级别 agent 合成数据,跨游戏泛化未验证。
  • 仅文本模态:二维棋盘压成一维序列,未利用视觉信息。
  • 作者展望:把决策游戏数据引入预训练阶段,可能全面提升推理能力。

常见问题(FAQ)

常见问题(FAQ)

MasterMind 是什么?

MasterMind 是上海人工智能实验室 OpenDILab 团队提出的 LLM 决策游戏后训练方案,包含 MasterMind-Dou(斗地主)与 MasterMind-Go(围棋)两个 agent,核心是用算法合成游戏数据微调 LLM。

为什么选择斗地主和围棋?

斗地主考验不完全信息下的决策(看不见对手手牌),围棋考验复杂多步搜索与空间推理(19×19 棋盘、一维序列建模)——分别对应现实决策中不确定性与长程规划两大难点。

对手策略预测头有什么用?

斗地主的优化策略高度依赖对手策略。额外的预测头让模型学会"读牌":预测对手下一动作,并在推理时输入当前对手样本(类似 in-context learning),把不完全信息转化为可推理的输入。

训练数据从哪里来?

数据由开源智能体自动合成:斗地主来自规则型/SL/DouZero agent 的自对弈,围棋来自 KataGo 自对弈记录与围棋书籍,共六个数据集约 1.5T tokens,无需人工标注。

游戏后训练真的提升通用推理吗?

是。BBH 长序列任务显著提升(TempSeq 12%→20.4%、Nav 53.6%→60%),但日期/几何类短程任务下降,说明收益集中在长序列建模与不确定推理,且存在灾难性遗忘风险。

数据集在哪里可以获取?

数据集已开源在 HuggingFace:OpenDILabCommunity/MasterMind(https://huggingface.co/datasets/OpenDILabCommunity/MasterMind)。

参考链接

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

内容概要:本文聚焦风电出力的不确定性问题,采用拉丁超立方抽样(Latin Hypercube Sampling, LHS)方法生成具有统计代表性的风电出力初始场景集,有效克服传统蒙特卡洛抽样存在的样本冗余与收敛速度慢的缺陷。为进一步降低场景数量以提升电力系统优化调度的计算效率,研究结合K-means聚类、快速前向选择等场景缩减技术,对生成的高维场景进行聚合与概率修正,保留最具代表性的典型场景及其对应概率分布。整个建模流程在Matlab平台上编程实现,形成一套完整的“抽样—生成—缩减—验证”的不确定性建模框架,为含高比例风电的电力系统提供高质量、低冗余的输入场景集,显著增强随机优化、鲁棒优化等模型的求解效率与工程实用性。; 适合人群:具备电力系统分析、概率统计基础及Matlab编程能力,从事新能源并网、电力系统优化调度、不确定性建模与风险评估等方向的科研人员、工程技术人员及研究生。; 使用场景及目标:①应用于风电主导的电力系统随机优化调度、机会约束规划、鲁棒经济调度等场景,提升模型对不确定性的刻画能力;②帮助研究者深入掌握拉丁超立方抽样与场景缩减的核心原理与实现方法,构建高精度的不确定性输入模型;③为复杂电力系统仿真提供经过科学约简的典型场景集,平衡计算精度与效率,支撑实际工程决策。; 阅读建议:建议读者结合提供的Matlab代码逐模块调试与运行,重点理解LHS在多维空间中的分层抽样机制、场景距离度量方式及聚类缩减过程中的概率守恒原则,关注缩减前后场景集的分布保真性与计算效率提升效果,以全面掌握风电不确定性建模的关键技术路径。
已经博主授权,源码转载自 https://pan.quark.cn/s/1c38cb6e5a26 永磁同步电机转子初始位置的辨识是永磁同步电机控制中的一个核心步骤。在电机启动阶段,必须精确地辨识转子的位置,以便于矢量控制策略能够精确地调控电机的运行状态。增量式光电编码器通常被安装在永磁电机上,用以获取转子的位置数据。在增量式编码器中确定光电脉冲计数器的基准值是辨识转子初始位置的一个关键环节。 为了辨识转子的初始位置,存在多种可行的方法。其中一种常用的技术是施加一个方向固定的电流矢量,通过电磁力的作用将电机的转子磁极驱动至一个预定位置。虽然这种技术实现起来相对简便,但在定位过程中,转子会产生较大的机械振动,这在某些特定的应用场景中并不适宜。还有一种技术是采用高频注入法,但这种方法需要额外设计滤波器以及解析位置信息的算法,因此实现起来较为复杂。此外,也有方法是根据电机的磁饱和特性来辨识转子的初始位置,但这种方法依赖于电机自身的参数配置。 本文介绍了一种新的转子初始位置辨识技术。该技术基于永磁同步电机的数学模型,采用二分法来选择试探电流矢量的角度。通过检测转子微小的运动方向,逐步缩小转子初始位置的可辨识范围,最终精确地确定转子的初始位置。实验数据表明,该技术能够快速且精确地完成转子初始位置的辨识任务。 矢量控制是一种常见的永磁同步电机控制方案,它通过转速和电流双闭环控制来实现电机的精密控制。矢量控制闭环依赖于电机转子位置信息,这些信息通常由增量式光电编码器提供。控制系统将通过光电编码器获取转速和坐标变换的角度数据,进而调整输出的电压和电流,以实现对电机转速和转矩的精确调控。 在矢量控制原理图中,转速反馈信号会与转速设定值进行比较,其差值经过转速PI调节器生成q轴电流的设定值。d...
下载代码方式:https://pan.quark.cn/s/a4b39357ea24 全国计算机等级考试二级教程《Python语言程序设计》(2018年版)被视为针对Python入门者和备考人员的核心学习材料。该资料汇总了教材内的所有编程练习答案,这些答案在Python 3.5.3环境中经过实际执行测试,从而保障了代码的准确性和应用价值。备考人员借助这些答案,能够评估自身的学习进度,并深入理解和熟练掌握Python编程的基础原理与方法。 1. Python基础理论:Python作为一门高级编程语言,因其简明扼要的语法结构和卓越的功能表现而备受推崇。基础内容涵盖了变量、数据种类(例如整型、浮点型、字符串、布尔型、列表、元组、字典、集合)、逻辑控制(比如条件判断if-else,循环控制for、while)、函数的声明及使用、模块的引入等。 2. Python高级应用:Python的进阶内容涉及异常管理(try-except-finally结构),类与实例(面向对象编程的基础,包含类的构造、对象的生成、属性与方法的运用、继承机制、多态表现),装饰器(用于调整函数或类的功能特性),上下文管理器(借助with语句实现资源管理)等。 3. 数据文件处理:Python配备了全面的文件操作功能,涉及文件的开启、数据读写、关闭操作,以及多种操作模式(例如r模式用于读取,w模式用于写入,a模式用于追加内容等)。此外,还包括文本文件与二进制文件的转换处理,以及文件的位置调整、复制和删除等操作。 4. 标准库的运用:Python的标准库资源极为丰富,比如os模块提供操作系统接口,sys模块用于获取系统参数,random模块可用于生成随机数值,datetime模块负责处...
代码下载地址: https://pan.quark.cn/s/191d569c07f9 电动汽车充电设施计费控制单元与充电控制器之间的通信协议是保障双方高效沟通的基础。协议V1.10版本自2017年6月14日开始执行,明确了通信的各个要素,涵盖物理层、数据链路层、交互步骤、报文类型及格式等细节。这些要素的清晰界定为充电控制器和计费控制单元之间的通讯开发与实施提供了技术依据。 在物理层方面,协议指出计费控制单元与充电控制器之间应采用CAN总线通信技术进行数据交换。CAN(Controller Area Network)总线是一种能够有效支持分布式控制和实时控制的串行通信网络。该技术在电子控制领域具有广泛应用,特别是在电动汽车充电设施的通信中,有助于确保数据传输的准确性与实时性。 数据链路层是协议的重要组成部分,其中涉及地址的指定、协议数据单元(PDU)、PDU结构、参数组编号(PGN)以及传输协议功能。地址的指定确保每个设备在通信网络中拥有唯一的标识。PDU是数据链路层传输的基本单元,它包含了源地址、目的地址、控制信息以及数据内容。PDU结构进一步规定了这些信息在PDU中的组织方式。PGN用于识别信息类别,以便接收方根据类别对数据进行相应的处理。传输协议功能则包含了数据的发送、接收、确认等机制。 计费控制单元与充电控制器之间的交互步骤主要包括主交互步骤和充电控制交互步骤。主交互步骤定义了计费单元和控制器之间的基本通信流程,而充电控制交互步骤则专注于充电过程中的具体控制指令和响应,例如启动充电、停止充电、心跳交互等。 报文分类对于理解通信协议具有重要作用。报文可以分为多种类型,包括指令帧、状态帧、数据帧、心跳帧、错误帧等。指令帧负责发送控制指令,状态帧用于报告当前状...
内容概要:本文研究基于蜣螂优化算法(DBO)的无线传感器网络(WSN)覆盖优化问题,旨在通过智能优化算法提升WSN的覆盖率与网络性能。文章系统阐述了无线传感器网络的基本架构及其在节点覆盖、能耗均衡和生命周期延长方面面临的挑战,重点介绍了蜣螂优化算法的生物启发原理、数学模型及其在高维复杂搜索空间中的全局寻优能力。通过构建WSN节点部署优化模型,将覆盖率为优化目标,结合Matlab编程实现算法仿真,并在多种监测区域场景下进行实验验证。结果表明,相较于传统遗传算法、粒子群优化等方法,DBO算法在提升网络初始覆盖率、改善覆盖盲区、均衡节点能耗以及延长网络整体生命周期方面展现出更强的优化性能和鲁棒性。; 适合人群:具备一定Matlab编程基础,从事智能优化算法、无线传感器网络、物联网系统设计及相关领域研究的科研人员、工程技术人员及高校研究生。; 使用场景及目标:①解决无线传感器网络中的节点部署与空间覆盖优化问题;②学习蜣螂优化算法的核心机制及其在工程优化问题中的建模与实现方法;③复现相关学术研究成果,支撑科研论文撰写与算法性能对比分析;④拓展该算法至路径规划、资源调度、设施布局等其他组合优化问题。; 阅读建议:建议读者结合所提供的Matlab代码深入理解算法实现细节,重点关注种群初始化、位置更新策略、收敛判断等关键模块的设计,同时可通过调整网络规模、传感半径、迭代次数等参数观察其对优化效果的影响,进一步掌握智能算法在实际问题中的调参与应用技巧。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

白拾ShiroX

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值