摘要
本文解读 ICLR 2025 SynthData Workshop 论文《Empowering LLMs in Decision Games through Algorithmic Data Synthesis》(MasterMind)。该论文提出用算法数据合成为 LLM 生成决策游戏训练语料,融合斗地主(不完全信息)与围棋(复杂多步搜索)两大经典游戏,通过三阶段/四任务课程式后训练让语言模型掌握游戏并提升泛化推理。其特别之处在于把"推理过程"而非"状态-动作对"写进训练数据,并引入对手策略预测头应对不完全信息。实验表明 Mastermind-Dou 动作准确率 90%、对 DouZero 专家胜率 41%,Mastermind-Go 下一状态预测精度 99.44%,且 BIG-Bench Hard 长序列推理任务显著提升,为 LLM 数据合成策略提供了新思路。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Empowering LLMs in Decision Games through Algorithmic Data Synthesis |
| 标题(中文) | 用算法合成数据赋能 LLM 的决策游戏能力 |
| 作者 | Haolin Wang, Xueyan Li, Yazhe Niu, Shuai Hu, Hongsheng Li |
| 机构 | 上海人工智能实验室(OpenDILab)· 北京航空航天大学 · 香港中文大学 · 新西伯利亚国立大学 |
| 会议 | ICLR 2025 SynthData Workshop |
| arXiv | arXiv:2503.13980 |
| 项目网站 | OpenDILabCommunity/MasterMind(数据集) |
背景与动机
为什么 LLM 需要新的推理训练数据?
- 现状局限:LLM 在代码、数学任务上已表现出较强的推理能力,但面对现实世界的复杂决策仍力不从心——逻辑推理整体不足,缺乏对任务的深度整体理解。
- 代码与数学数据的短板:结构明确但缺乏不确定性与自然语言多样性;决策游戏数据则天然包含不完全信息、随机性与分阶段推理结构,更接近真实世界。
- 现有工作的空白:如 ChessGPT 只在单一棋类上做策略-语言桥接;而开源智能体 DouZero(斗地主)、KataGo(围棋)与 LightZero 平台已经证明可以自动生成海量高质量对局数据。
- 核心观察:决策游戏的推理过程可分阶段拆解(模拟人类逐步推理),且数据可以由智能体自动合成——这让游戏成为代码、数学之外的第三条推理语料路线。
研究主线:从问题到结论

图 9:MasterMind 研究主线:问题→动机→课程设计→结果(Mermaid 流程图)
基准/方法设计
MasterMind 双 agent 架构
- MasterMind-Dou(斗地主):三阶段推理流水线——① 可行动作预测:基于历史记录与手牌预测 Top-p 候选动作;② 对手策略预测:额外的神经网络头预测对手下一动作,像 in-context learning 一样输入对手样本;③ 最终动作选择:拼接前两步分析生成最终决策。
- MasterMind-Go(围棋):四任务课程——① 规则层:预测下一状态 $s,a\to s'$;② 状态评估层:用 KataGo 生成领地/点差/胜率分析;③ 自然语言理解层:从棋书提取局面解释;④ 决策层:综合全部信息做最终决策。
- 防过拟合设计:动态候选动作(DouZero Q 网络 Top-p 概率和 25% 过滤,压缩超过 27000 的合法动作空间)+ 思想链(CoT)训练,让模型关注推理过程而非死记规则。
图 1:通过合成数据精炼 LLM:从斗地主与围棋到更强大的智能体(论文 Fig. 1)
分类全景

图 10:MasterMind 双域数据/任务分解全景(Mermaid 流程图)
方法细节
数据合成与训练要点
- 文本化:斗地主卡牌编码为整数(3=3…A=14、2=17、小王=20、大王=30),候选动作离散化;围棋 19×19 棋盘用符号"o"(白)、"#"(黑)、"•"(空)一维序列化,行列标号 A1–T19。
- 对手建模:规则型、监督学习型、DouZero 三类 agent 生成多样对手数据,按水平标注,保证模型能泛化到新对手。
- 训练损失:标准 SFT 最大似然 $L_\theta=\frac{1}{N}\sum_{i=1}^{N}\log P_\theta(Y_i|X_i)$;LLaMA-2-7B + LoRA(r=32,α=64),8×A100,3000 步预热。
- Count 函数:生成阶段程序化计算围棋领地与点差,弥补 LLM 数领地弱点,稳定胜率预测。
- 数据规模:六个数据集合计约 1.5T tokens(Dou-prob 171 万样本、Go-next-state 15 万样本、Go-analysis 13.9 万样本等)。
图 2:LLM 先预测合法动作、再分析对手响应、最后确定最优决策(论文 Fig. 2)
图 3:四个渐进任务生成多样的棋局分析,再转化为文本数据微调 LLM(论文 Fig. 3)
实验设计与结果
评测协议
LLaMA-2-7B 主干,8×A100 训练;斗地主对局每轮重复 100 次、模型固定地主位、农民由开源 agent 扮演;基线包括 0-shot、few-shot、few-shot+similarity、无概率思想链(w/o prob)变体。
Doudizhu 主表(与专家数据对齐)
| 模型 | Act. Acc. ↑ | CoT RL ↑ | Pred. Acc. ↑ |
|---|---|---|---|
| LLaMA-2-7B (0-shot) | 0% | 0.52 | 0% |
| LLaMA-2-7B (few-shot) | 21.18% | N/A | N/A |
| few-shot + similarity | 42.65% | N/A | N/A |
| Mastermind-Dou w/o prob | 78% | N/A | N/A |
| Mastermind-Dou with prob | 90% | 0.98 | 39% |
对局胜率(地主位,100 轮)
| 模型 | v.s. RLCard ↑ | v.s. DouZero ↑ |
|---|---|---|
| LLaMA-2-7B | 0% | 0% |
| LLaMA-2-7B (few-shot) | 12% | 3% |
| Mastermind-Dou w/o prob | 78% | 33% |
| Mastermind-Dou with prob | 90% | 41% |
| DouZero (Expert) | 90% | 43% |
Go 代理任务(误差越低越好)
| 模型 | s' Acc. ↑ | Score MAE ↓ | Winrate MAE ↓ | expl. RL ↑ | expl. ppl. ↓ |
|---|---|---|---|---|---|
| LLaMA-2-7B | 0% | N/A | N/A | 0.28 | 11.45 |
| Single-task | 99.44% | 1.80 | 5.14 | 0.44 | 5.23 |
| Multi-task | 96.08% | 1.74 | 4.49 | 0.43 | 3.64 |
泛化与规模效应
- BBH 泛化:TempSeq 12%→20.4%、Nav 53.6%→60%、Hyper. 51.6%→62.8%(Mastermind-Dou);但 Date 60.4%→22.8% 等短程任务下降(灾难性遗忘)。
- 跨模型验证:Gemma-2B-Mastermind 76.69% vs Gemma-7B-Mastermind 86.27% Act. Acc.——收益随模型规模增大而更明显。
图 4:Mastermind(地主)v.s. DouZero(农民):更主动的出牌策略带来胜利(论文附录 Fig. 9)
图 5:DouZero(地主)v.s. DouZero(农民):农民获胜(论文附录 Fig. 8)
图 6:围棋 $s,a\to s'$ 数据示例,难度从左到右递增(论文附录 Fig. 10)
图 7:围棋领地估计与胜率预测示例(论文附录 Fig. 11)
图 8:下棋时的步骤式推理:棋盘状态→领地归属→点差与胜率→局面评述(论文附录 Fig. 6)
结果对比总结

图 11:斗地主结果对比总结:从 0% 到 90% 与对局胜率(Mermaid 流程图)
关键发现
关键发现
- 斗地主从 0 到 90%:训练前 0-shot 动作准确率 0%,Mastermind-Dou 完整版达 90%,对 RLCard 胜率 90%、对 DouZero 胜率 41%(DouZero 自身 43%)。
- 推理过程可学:CoT RL 相似度 0.98;消融去掉概率思想链后准确率从 90% 降至 78%——思想链是泛化关键。
- 围棋规则理解近乎完美:下一状态预测 99.44%,胜率 MAE ≤5%,解释 Rouge-L 0.44(基线 0.28)。
- 非模仿证据:部分局面 Mastermind 用与 DouZero 不同的策略取胜,说明学到的是高层策略而非行为克隆。
- 长序列推理迁移:BBH 的 TempSeq 从 12% 提升到 20.4%、Navigation 从 53.6% 到 60%。
- 规模正相关:Gemma-7B(86.27%)比 Gemma-2B(76.69%)收益更明显。
局限性
局限性
- 围棋未做完整对局评测:SFT 学围棋成本高,只用代理任务(状态预测/评估/解释)验证。
- 灾难性遗忘:BBH 日期任务 60.4%→22.8%、几何任务 19.2%→7.6%——后训练未覆盖的技能被弱化。
- 数据依赖专家智能体:需要 DouZero/KataGo 级别 agent 合成数据,跨游戏泛化未验证。
- 仅文本模态:二维棋盘压成一维序列,未利用视觉信息。
- 作者展望:把决策游戏数据引入预训练阶段,可能全面提升推理能力。
常见问题(FAQ)
常见问题(FAQ)
MasterMind 是什么?
MasterMind 是上海人工智能实验室 OpenDILab 团队提出的 LLM 决策游戏后训练方案,包含 MasterMind-Dou(斗地主)与 MasterMind-Go(围棋)两个 agent,核心是用算法合成游戏数据微调 LLM。
为什么选择斗地主和围棋?
斗地主考验不完全信息下的决策(看不见对手手牌),围棋考验复杂多步搜索与空间推理(19×19 棋盘、一维序列建模)——分别对应现实决策中不确定性与长程规划两大难点。
对手策略预测头有什么用?
斗地主的优化策略高度依赖对手策略。额外的预测头让模型学会"读牌":预测对手下一动作,并在推理时输入当前对手样本(类似 in-context learning),把不完全信息转化为可推理的输入。
训练数据从哪里来?
数据由开源智能体自动合成:斗地主来自规则型/SL/DouZero agent 的自对弈,围棋来自 KataGo 自对弈记录与围棋书籍,共六个数据集约 1.5T tokens,无需人工标注。
游戏后训练真的提升通用推理吗?
是。BBH 长序列任务显著提升(TempSeq 12%→20.4%、Nav 53.6%→60%),但日期/几何类短程任务下降,说明收益集中在长序列建模与不确定推理,且存在灾难性遗忘风险。
数据集在哪里可以获取?
数据集已开源在 HuggingFace:OpenDILabCommunity/MasterMind(https://huggingface.co/datasets/OpenDILabCommunity/MasterMind)。
参考链接
参考链接
- arXiv 摘要页:arXiv:2503.13980
- 数据集(HuggingFace):OpenDILabCommunity/MasterMind
- DouZero(斗地主专家,ICML 2021):arXiv:2106.06135
- LightZero(MCTS 通用基准,NeurIPS 2023 D&B):arXiv:2310.08348
- KataGo(围棋引擎):github.com/lightvector/KataGo
- ChessGPT(策略学习与语言建模桥接,NeurIPS 2024):arXiv:2306.09200
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)


被折叠的 条评论
为什么被折叠?



