深度学习之Google Deepmind的alphago人工智能算法技术演变历程

围棋智能机器人阿法狗,阿尔法狗机器人围棋 阿尔法狗(AlphaGo)是第一个击败人类职业围棋选手、第一个战胜围棋世界冠军的人工智能程序,由谷歌(Google)公司的团队开发。其主要工作原理是“深度学习”。人工智能围棋项目:小发猫 2017年5月,在中国乌镇围棋峰会上,它与排名世界第一的世界围棋冠军柯洁对战,以3比0的总比分获胜。围棋界公认阿尔法围棋的棋力已经超过人类职业围棋顶尖水平。起源围棋,起源于中国,中国古代称为“弈”,可以说是棋类之鼻祖,围棋至今已有4000多年的历史。据先秦典籍《世本》记载:“尧造围棋,丹朱善之。”晋张华在《博物志》中继承并 阅读详情

  摘要

  强化学习的典型应用。

  

32b10185549cc9a4c77a7a7c436c658ee13bc2ec

 

  一、简介

  有些人会有如下质疑“alphago都用了蒙特卡洛搜索树了,这变成了一部分搜索问题了并不是人工智能算法了或者说不够智能了”,但我的拙见是人在思考问题的时候除了直觉、经验判断、逻辑推理之外也会去枚举、搜索,所以我觉得算法包含一部分搜索并不能直接说该算法这不够智能或者这不是智能算法了,我觉得更多的是要考虑该算法在该类问题上如何去刻画出人类的直觉、经验判断、逻辑推理等。

  最近大家比较关心的围棋人机大战(alphago vs 李世石)中,deep mind基于Nature2016文章的alphago在5局制的比赛中已经取得了4-1的获胜。2016年google与facebook两个大拿在围棋领域基于深度学习都发表了文章,其中facebook文章如下:《BETTER COMPUTER GO PLAYER WITH NEURAL NET- WORKAND LONG-TERM PREDICTION》;Google文章如下:《Mastering the game of Go with deep neural networks and tree search》。这两篇文章都是蒙特卡洛搜索树+DCNN,效果google的alphago优于facebook的方法,刚好借此机会将之前看到的deep mind该领域的文章捋了一下。

  google在alphago之前就已经发表了相当多这方面的demo与文章,从其最早的NIPS2013文章《Playing Atari with Deep ReinforcementLearning》到现在的Nature2016 《Mastering the game of Go with Deep Neural Networks & Tree Search》。deep mind在此期间做了很多扎实的研究工作,本文将进行简单的描述。本文接下去会按如下几点内容进行叙述:

  1.Q-learning

  2. Reinforcement learning

  3. deep Q-Networks

  4. alphago

  二、Q-learning与Reinforcement learning

  增强学习Reinforcement learning的场景大部分有一个共同的特点,那就是这些场景有序列决策或者控制的问题,对于当前的任何一个state不能明确的对不同的action给出一个事先well defined的score值。它大多应用于如下的领域:机器人控制,市场决策,工业控制等。

  Q-learning是用于解决Reinforcement learning问题的一种常见方法,其经典的公式如下:

  

97b85a16aed19c067cdd0fe9558aa5a6e89346f3

 

  三、deep Q-Networks(DQN)

  2013发表NIPS文章《Playing Atari with Deep ReinforcementLearning》是deep mind公开的最早使用raw pixels作为输入的,用于解决reinforcement learning的深度学习网络DQN。在该文章中,作者在atari一系列的游戏上做了各种算法的比较,如下图所示:

  

5ffb521cf066113d62988971533e9bb90ef403b4

 

  在总共7个游戏中,有6个做到了算法中最好,其中还有3个做到了比人类专家还要好。该文章中提到的DQN有两个特点:1. 用来更新参数的minibatch是是从replay memory(回放记忆)中采样出来的,而不是仅仅的用当前一个片段或者session,这样能使得模型收敛性更好,否则会很容易训飞。2. value函数是一个多层网络。

  在上述文章提出后,deep mind在该问题上不停的打磨,不断的优化其工程与算法:

  1. 2015发表ICML文章《MassivelyParallel Methods for Deep Reinforcement Learning》,该文章从工程上了做了4个方面的分布式:学习、决策、价值、经验,第1个属于学习,第2、3个属于网络方面,第4个偏存储方面。DQN的全面分布式将DQN的学习时间成本与模型效果都提升了一个档次。DQN分布式结构简要如下:

  

e8bee422b157c0ed1069d66d73d6ccbe28296f26

 

  2. 2016发表ICLR文章《PRIORITIZEDEXPERIENCE REPLAY》,该文章指出了原DQN中经验均匀采样的问题,并从防过拟合、防局部最优这些点上,设计了介于均匀采样与纯优先级贪心之间的经验采样方法,提出的这个改进再次将DQN的模型效果提升了一个档次。

  3. 2016发表ICLR文章《PolicyDistillation》,该篇文章实际上是做了DQN的transfer learning的实验,有很多思想与hinton的dark knowledge里面的东西都很相似,其方法示意图如下所示:

  

4f198d8f4c2dfea83e2e3092751c7b24d3f6772d

 

  四、alphago

  训练阶段:

  alphago训练如下图a中展示了alphago相应的4个neural network,b中主要展示了policy network与value network及其输出形式。

  

f09c0418070d09bb2e9895a25dc9db2fbe03f168

 

  1. policy network(14层,输出棋盘每步move概率值),它首先采用supervisedlearning训练方法在KGS数据集上达到了55.7%的专家moves预测准确率,然后由reinforcement learning训练方法进行自我训练(每一次训练都在前几次迭代完的模型中随机一个模型做决策),自我训练的policy network在80%的情况下打败了supervised learning训练出来的policy network。

  2. value network(15层,预测棋盘下一步move),该网络由pair训练数据做regressionloss反馈更新得到。在KGS的数据集上,该训练方法出现了过拟合的现象(训练MSE0.19,测试MSE0.37),但若在reinforcement learning学出来的policy network基础上产生出的自我训练集里进行采样学习的话,就可以有效的避免该问题(训练MSE0.226,测试MSE0.234)。

  预测阶段:

  在alphago系统模拟的时候,每一个action由如下三个因素决定:s状态下a的访问次数,RL policy network for action value,SL policy networkfor prior probability;在alphago系统模拟的时候,每一个叶子节点价值由如下两个因素决定:value network,rollout network;在alphago系统所有模拟都结束后,由上述两点计算得到s状态下a的value值。综上RL与SL学习出来的两个policy network共同决定了蒙特卡洛搜索树节点的选择,value network与rollout network决定了模拟出来的叶子节点的价值,最终s状态下a的value由上述两部分以及所有模拟中s状态下a的访问次数共同影响得到。最后alphago系统选择s状态下最优的action作为围棋当前的move。

  本文作者:阿里-记忆

解密Google Deepmind AlphaGo围棋算法:真人工智能来自于哪里? 2016年1月28日,Google Deepmind在Nature上发文宣布其人工智能围棋系统AlphaGo历史性的战胜人类的职业围棋选手!这条重磅新闻无疑引起了围棋界和人工智能界的广泛关注!3月份AlphaGo对阵李世石的比赛更将引起全人类的目光! 是什么使围棋算法产生了质的飞跃?要知道,在之前最好的围棋程序也只能达到业余人类棋手的水平。是真的人工智能产生了吗?对于大多数人来说,大家都知道1997 阅读详情

相关推荐

人工智能发展历程与未来趋势分析

人工智能作为计算机科学的重要分支,经历了从逻辑推理到深度学习的演进过程。其核心技术原理是通过算法模拟人类智能行为,在机器学习特别是深度学习取得突破后,AI在图像识别、自然语言处理等领域展现出强大技术价值。当前AI应用已渗透到医疗诊断、金融科技、智能制造等多个场景,其中计算机视觉和语音识别成为行业热点。随着Transformer等新架构的出现,AI正朝着多模态、强泛化方向发展。中国在AI应用层快速突破的同时,也面临芯片和基础算法的挑战。未来AI将与生物、材料等学科深度交叉,而伦理治理和全球竞争格局将成为关键议

weixin_30701575的博客 453

如何理解AlphaGo Zero背后涉及到的技术

详细讲解AlphaGo Zero背后涉及到的知识点,以及论文流程讲解分析。

深度学习资源大集合

很好的资源,Deep Reinforcement Learning深度强化学习_论文大集合

Alphago进化史 漫画告诉你Zero为什么这么牛

 Alphago家族又添新成员  来源:环球科学ScientificAmerican公众号  策划 | 吴非    绘制 | 铁蛋公主  专家评Alphago Zero 成绩令人欣喜但AI还在路上  Alphago进步速度示意图  作者:葛熔金  在金庸的小说《射雕英雄传》里,周伯通“左手画圆,右手画方”,左手攻击右手,右手及时反搏,自娱自乐,终无敌于天下。  现实世界中,亦有这么一个“幼童”,他...

kebu12345678的博客 5650

AlphaGo之父DeepMind再出神作,PrediNet原理详解

最近DeepMind发表论文,称受Marta Garnelo和 Murray Shanahan的论文“Reconciling deep learning with symbolic artificial intelligence: representing objects and relations”启发,他们提出了一种新的架构,可将目前人工智能的两大流派符号派和神经网络派相结合,...

Python爱好者的专栏 3687

深度学习google deepmindalphago AI人工智能算法技术演变历程

最近大家比较关心的围棋人机大战(google alphago深度学习+蒙特卡洛搜索算法 vs 李世石)中,google deepmind基于Nature2016文章的alphago算法在5局制的比赛中已经取得了3-1的成绩提前锁定了胜局。本文扒了一下google deepmind在该领域的一些文章,揭示了google alphago算法技术演变历程

孙佰贵的专栏 1万+

入门篇--知名企业-3-Google DeepMind:从AlphaGo到AGI,AI如何改写人类未来?

他们证明了长期主义的力量。

weisian的博客 3万+

Google DeepMind成果看人工智能发展

Google Deep Mind成果看人工智能发展 (四川大学 电子信息学院) 摘要:近几年,人工智能非常火热,几乎渗透到了社会的方方面面,但是人们只是看到了它光鲜的外表,殊不知它也曾经历了漫长的寒冬,未来之路任重而道远,生死存亡未可知。本文从谷歌公司旗下的Deep Mind公司成果出发,简要探讨它们背后的原理以及人工智能的发展历程。 关键词:人工智能,机器学习,深度学习,强化学习 引言: 从未有过如此复杂的情绪,起初信心满满,然后如临深渊,再而震惊,再而怀疑,直至绝望。这是人类与机器的智慧比拼,这一次人

qq_35096008的博客 1127

AI技术演进:从深度学习到生成式人工智能

人工智能(AI)作为计算机科学的重要分支,经历了从符号推理到深度学习的革命性转变。其核心技术原理基于神经网络架构,通过多层次的特征提取和模式识别实现智能决策。在工程实践中,GPU/TPU等专用硬件和分布式训练技术大幅提升了模型训练效率,使AI在计算机视觉、自然语言处理等领域取得突破性进展。特别是Transformer架构的出现,推动了生成式AI(如GPT系列)的快速发展,这些大模型通过海量参数和注意力机制实现了接近人类的文本生成能力。当前AI技术已广泛应用于工业质检、智能客服等场景,同时面临计算成本优化、模

weixin_34327223的博客 323

DeepMind重组对Gemini API与开发者生态的影响分析

人工智能领域,大语言模型(LLM)和生成式AI正推动着技术范式的变革。其核心原理是基于海量数据训练出的Transformer架构,通过自注意力机制理解和生成人类语言。这类技术的价值在于能够自动化处理复杂任务,如代码生成、多模态内容理解和逻辑推理,从而显著提升开发效率。在实际应用场景中,开发者通过API调用将这些能力集成到各类应用中。近期,Google DeepMind的组织架构调整,特别是其核心产品Gemini系列模型背后的战略转向,正是这种技术从实验室研究向大规模工程化、产品化演进的关键体现。此次重组预

weixin_33826609的博客 534

AI学习之路(4): TensorFlow是什么

在我们探索TensorFlow之前,先来聊一下金庸的小说,在它的小说《笑傲江湖》里,剑宗和气宗是华山派的两个派别,也就是说剑宗和气宗同属于华山派,剑宗认为在武学之中剑术最重要,而气宗则认为在武学之中气功最重要,在华山派的历史上这两派一直是争论不休,互相指责对方是邪说,而那种认为剑术和气功同样重要的说法更是同时被两派指责为邪说。同样,在AI领域,也一直分为两派,一派认为全部数据处理计算太复杂,不能使

大坡3D软件开发 3991

Master带给世界的思考:是“失控”还是进化

Master在2017年年初以狂胜60局的表现震惊了围棋界,最后DeepMind官方确认,在围棋网站上通过60场比赛横扫中日韩围棋高手的围棋程序 “Master”,同样出自 DeepMind ——这是在AlphaGo 的基础上,DeepMind 半年来在人工智能方面的重要进展。DeepMind 官方发布的总结中写道,“最激动人心的莫过于 AlphaGo 博弈过程中所呈现出来的创造力,有时,它的棋招...

weixin_33709219的博客 131

Python深度学习:从入门到实战

亲爱的读者,欢迎您翻开这本书。我们即将探索的,是深度学习的宇宙——一个由数据、算法与算力构筑的奇妙世界。它既是严谨的科学,也是创造的艺术,更是一条通往未来智慧的修行之路。本书将带您从最基础的数学原理出发,亲手搭建神经网络,驾驭Transformer等前沿模型,最终将智慧转化为现实世界的价值。请放下畏惧,保持好奇。这不仅是一次知识的学习,更是一场思维的远行。来,随我一起,开启这趟非凡的旅程吧。

weixin_45747731的博客 184
上一篇: 卷积神经网络(CNN)在句子建模上的应用
下一篇: On the Personalities of Dead Authors
MemRay
博客等级 码龄17年 447粉丝 28原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值