阿尔法狗再进化不再受人类知识限制

2017-10-19 10:35 淘股票http://gupiao.southmoney.com/ 举报

　　据大卫·席尔瓦介绍，AlphaGo Zero使用新的强化学习方法，让自己变成了老师。系统一开始甚至并不知道什么是围棋，只是从单一神经网络开始，通过神经网络强大的搜索算法，进行了自我对弈。

　　随着自我博弈的增加，神经网络逐渐调整，提升预测下一步的能力，最终赢得比赛。更为厉害的是，随着训练的深入，DeepMind团队发现，AlphaGo Zero还独立发现了游戏规则，并走出了新策略，为围棋这项古老游戏带来了新的见解。

　　自学3天，就打败了旧版AlphaGo

　　除了上述的区别之外，AlphaGo Zero还在3个方面与此前版本有明显差别。

　　AlphaGo-Zero的训练时间轴

　　首先，AlphaGo Zero仅用棋盘上的黑白子作为输入，而前代则包括了小部分人工设计的特征输入。

　　其次，AlphaGo Zero仅用了单一的神经网络。在此前的版本中，AlphaGo用到了“策略网络”来选择下一步棋的走法，以及使用“价值网络”来预测每一步棋后的赢家。而在新的版本中，这两个神经网络合二为一，从而让它能得到更高效的训练和评估。

　　第三，AlphaGo Zero并不使用快速、随机的走子方法。在此前的版本中，AlphaGo用的是快速走子方法，来预测哪个玩家会从当前的局面中赢得比赛。相反，新版本依靠地是其高质量的神经网络来评估下棋的局势。

　　AlphaGo几个版本的排名情况。

　　据哈萨比斯和席尔瓦介绍，以上这些不同帮助新版AlphaGo在系统上有了提升，而算法的改变让系统变得更强更有效。

　　经过短短3天的自我训练，AlphaGo Zero就强势打败了此前战胜李世石的旧版AlphaGo，战绩是100:0的。经过40天的自我训练，AlphaGo Zero又打败了AlphaGo Master版本。“Master”曾击败过世界顶尖的围棋选手，甚至包括世界排名第一的柯洁。

　　对于希望利用人工智能推动人类社会进步为使命的DeepMind来说，围棋并不是AlphaGo的终极奥义，他们的目标始终是要利用AlphaGo打造通用的、探索宇宙的终极工具。AlphaGo Zero的提升，让DeepMind看到了利用人工智能技术改变人类命运的突破。他们目前正积极与英国医疗机构和电力能源部门合作，提高看病效率和能源效率。

　　更多相关资讯请关注淘股票

阿尔法狗再进化不再受人类知识限制

相关阅读

最新文章

阿尔法狗再进化 不再受人类知识限制

相关阅读

最新文章

阿尔法狗再进化不再受人类知识限制