案例库 · 研发与科研 · 技术决策 · 2016–2017
AlphaGo Zero从零棋谱开始,自学成才,围棋水平超越人类冠军
DeepMind的AlphaGo Zero通过自我对弈,不借助任何人类数据或领域知识,以100比0击败了曾战胜世界冠军的AlphaGo。
Google DeepMind
那一手
AlphaGo已经击败过围棋世界冠军,但它依赖人类棋谱数据库和手工设计的领域特征。这些借来的知识给程序的能力设了上限,而且获取更好的棋谱既慢又贵。
AlphaGo Zero团队完全去掉了人类数据。网络除了棋盘规则外一无所知;它和自己对弈,网络学习预测自己会下哪一步以及谁会赢。这预测改进了搜索,更强的搜索带来了更强的自我对弈。
游戏之外的因素一律不掺和。系统自己定课程、自己当考官,一轮又一轮地积累实力,过程中从未见过任何专家走法。
从这张白纸出发,它击败了原版、击败了世界冠军的AlphaGo,比分是100比0——这证明了干净、自生的训练循环比借用数据更值钱。
为什么管用
- 自我对弈能产出无限多、且难度恰好匹配当前实力的棋局,所以课程永远不嫌太难或太简单。
- 去掉人类棋谱,就滤掉了噪音和人类水平的限制,让智能体能超越写训练数据的人类水平。
- 网络的每一次改进都让搜索更好,更好的搜索生成更强大的对手,进步在正循环里不断叠加。
- 因为奖励就是赢棋,信号干净又自动,根本不需要标注。
值了多少让智能体自己做自己的老师神来之笔
可以搬走什么
最好的训练信号往往是你能随时生成的——如果你定得出规则,自我对弈就能免费给你无限多、且分布一致的数据。
后来呢
同样自我对弈的想法推广应用到了其他棋类,现在成了现代强化学习的基础组件,为智能体在缺乏优秀专家数据的领域战胜人类打开了大门。DeepMind后来还把白板学习用到国际象棋、将棋等游戏里,“从自己的落子中学习”的循环成了这个领域的标配。
资料来源
发现哪里写错了?告诉我们。