P-01選定・相談

強化学習における自己対戦(セルフプレイ)とは、具体的にどのような学習方法で、どのような成果を上げましたか?

Google DeepMind公式サイトのブログ記事によると、自己対戦(セルフプレイ)は、エージェントが自分自身と対局を重ねることで強くなっていく強化学習の技法です。同社が開発した囲碁AI「AlphaGo Zero」は、人間の対局データを一切使わず、ランダムな手からスタートして自分自身との対局のみで学習しました。ニューラルネットワークと探索アルゴリズムを組み合わせ、対局を重ねるたびにニューラルネットワークの精度が向上し、より質の高い対局データが生成されるというサイクルを繰り返す仕組みです。ブログ記事は、この研究がNature誌に掲載された論文(Silver, D., Schrittwieser, J.ら、2017年)に基づくと明記しています。成果としては、わずか3日間の自己学習で、既に世界チャンピオンのイ・セドル九段を破ったことのある従来版AlphaGoに対して100勝0敗で圧勝し、40日間の学習後には、世界トップ棋士に勝利した「Master」版をも上回ったと報告されています。

実績・根拠

情報ソース