Google DeepMindが開発したAlphaGo Zeroは、強化学習の代表的な応用例のひとつです。従来のAlphaGoが人間のプロ棋士による対局データを学習の出発点としていたのに対し、AlphaGo Zeroは囲碁のルール以外の知識を一切持たない状態から、ニューラルネットワークと探索アルゴリズムを組み合わせた自己対戦のみで学習を行いました。DeepMind公式ブログ(2017年10月18日公開、学術誌Natureに掲載された研究に基づく)によると、AlphaGo Zeroはわずか3日間の自己対戦学習で従来のAlphaGoに100対0で圧勝し、40日間の学習後にはEloレーティングが5000を超え、それ以前の全バージョンを上回りました。これは強化学習が人間の知識やラベル付きデータに頼らずとも、自己対戦という手法だけで高度な戦略的意思決定能力を獲得できることを示した象徴的な事例として、AI研究において広く引用されています。