強化学習(Reinforcement Learning)

Concept

AI基礎概念

最終更新: 2026-07-10

6 References

https://www.refbase.ai/entity/reinforcement-learning

Knowledge Dossier

公開済みEvidenceをIdentity / Capability / Credibility / Use Case / Constraints・Current Statusの軸で機械的に集約したものです(新規の主張・推測は含みません)。

Identity

Capability

  • 強化学習は、エージェントが環境と相互作用し、報酬を最大化するように試行錯誤を通じて方策を学ぶ機械学習の枠組みである。検証待ち Reinforcement Learning: An Introduction(Sutton & Barto)
  • 強化学習は、正解ラベルから学ぶ教師あり学習と異なり、行動の結果として得られる報酬を手がかりに学習する点が特徴である。検証待ち 同上(Sutton & Barto)
  • Google DeepMind公式ブログ。囲碁AI「AlphaGo Zero」は人間の対局データを使わず自己対戦のみで学習し、ニューラルネットワークと探索アルゴリズムを組み合わせ対局のたびに精度を向上させるサイクルを構築。3日間の学習で従来版AlphaGoに100勝0敗、40日間の学習で世界トップ棋士に勝利した「Master」版も上回った。Nature誌掲載論文(Silver et al., 2017)に基づく。検証待ち AlphaGo Zero: Starting from scratch

Credibility

公開Evidence未整備

Use Case

  • Google DeepMindが開発したAlphaGo Zeroは、人間の対局データを一切用いず、囲碁のルールのみを与えられた状態からニューラルネットワークと探索アルゴリズムの自己対戦のみで学習した強化学習システム。DeepMind公式ブログ(2017年10月18日、学術誌Natureに掲載された研究の紹介)によれば、3日間の自己対戦で従来のAlphaGoに100対0で勝利し、40日後にはEloレーティングが5000を超えてそれ以前の全バージョンを上回った。人間の知識に依存しない自己対戦学習によって高度な戦略的能力を獲得できることを示した強化学習の画期的な実例。検証待ち AlphaGo Zero:自己対戦のみで学習した強化学習システム(DeepMind公式ブログ)
  • OpenAIの論文(arXiv:2203.02155)は、教師あり学習後にRLHFで調整した13億パラメータのInstructGPTが、100倍以上大きい1750億パラメータのGPT-3より人間評価者に好まれたと報告した。検証待ち Training language models to follow instructions with human feedback

Constraints / Current Status

  • 強化学習は、正解ラベルから学ぶ教師あり学習と異なり、行動の結果として得られる報酬を手がかりに学習する点が特徴である。検証待ち 同上(Sutton & Barto)

Key References

Knowledge Graph

References — 問い別の知識

データアクセス

各APIエンドポイントはJSON形式でデータを返します。生成AIのツール呼び出し・RAG連携での利用を想定しています。