事前学習により、モデルは大規模データから汎用的な言語理解を獲得し、その後少量のデータでファインチューニングするだけで個別タスクに適応できるようになります。BERTはこの手法で11のNLPタスクにおいて当時の最高性能を達成しました。
汎用的な言語理解の獲得とタスク適応の効率化という効果
タスクごとにモデルをゼロから学習する必要がなくなる点が特徴