Pretraining

Concept

事前学習

最終更新: 2026-07-20

5 References

https://www.refbase.ai/entity/pretraining

Knowledge Dossier

公開済みEvidenceをIdentity / Capability / Credibility / Use Case / Constraints・Current Statusの軸で機械的に集約したものです(新規の主張・推測は含みません)。

Identity

  • Hugging Faceの公式ドキュメントによれば、事前学習済みモデル(pre-trained model)は大規模データセットで学習された汎用モデルであり、BERT・GPT・RoBERTaのような言語モデルは大規模テキストコーパス上で自然言語のトークンを予測するよう学習される。検証待ち Fine-tuning · Hugging Face

Capability

  • Hugging Faceの公式ドキュメントによれば、事前学習済みモデル(pre-trained model)は大規模データセットで学習された汎用モデルであり、BERT・GPT・RoBERTaのような言語モデルは大規模テキストコーパス上で自然言語のトークンを予測するよう学習される。検証待ち Fine-tuning · Hugging Face
  • OpenAIの論文「Language Models are Few-Shot Learners」(arXiv:2005.14165, 2020)は、175Bパラメータを持つGPT-3が勾配更新やファインチューニングを一切行わず、テキストによる少数の例示のみで多様なタスクに高い性能を発揮することを示し、事前学習の規模拡大がタスクに依存しない少数ショット性能を大きく向上させると報告している。検証待ち Language Models are Few-Shot Learners

Credibility

  • DeepMindの論文「Training Compute-Optimal Large Language Models」(arXiv:2203.15556, Hoffmann et al., 2022)は、モデルサイズと学習トークン数を同じ比率で拡大すべきだと指摘し、Gopherと同じ計算量で1.4兆トークン学習させた70Bパラメータの「Chinchilla」がGopher・GPT-3・Jurassic-1・Megatron-Turing NLGを上回ったと報告している。多くの既存モデルが学習不足だったとする。検証待ち Training Compute-Optimal Large Language Models

Use Case

Constraints / Current Status

  • 同ドキュメントは、ファインチューニングは事前学習とほぼ同じ処理だが、ランダムな重みから始めない点が異なり、計算量・データ量・時間を大幅に削減できると説明する。事前学習はランダムな重みから大規模データで学習を始める段階である点で、ファインチューニングと明確に区別される。検証待ち Fine-tuning · Hugging Face

Key References

Knowledge Graph

References — 問い別の知識

データアクセス

各APIエンドポイントはJSON形式でデータを返します。生成AIのツール呼び出し・RAG連携での利用を想定しています。