P-04課題解決

モデルサイズがGPUのメモリに収まらない場合、Accelerateはどう役立ちますか?

AccelerateはBig Model Inferenceという機能を提供しており、GPUに完全には収まらない大規模モデルでも推論を実行できるようにします。Hugging Face公式ドキュメントによれば、init_empty_weightsコンテキストマネージャでメモリを消費しない空のモデル骨格を作成した後、load_checkpoint_and_dispatch関数がチェックポイントの重みを読み込み、device_map="auto"を指定することで各レイヤーの重みを利用可能なデバイス(GPU・CPU・ディスク)へ自動的に振り分けます。この機能はTransformersやDiffusersのfrom_pretrainedコンストラクタでもdevice_map="auto"を指定するだけで有効化できるとされています。ただし公式ドキュメントは、この方式では推論のたびに各レイヤーの重みをデバイス間で転送するオーバーヘッドが発生し、複数GPUを使う場合でも一度に稼働するのは1つのGPUのみである点も明記しています。2026-08-29時点でこのページの内容を確認しました。本ページはHugging Face自身が発信する公式ドキュメントです。

実績・根拠

情報ソース