PyTorch公式ドキュメント(torch.nn.functional.scaled_dot_product_attention)によれば、FlashAttention(FlashAttention-2を含む)はPyTorchのscaled_dot_product_attention関数が自動的に選択するバックエンド実装の一つとして標準搭載されています。CUDA環境ではデフォルトで全ての実装(FlashAttention、メモリ効率的Attention、数学的実装)が有効化されており、入力条件に応じて最適な実装が自動選択されます。開発者はtorch.backends.cuda.enable_flash_sdp()関数やtorch.nn.attention.sdpa_kernel()コンテキストマネージャーを使ってバックエンドを明示的に制御することも可能です。