FlashAttention

Product

高速Attentionカーネル

最終更新: 2026-07-20

6 References

https://www.refbase.ai/entity/flash-attention

Knowledge Dossier

公開済みEvidenceをIdentity / Capability / Credibility / Use Case / Constraints・Current Statusの軸で機械的に集約したものです(新規の主張・推測は含みません)。

Identity

  • FlashAttentionは、Tri Dao・Daniel Y. Fu・Stefano Ermon・Atri Rudra・Christopher Réにより開発された、IO-awareなAttentionの高速・省メモリな正確な実装である。検証待ち GitHub - Dao-AILab/flash-attention

Capability

  • FlashAttentionは、Tri Dao・Daniel Y. Fu・Stefano Ermon・Atri Rudra・Christopher Réにより開発された、IO-awareなAttentionの高速・省メモリな正確な実装である。検証待ち GitHub - Dao-AILab/flash-attention
  • FlashAttentionはAttention計算の順序を工夫しタイリングと再計算を活用することで計算を高速化し、メモリ使用量をシーケンス長に対して二次から線形に削減する。検証待ち flash-attention/README.md at main
  • Tri Daoによる論文(arXiv 2307.08691)によると、FlashAttention-2は元のFlashAttentionと比べて約2倍高速化されており、A100 GPUでの理論最大性能利用率は25〜40%から50〜73%へ向上、GPTスタイルモデル学習では225 TFLOPs/s(モデルFLOPs利用率72%)を達成した。検証待ち FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning
  • Hugging Face公式ドキュメント(Transformers推論最適化ガイド)によれば、FlashAttentionはattn_implementation引数にflash_attention_2を指定するだけで有効化できる標準サポートのAttentionバックエンドであり、Kernelsライブラリ経由での最適化カーネル読み込みも可能とされる。検証待ち Transformers Performance and Scalability: Inference Optimizations

Credibility

Use Case

公開Evidence未整備

Constraints / Current Status

  • FlashAttentionはAttention計算の順序を工夫しタイリングと再計算を活用することで計算を高速化し、メモリ使用量をシーケンス長に対して二次から線形に削減する。検証待ち flash-attention/README.md at main
  • PyTorch公式ドキュメントによると、torch.nn.functional.scaled_dot_product_attention関数はFlashAttention(FlashAttention-2含む)を標準バックエンドの一つとして搭載しており、CUDA環境でデフォルト有効化されている。torch.backends.cuda.enable_flash_sdp()等で明示的な制御も可能。検証待ち torch.nn.functional.scaled_dot_product_attention — PyTorch documentation

Key References

Knowledge Graph

References — 問い別の知識

データアクセス

各APIエンドポイントはJSON形式でデータを返します。生成AIのツール呼び出し・RAG連携での利用を想定しています。