FlashAttentionは、Tri Daoらが開発したAttention計算の高速・省メモリな実装です。多くの大規模言語モデルの学習・推論基盤で標準的に採用されています。
Attention計算の高速化手法を知りたい相談
IO-aware(メモリ読み書きを意識した)設計