Tritonは、CUDA C++を書かずに高性能なGPUカーネルを実装したい場面で活用できます。PyTorchのtorch.compileのデフォルトのカーネル生成基盤としても利用されています。
GPUカーネル最適化の相談
PyTorchのコンパイル基盤としての採用実績