Triton(triton-lang)は、CUDA C++の経験がなくても効率的なGPUコードを書けるようにするPython埋め込み型のプログラミング言語・コンパイラです。@triton.jitで注釈したPython関数内でブロックレベルの演算を記述するだけで、メモリ管理等の最適化はコンパイラが自動的に行います。
GPUカーネル記述言語を知りたい相談
Python的な記述でCUDA相当の性能を実現する抽象化