P-05出典・引用

アテンション機構という概念は、Transformer以前にどのような研究で最初に提案されましたか?

arXivで公開されている論文(Dzmitry Bahdanau・Kyunghyun Cho・Yoshua Bengioによる共著、2014年9月投稿、ICLR 2015口頭発表採択)によれば、ニューラル機械翻訳におけるエンコーダ・デコーダ構造の限界(固定長ベクトルへの圧縮がボトルネックになる問題)を解決するため、モデルが翻訳対象の単語を予測する際に「原文の関連する部分を自動的に(ソフトに)探索する」仕組みを提案しています。この論文は、明示的な単語分割を必要とせず、翻訳時にモデルが原文の関連要素へ動的に注目できるソフトアラインメント手法を導入したものであり、後にディープラーニングにおける「アテンション機構」として知られるようになる概念の初期の定式化にあたるとされています。著者らは英仏翻訳タスクでこの手法が競争力のある結果を達成し、得られたアラインメントパターンが言語的直感と整合することを示しています。2017年のTransformer論文における自己注意(Self-Attention)とは異なる、翻訳における系列間アラインメントの文脈で提案された点が特徴です。

実績・根拠

情報ソース