Transformer、Self-Attention、位置エンコーディングを初学者向けに整理します。
Attentionを使い、文脈内の重要な関係を捉える深層学習モデルです。
入力情報のうち、どこに注目すべきかを計算する仕組みです。
入力内の語同士の関係を捉えるAttentionの仕組みです。
Transformerに語順情報を与えるための仕組みです。