基礎

Transformer(トランスフォーマー)

現在の大規模言語モデルを可能にした、2017年に登場したニューラルネットワーク構造。

Transformer以前の言語モデルは、テキストをおおむね順番通り、単語を一つずつ処理していたため、離れた単語同士の関係を捉えにくく、学習にも時間がかかりました。2017年の論文“Attention Is All You Need”で提案されたTransformer構造は、self-attention(自己注意機構)を導入し、文章中のすべての単語を他のすべての単語と同時に比較して関連度を計算できるようにしました。

この並列処理こそが、現在の規模での学習を可能にしています。Transformerは数千のGPUで同時に効率よく学習させることができます。GPT、Claude、Geminiを含め、現在実運用されている主要なLLMのほぼすべてがTransformerの派生形です。