大規模言語モデル(LLM)とは
ChatGPT・Claude の仕組み
大規模言語モデル(LLM: Large Language Model)は、膨大なテキストデータを学習した AI モデルで、自然な言語でのやり取りや文章生成を可能にします。ChatGPT(OpenAI)、Claude(Anthropic)、Gemini(Google)などが代表例です。
「大規模」の意味
LLM の「大規模」とはパラメータ数の多さを指し、GPT-4 では数千億個以上とされています。パラメータとはモデルが学習の過程で調整する数値で、多いほど複雑なパターンを学習できますが、学習・運用に莫大な計算リソースが必要です。
Transformer アーキテクチャ
現代の LLM は Transformer と呼ばれるアーキテクチャを基盤にしています。「アテンション機構」という仕組みで、文中の単語間の関係を広範囲にわたって捉えることができます。
入力トークン列 → Transformer ブロック × 数十〜百層 → 次トークンの確率分布 → 出力
LLM ができること
- 質問への回答・対話
- 文章の要約・翻訳・校正
- プログラムコードの生成・デバッグ
- アイデア出し・ブレインストーミング
- 分析・レポート作成の補助
トークンと文脈長
LLM はテキストを「トークン」という単位で処理します(日本語では概ね1〜3文字が1トークン)。一度に処理できるトークン数を コンテキスト長(文脈長)と言い、最新モデルは100万トークン以上に対応しています。
まとめ
LLM は大量のテキストを学習して言語を扱えるようになった AI です。強力な反面、ハルシネーション(事実でないことをもっともらしく述べる)の問題があるため、重要な情報は必ず一次情報で確認する習慣が大切です。