scaled dot-product attention
Attention(Q, K, V) =
softmax(QKᵀ / √dₖ) V
softmax(QKᵀ / √dₖ) V
QKᵀ → 関連度を測る
√dₖ → 勾配を安定させる
softmax → 割合に変える
V → 中身を混ぜる
ブラックボックスのまま、
使わない。
線形代数、確率統計、最適化から、モデルの動作原理、最新の論文まで。 「なぜそう動くのか」を説明できる力が、応用力と批判的思考の土台になる。
THE STACK OF UNDERSTANDING
基礎から、積み上げる
01
線形代数
LINEAR ALGEBRAベクトルと行列で世界を表現する。
02
確率・統計
PROBABILITY不確実さを数で扱う。
03
最適化
OPTIMIZATION損失を最小化していく。
04
機械学習
MACHINE LEARNINGデータから関数を学ぶ。
05
Transformer
ATTENTION注意機構で文脈を捉える。
06
LLMの内部
INTERNALSなぜ言葉を生成できるのか。
THE JOURNEY
理解の、グラデーション
01
なんとなく 知っている
02
仕組みを 理解する
03
説明 できる
READING LIST
読む、議論する
論文や教材を輪読し、発表・議論・フィードバックを繰り返す。人に説明することで、理解は一段深まる。
[01]Attention Is All You Need (2017)
[02]Deep Learning — Goodfellow et al.
[03]Pattern Recognition and Machine Learning (PRML)
[04]ベイズ推論による機械学習
[05]Kaggleで学ぶ大規模言語モデル入門
HOW WE STUDY
学ぶ手段は、それぞれ
資格・講座・書籍・論文。そのときの興味やキャリアに合わせて、各自の方法でAIを深めています。
資格
- E資格
- G検定
- DS検定 など
講座
- 東大松尾研 GCI
- DL基礎講座
- LLM講座 など
その他
- 論文読み企画
- 勉強会・解説会 など
