基礎の言語化
既に手を動かして知っていることを、説明できる形にする。
period2026 Q3
new repo—
学ぶこと
- –
Transformer の構造(Attention、位置エンコーディング、Encoder / Decoder の役割分担)
- –
Diffusion モデルの原理 — 毎回指定している steps / cfg / sampler が何をしているのか
- –
VLM の仕組み — OCR が「文字認識」ではなく「画像を条件にした生成」である点
- –
評価指標の基礎(精度・再現率・F1、損失関数、交差検証)
成果物
- –
notes/transformer.md — 図付きで自分の言葉で説明
- –
notes/diffusion.md — ステップ数・CFG スケールと実際の生成結果を並べた検証つき
- –
notes/evaluation-basics.md — 指標の使い分け
完了条件
workflows/api_vegetable.json の各パラメータについて、なぜその値かを説明できる
Attention の計算を数式ではなく図と言葉で説明したノートがある
分類タスクで「精度が高いのに使い物にならない」ケースを具体例で説明できる