phase 00 — 基礎の言語化

いま学ぶこと

Phase 0 は新しいものを作らず、既に動かして知っていることを説明できる形にする段階です。下の 4 つは、いま手元にあるリポジトリを説明するために必要な順に並べています。上から順に進めれば、後の項目ほど前の項目を前提にできます。参考資料は日本語・英語・中国語を混ぜてあります。英語の原典が重いときは、同じ内容を扱う中国語の教材から入っても構いません。

4

topics

29

resources

2026 Q3

period
01

扱う範囲

全 4 項目

TransformerAttentionDiffusionVLM評価指標
02

進め方

上から順に

1

図解で全体像

各項目の最初に挙げた解説記事・動画だけを、4 項目ぶん通しで読む。この時点では論文に入らない。

2

手元のパラメータと接続

Diffusion の項目の演習を行い、workflows/api_vegetable.json の値と結びつける。Phase 0 の完了条件のひとつがここで埋まる。

3

原典で裏を取る

説明していて曖昧だった箇所だけ論文に戻る。最初から全部読もうとしない。

4

ノートに落とす

notes/ に自分の言葉で書く。書けなかった箇所が、まだ理解していない箇所です。

03

項目ごとの資料

全 29 件 — JA 1 / EN 20 / ZH 8

01

Transformer の仕組み

この先のフェーズはすべて Transformer の上に乗ります。codex-skills で使っているエージェントも、Phase 2 で作る RAG も、Phase 3 の Tool use も同じ土台です。ここを飛ばすと、以降の「なぜそう動くのか」がすべて暗記になります。

答えられるようになりたい問い

Attention は何を計算しているのか。なぜ再帰なしで系列を扱えるのか。

手を動かして確かめる

短い文を 1 つ選び、各トークンがどのトークンを参照するかを図に描いてみる。数式ではなく矢印で説明できれば十分です。

参考資料 — 8 件

02

Diffusion モデルの仕組み

comfyui-vegetable-generator では毎回 steps / cfg / sampler を指定していますが、それぞれが何をしているかは未整理のままです。Phase 1 で生成物を評価するには、まず「どのパラメータが何に効くか」を説明できる必要があります。

答えられるようになりたい問い

steps を増やすと何が起きるのか。cfg スケールは何と何のバランスを取っているのか。

手を動かして確かめる

同じ seed のまま steps と cfg だけを変えた画像を並べ、変化を言葉で説明する。Phase 1 の評価基盤の原型になります。

参考資料 — 8 件

03

VLM と文書理解

dots-ocr-demo は起動しただけで止まっています。VLM 系の OCR は文字を 1 文字ずつ認識しているのではなく、画像を条件にテキストを生成しています。この違いを理解しないと、Phase 1 で誤り方を分類できません。

答えられるようになりたい問い

VLM の OCR はなぜ「それらしいが存在しない文字列」を出すことがあるのか。

手を動かして確かめる

わざと読みにくい文書を入力し、出力がどう崩れるかを観察する。崩れ方が古典的 OCR と違うことを確かめます。

参考資料 — 6 件

04

評価指標の基礎

現在地の分析で最大の弱点として挙げた「出力を評価できない」を埋めるための準備です。Phase 1 に入る前にここを済ませておかないと、指標を選ぶ段階で手が止まります。

答えられるようになりたい問い

精度が高いのに使い物にならないのはどういう状況か。生成物にはなぜ正解率が使えないのか。

手を動かして確かめる

手元の OCR 出力を 10 件だけ目視で採点し、どういう基準で「良い」と判断したかを言語化する。それが指標の原型になります。

参考資料 — 7 件

04

このフェーズの完了条件

満たしたら Phase 1 へ

  • workflows/api_vegetable.json の各パラメータについて、なぜその値かを説明できる

  • Attention の計算を数式ではなく図と言葉で説明したノートがある

  • 分類タスクで「精度が高いのに使い物にならない」ケースを具体例で説明できる