AI を、動かしながら学ぶ。
画像生成・文書理解・エージェントを実際に走らせながら AI を学ぶための実験リポジトリ群です。動かす、制約を測る、残す。 このサイトはその観測結果と、これから進む経路をまとめたものです。
4
repositories6
phases2026-08-04
updatedリポジトリ
1 テーマ 1 リポジトリ / 全 4 件
comfyui-vegetable-generator
ComfyUI のワークフローを API から叩き、野菜 EC の商品画像を生成する。Mac の Docker Compose だけで完結し、コマンドは 4 つ。
ワークフロー API の構造、CPU 推論のステップ数と所要時間の関係、再現可能な実行環境の作り方
codex-skills
AI エージェントから再利用できるスキル集。Android のランチャーアイコンを生成・監査する手順を、エージェントが実行できる形に外部化している。
手順をスキルとして切り出す粒度の決め方、アイコン構成の監査の自動化
dots-ocr-demo
DOTS OCR を Docker Compose で動かす検証環境。文書画像からのテキスト抽出を試す。精度の測定には未着手。
VLM 系 OCR の実行環境の立ち上げ
.github
Organization のハブ。学習ロードマップ、学習ノート、そしてこのサイトのソースを置いている。
全体像の管理と、静的サイトとしての公開
現在地
自己診断 / 2026-08-04 時点
推論環境を再現可能な形で組める。どのリポジトリも数コマンドで立ち上がり、依存はコンテナに閉じている。
制約を数値で残す習慣がある。Mac の Docker から GPU が使えないこと、CPU でのステップ数別の所要時間まで実測して記録している。
出力を評価できない
生成画像も OCR 結果も、良し悪しを判定する指標がどのリポジトリにもない。「動いた」で観測が止まっている。
推論しかしていない
学習・微調整・量子化といった、モデルの重みに触れる工程を通っていない。既存モデルの利用者の位置に留まっている。
LLM アプリの土台がない
エージェントの入口はあるが、その下にあるはずの構造化出力・埋め込み検索・コンテキスト設計を通っていない。
現在地は Phase 0「基礎の言語化」です。何をどの順で学ぶか、参考資料つきでまとめています。
進め方
3 つの原則
01
動くものを作ってから理論に戻る
既存リポジトリはすべて「まず Docker で動かす」から始まっている。この進め方を維持する。
02
1 テーマ 1 リポジトリ
リポジトリが成果物であり、進捗の単位でもある。
03
完了条件を先に決める
各フェーズに「何ができたら次へ進むか」を明記する。学習が発散しないようにするため。
ロードマップ
時期は目安。完了条件を満たしたら次のフェーズへ
- PHASE 00NOW
基礎の言語化
既に手を動かして知っていることを、説明できる形にする。
2026 Q3
- PHASE 01
生成物の評価
「動いた」から「良し悪しを判定できる」へ。最大の弱点を埋める。
2026 Q3–Q4
- PHASE 02
LLM アプリ基礎
エージェントを作る前に、その土台となる要素を単体で押さえる。
2026 Q4
- PHASE 03
エージェント化
単発の応答から、道具を使って多段で動く仕組みへ。
2027 Q1
- PHASE 04
推論基盤・運用
ローカルの Mac から出て、性能とコストを扱えるようにする。
2027 Q1–Q2
- PHASE 05
モデルを作る側へ
ここまでは既存モデルの利用者。ここからモデル自体に手を入れる。
2027 Q2 以降