gekal-study-ai — learning system

AI を、動かしながら学ぶ。

画像生成・文書理解・エージェントを実際に走らせながら AI を学ぶための実験リポジトリ群です。動かす、制約を測る、残す。 このサイトはその観測結果と、これから進む経路をまとめたものです。

4

repositories

6

phases

2026-08-04

updated
01

リポジトリ

1 テーマ 1 リポジトリ / 全 4 件

comfyui-vegetable-generator

稼働中
画像生成 / Text-to-Image

ComfyUI のワークフローを API から叩き、野菜 EC の商品画像を生成する。Mac の Docker Compose だけで完結し、コマンドは 4 つ。

ComfyUIStable Diffusion 1.5Docker ComposePython
ここで得た知見

ワークフロー API の構造、CPU 推論のステップ数と所要時間の関係、再現可能な実行環境の作り方

codex-skills

稼働中
AI エージェント / Tool use

AI エージェントから再利用できるスキル集。Android のランチャーアイコンを生成・監査する手順を、エージェントが実行できる形に外部化している。

Agent SkillsCodexAndroid
ここで得た知見

手順をスキルとして切り出す粒度の決め方、アイコン構成の監査の自動化

dots-ocr-demo

検証止まり
文書理解 / VLM

DOTS OCR を Docker Compose で動かす検証環境。文書画像からのテキスト抽出を試す。精度の測定には未着手。

DOTS OCRVLMDocker Compose
ここで得た知見

VLM 系 OCR の実行環境の立ち上げ

.github

ハブ
ハブ / 公開

Organization のハブ。学習ロードマップ、学習ノート、そしてこのサイトのソースを置いている。

Next.jsMUIGitHub ActionsGitHub Pages
ここで得た知見

全体像の管理と、静的サイトとしての公開

02

現在地

自己診断 / 2026-08-04 時点

✓ できていること
  • 推論環境を再現可能な形で組める。どのリポジトリも数コマンドで立ち上がり、依存はコンテナに閉じている。

  • 制約を数値で残す習慣がある。Mac の Docker から GPU が使えないこと、CPU でのステップ数別の所要時間まで実測して記録している。

! 埋めるべき穴

出力を評価できない

生成画像も OCR 結果も、良し悪しを判定する指標がどのリポジトリにもない。「動いた」で観測が止まっている。

推論しかしていない

学習・微調整・量子化といった、モデルの重みに触れる工程を通っていない。既存モデルの利用者の位置に留まっている。

LLM アプリの土台がない

エージェントの入口はあるが、その下にあるはずの構造化出力・埋め込み検索・コンテキスト設計を通っていない。

いま学ぶことを見る

現在地は Phase 0「基礎の言語化」です。何をどの順で学ぶか、参考資料つきでまとめています。

03

進め方

3 つの原則

01

動くものを作ってから理論に戻る

既存リポジトリはすべて「まず Docker で動かす」から始まっている。この進め方を維持する。

02

1 テーマ 1 リポジトリ

リポジトリが成果物であり、進捗の単位でもある。

03

完了条件を先に決める

各フェーズに「何ができたら次へ進むか」を明記する。学習が発散しないようにするため。

04

ロードマップ

時期は目安。完了条件を満たしたら次のフェーズへ