Matatabi AI
  • 日本語
  • English

Matatabi AI

猫がまたたびに抗えないように、

人にだって、どうしようもなく惹かれてしまう何かがきっとある。

私たちは、その正体を探し出し、AIの中に根付かせる会社です。

Matatabi AI とは
コンテンツ制作分野で、AI開発や技術検証、制作ノウハウの提供を行う会社です。
More
できること
AI開発、技術検証、制作ノウハウの提供を行っています。
More
お問い合わせ
ご相談やご質問は、こちらからお寄せください。
More
New tabGitHub(新しいタブで開く)New tabComfy with ComfyUI(新しいタブで開く)
Kura
学習の進み具合、設定、損失のグラフ、GPU の状態を表示する Kura の画面
More
FLUX.2 Klein Schematic LoRA
1枚の絵画から、奥行き・面の向き・骨格・切り抜きの6種類の図を描き出した例
More
ComfyUI Panorama Stickers
More
ComfyUI Workflow Image Export
More
Comfyに使う ComfyUI
Comfyに使う ComfyUI のトップページ
More
ComfyUI Video Stabilizer
More
Cross-Image Try-On LoRA
緑のドレスの女性と黒いシャツの男性を並べた画像と、男性の服が緑のドレスに置き換わった編集結果
More
© 2026 Matatabi AI会社についてお問い合わせプライバシーポリシー

FLUX.2 Klein Schematic LoRA

2026.06.01Works

1枚の絵画から、奥行き・面の向き・骨格・切り抜きの6種類の図を描き出した例

画像編集モデル FLUX.2 [klein] 9B で、写真から深度マップやノーマルマップ、人のポーズ、切り抜きマスクを出力する LoRA を6種類開発し、公開しました。本来はそれぞれ専用の画像認識モデルが担う処理を、「写真を別の画像に描き直す」編集として行います。

6種類はいずれもローカル環境で動作します。精度では専用モデルに及ばないものの、物体に隠れて見えない部分まで含めて切り抜くなど、画像生成モデルならではの結果も得られました。

nomadoor/flux-2-klein-9B-schematic-lora6種類の LoRAnomadoor/flux-2-klein-9B-schematic-dataset学習データFLUX.2 [klein] Schematic LoRA解説記事 — データの作り方と詳しい結果

認識を、画像編集として

深度推定やセグメンテーションといった画像認識の処理(CVタスク)は、タスクごとに専用のモデルを使うのが一般的です。Google DeepMind は、こうした処理を画像編集として扱う研究「Vision Banana」を発表しています。

これに影響を受けて、FLUX.2 [klein] でも同じことができないだろうか、と考えたのが最初の発想です。

ただ、Vision Banana をそのまま再現しても面白くないので、深度推定やノーマルマップ推定に加えて、ポーズ推定と amodal segmentation の2つを新たに加えました。選んだのは、どれも画像生成のパイプラインによく組み込まれている処理です。ポーズは深度と同じく ControlNet の入力として、セグメンテーションはインペイントで描き直す範囲を決めるマスクとして、よく使われています。

見えない部分まで切り抜く

通常のセグメンテーションは、見えている部分だけを切り抜きます。amodal segmentation は、見えない部分まで想像して切り抜きます。車の後ろに人が立っていれば、通常は車の上に出ている肩や顔だけを切り抜きますが、amodal segmentation では車に隠れた体まで想像して切り抜きます。

見えないものを想像して描くのは、画像生成モデルが最も得意とする処理です。専用モデルの SAM 3.1 が見えている部分だけを切り抜いたベンチを、LoRA は人に隠れた背もたれや座面まで含めて、一台分の形で描きました。

人物、ベンチ、機関車について、見えている範囲だけの切り抜きと、隠れた部分まで含めた切り抜きの比較
amodal segmentation。中央は見えている部分だけを切り抜く SAM 3.1、右が LoRA

6つのタスク

用意したタスクは、深度、ノーマルマップ、体のポーズ、手と顔を含む全身のポーズ、セグメンテーション、amodal segmentation の6つです。1つの LoRA にまとめて学習するとタスクどうしが混ざってしまったため、タスクごとに LoRA を分けています。

3枚の写真について、Depth Anything V2 と LoRA がそれぞれ推定した深度の比較
深度。中央が Depth Anything V2、右が LoRA
3枚の写真について、Lotus-2 と LoRA がそれぞれ推定したノーマルマップの比較
ノーマルマップ。中央が Lotus-2、右が LoRA
3枚の画像について、DWPose と LoRA が推定した体のポーズの比較
体のポーズ。中央が DWPose、右が LoRA。下段のキャラクターでは DWPose は何も検出していない
3枚の画像について、DWPose と LoRA が推定した手と顔を含む全身のポーズの比較
手と顔を含む全身のポーズ。中央が DWPose、右が LoRA
3枚の写真について、SAM 3.1 と LoRA がそれぞれ出したセグメンテーションマスクの比較
セグメンテーション。中央が SAM 3.1、右が LoRA

重さと、選ぶことの難しさ

課題もあります。一つは、CVタスクとしては重いことです。9B の画像生成モデルを動かすため、専用の認識モデルより時間も計算資源もかかります。

もう一つはセグメンテーションで、amodal に限らず、通常のセグメンテーションも難しいタスクでした。深度マップやノーマルマップは、言ってみれば絵柄変換なので簡単にできます。セグメンテーションでは、プロンプトを読み、画像の中のどれを選ぶかという、一段難しい作業が発生します。

学習データは、データの作り方とあわせて公開しています。