Litmus — 話題のニュースを、深く読み解く。 RSS
AI

FLUX 3 Imageは、触れていない部分を座標で固定して編集できる

Black Forest LabsのFLUX 3 Imageは、画像の要素ごとに座標を指定でき、触れていない部分は編集前後で変わらないと公式が説明する。価格は10月8日まで半額。

タブレットにスタイラスで円形の模様を描いている手元

イメージ写真 記事の内容を撮影したものではありません。Photo by Michael Burrows on Pexels

この記事には Amazon アソシエイトのリンクを含みます。

通販サイトやSNSの運用で、手持ちの商品写真を1枚のコーディネート画像にまとめたいと思ったことはないだろうか。ベスト、Tシャツ、ジーンズ、バッグ、靴。別々に撮った写真を画像生成AIに渡して「1枚にまとめて」と頼むと、狙った配置にならなかったり、直すたびに関係ない部分まで変わってしまったりする。

Black Forest Labsが2026年10月1日に公開した画像生成モデル「FLUX 3 Image」は、この悩みに答える設計になっている。写真の要素ごとに置き場所を座標で指定でき、しかも一度作った画像の一部だけを直すとき、触れていない部分は変わらないと公式が説明している。

位置をどんな数字で指定するのか、そして「変わらない」とどうして言い切れるのか。公式サイトの実例から見ていく。

商品写真を1枚に合成する

複数の写真を、どうやって1枚にまとめるのか。公式サイトのデモは、ベスト・Tシャツ・ジーンズ・ダッフルバッグ・ビーニー(ニット帽)・スニーカーという6枚の商品写真を使う。それぞれにref_image_0からref_image_5まで番号を振り、「Times Squareのストリートファッションのポートレート」という1行の指示文だけで1枚の人物写真に合成している。

6枚の参照画像には、それぞれ画像内の置き場所を示す矩形(bounding box)が振られている。帽子は頭の高さ、ベストとTシャツは胴体、ジーンズは脚、スニーカーは足元という具合に、実際に人が身につける位置に矩形が並ぶ。

画像全体 帽子 ベスト Tシャツ ジーンズ 靴 バッグ バッグだけ別の位置

図が示すとおり、ダッフルバッグだけは体の輪郭から外れた横の位置に矩形がある。服のパーツだけでなく、小物も体とは独立した場所に置けることが分かる。この位置の指定は、どんな数字で決まっているのだろうか。

位置は0から1000の目盛りで決まる

矩形の数字は、画像の縦横のピクセル数ではなく、0から1000までの共通の目盛りで書く。公式ドキュメントと公式モデルページのFAQには、「どのアスペクト比を選んでも、キャンバスは縦横とも0から1000のグリッドになる」とある。それぞれの矩形は[y_min, x_min, y_max, x_max]の形式で書く。実際のピクセル数が768×768でも4Kでも、同じ座標の指定がそのまま使える。

矩形は自分で描く必要もない。公式FAQによると、アスペクト比と1行の指示文だけを与えれば、AIが要素ごとの矩形と説明文を自動で組み立てる。組み上がった矩形は、気に入らなければ1つずつ動かして調整できる。

矩形を自分で書く場合、レイアウトの指示は2つの部分でできている。公式FAQによると、まず画像全体を1段落で説明する「キャプション」を書く。そのあとに、要素ごとのid・矩形・説明文を並べたJSON配列の「エレメントテーブル」を続ける。キャプションの中では、town_1やdome_1のように、それぞれの要素をIDで名指しする。このIDが、編集のときにも同じ要素を指す手がかりになる。

この共通の目盛りは、新しく画像を作るときだけでなく、すでにある画像を直すときにも使われる。直す対象の矩形には、次の3種類(kind)がある。

  • new: 新しく描き直す要素
  • move: 位置を動かす要素
  • anchor: 元のまま変えない要素

公式ドキュメントの編集例では、anchorに指定した要素に注目したい。入力画像での矩形の位置(src_bbox)と、出力画像での矩形の位置(tgt_bbox)に、同じ座標が与えられている。つまり、同じ座標を入力と出力の両方に書けば、その部分は数値としてそのまま残り、違う指定をした部分だけが新しく描かれる。

一部だけ直したいとき、この仕組みは実際どこまで信頼できるのだろうか。

触れていない部分は変わらない

自分は、画像の一部だけ直す機能くらいなら、今どきの画像生成AIにはひと通り備わっているだろうと思っていた。ところが公式サイトのFAQは、わざわざ次のように念を押している。

Everything you didn’t touch stays exactly where it was, so an image holds together across one round of edits after another.

訳すと、「触れていない部分は、そのままの場所に残る。だから、編集を何度重ねても画像が崩れない」という意味になる。公式サイトに載っている実例では、サーファーの写真で黒いウェットスーツと白いサーフボードを赤へ塗り替える指示を出す。そのとき、背景の大きな波と曇り空は「exactly unchanged(正確に変えない)」という指定で固定している。塗り替えた2つの矩形以外は、構図ごと据え置かれる。商品写真に置き換えれば、生地の色や柄だけを直しても、合成したモデルや背景は作り直さずに済むということだ。

同じFAQには「Does FLUX 3 change the boxes I draw? No.」という一文もある。プロンプトを整えるアップサンプラーが要素を書き足すことはあっても、自分で描いた矩形はIDも座標もそのままモデルに届く。ここまでの保証は、公式ドキュメントが示す実装の設計と、公式サイトに載っている実例の範囲のものだ。

仕組みは分かった。では、実際に自分で試すには何が要るのだろうか。

使い方は2通りある

試す方法は2つある。公式サイトのPlaygroundで矩形を自分の手で描くか、Black Forest LabsのAPIへレイアウト込みのプロンプトを送るかだ。

FLUX 3 Image自体は、Hugging Faceなどでウェイトが公開されている「オープンウェイト」のモデルではない。自分のサーバーで動かしたい場合は、公式サイトにある「commercial weights license」の契約が必要になる。これは営業チームへの問い合わせが条件になる。手元のPCやオフラインの環境でそのまま動かすことはできない。

価格は10月8日まで半額

公式サイトの価格ページで確認すると、解像度によって1枚あたりの価格が5段階に分かれており、2026年10月8日までは通常価格の半額になっている。

解像度通常価格(1枚)10/8までの価格(1枚)
768×768$0.041$0.0205
1K$0.048$0.024
1.5K$0.07$0.035
2K$0.10$0.05
4K(5456×3072、約16.8MP)$0.607$0.3035

もっとも高い4Kでも、半額の間なら1枚0.3ドルほどで済む。普段づかいの1Kや2Kなら、半額期間でなくても1枚数セントの範囲に収まる。

まとめ

FLUX 3 Imageは、画像の要素ごとに0から1000の座標で位置を指定し、最大10枚の参照写真を1枚に合成できる。すでにある画像を直すときも同じ座標の仕組みを使い、触れていない矩形は公式の説明どおり変わらない。試すにはBlack Forest LabsのPlaygroundかAPIが要る。オープンウェイトとしての配布はないため、自分のサーバーで動かすには別途ライセンス契約を結ぶ必要がある。価格は2026年10月8日まで通常の半額で、もっとも安い768×768なら1枚2セントほどで試せる。

この記事の先を読む本を探す

特定の本を勧めるものではありません。検索結果から、いまの版と目次を確かめて選んでください。

コメント

気づきや感想をどうぞ

記事への補足や、読んで考えたことをお寄せください。個人情報や、他の人を傷つける内容の投稿はお控えください。

コメントを読み込んでいます…

    ほかの記事

    最新の記事 →