通販サイトやSNSの運用で、手持ちの商品写真を1枚のコーディネート画像にまとめたいと思ったことはないだろうか。ベスト、Tシャツ、ジーンズ、バッグ、靴。別々に撮った写真を画像生成AIに渡して「1枚にまとめて」と頼むと、狙った配置にならなかったり、直すたびに関係ない部分まで変わってしまったりする。
Black Forest Labsが2026年10月1日に公開した画像生成モデル「FLUX 3 Image」は、この悩みに答える設計になっている。写真の要素ごとに置き場所を座標で指定でき、しかも一度作った画像の一部だけを直すとき、触れていない部分は変わらないと公式が説明している。
位置をどんな数字で指定するのか、そして「変わらない」とどうして言い切れるのか。公式サイトの実例から見ていく。
商品写真を1枚に合成する
複数の写真を、どうやって1枚にまとめるのか。公式サイトのデモは、ベスト・Tシャツ・ジーンズ・ダッフルバッグ・ビーニー(ニット帽)・スニーカーという6枚の商品写真を使う。それぞれにref_image_0からref_image_5まで番号を振り、「Times Squareのストリートファッションのポートレート」という1行の指示文だけで1枚の人物写真に合成している。
6枚の参照画像には、それぞれ画像内の置き場所を示す矩形(bounding box)が振られている。帽子は頭の高さ、ベストとTシャツは胴体、ジーンズは脚、スニーカーは足元という具合に、実際に人が身につける位置に矩形が並ぶ。
図が示すとおり、ダッフルバッグだけは体の輪郭から外れた横の位置に矩形がある。服のパーツだけでなく、小物も体とは独立した場所に置けることが分かる。この位置の指定は、どんな数字で決まっているのだろうか。
位置は0から1000の目盛りで決まる
矩形の数字は、画像の縦横のピクセル数ではなく、0から1000までの共通の目盛りで書く。公式ドキュメントと公式モデルページのFAQには、「どのアスペクト比を選んでも、キャンバスは縦横とも0から1000のグリッドになる」とある。それぞれの矩形は[y_min, x_min, y_max, x_max]の形式で書く。実際のピクセル数が768×768でも4Kでも、同じ座標の指定がそのまま使える。
矩形は自分で描く必要もない。公式FAQによると、アスペクト比と1行の指示文だけを与えれば、AIが要素ごとの矩形と説明文を自動で組み立てる。組み上がった矩形は、気に入らなければ1つずつ動かして調整できる。
矩形を自分で書く場合、レイアウトの指示は2つの部分でできている。公式FAQによると、まず画像全体を1段落で説明する「キャプション」を書く。そのあとに、要素ごとのid・矩形・説明文を並べたJSON配列の「エレメントテーブル」を続ける。キャプションの中では、town_1やdome_1のように、それぞれの要素をIDで名指しする。このIDが、編集のときにも同じ要素を指す手がかりになる。
この共通の目盛りは、新しく画像を作るときだけでなく、すでにある画像を直すときにも使われる。直す対象の矩形には、次の3種類(kind)がある。
new: 新しく描き直す要素move: 位置を動かす要素anchor: 元のまま変えない要素
公式ドキュメントの編集例では、anchorに指定した要素に注目したい。入力画像での矩形の位置(src_bbox)と、出力画像での矩形の位置(tgt_bbox)に、同じ座標が与えられている。つまり、同じ座標を入力と出力の両方に書けば、その部分は数値としてそのまま残り、違う指定をした部分だけが新しく描かれる。
一部だけ直したいとき、この仕組みは実際どこまで信頼できるのだろうか。
触れていない部分は変わらない
自分は、画像の一部だけ直す機能くらいなら、今どきの画像生成AIにはひと通り備わっているだろうと思っていた。ところが公式サイトのFAQは、わざわざ次のように念を押している。
Everything you didn’t touch stays exactly where it was, so an image holds together across one round of edits after another.
訳すと、「触れていない部分は、そのままの場所に残る。だから、編集を何度重ねても画像が崩れない」という意味になる。公式サイトに載っている実例では、サーファーの写真で黒いウェットスーツと白いサーフボードを赤へ塗り替える指示を出す。そのとき、背景の大きな波と曇り空は「exactly unchanged(正確に変えない)」という指定で固定している。塗り替えた2つの矩形以外は、構図ごと据え置かれる。商品写真に置き換えれば、生地の色や柄だけを直しても、合成したモデルや背景は作り直さずに済むということだ。
同じFAQには「Does FLUX 3 change the boxes I draw? No.」という一文もある。プロンプトを整えるアップサンプラーが要素を書き足すことはあっても、自分で描いた矩形はIDも座標もそのままモデルに届く。ここまでの保証は、公式ドキュメントが示す実装の設計と、公式サイトに載っている実例の範囲のものだ。
仕組みは分かった。では、実際に自分で試すには何が要るのだろうか。
使い方は2通りある
試す方法は2つある。公式サイトのPlaygroundで矩形を自分の手で描くか、Black Forest LabsのAPIへレイアウト込みのプロンプトを送るかだ。
FLUX 3 Image自体は、Hugging Faceなどでウェイトが公開されている「オープンウェイト」のモデルではない。自分のサーバーで動かしたい場合は、公式サイトにある「commercial weights license」の契約が必要になる。これは営業チームへの問い合わせが条件になる。手元のPCやオフラインの環境でそのまま動かすことはできない。
価格は10月8日まで半額
公式サイトの価格ページで確認すると、解像度によって1枚あたりの価格が5段階に分かれており、2026年10月8日までは通常価格の半額になっている。
| 解像度 | 通常価格(1枚) | 10/8までの価格(1枚) |
|---|---|---|
| 768×768 | $0.041 | $0.0205 |
| 1K | $0.048 | $0.024 |
| 1.5K | $0.07 | $0.035 |
| 2K | $0.10 | $0.05 |
| 4K(5456×3072、約16.8MP) | $0.607 | $0.3035 |
もっとも高い4Kでも、半額の間なら1枚0.3ドルほどで済む。普段づかいの1Kや2Kなら、半額期間でなくても1枚数セントの範囲に収まる。
まとめ
FLUX 3 Imageは、画像の要素ごとに0から1000の座標で位置を指定し、最大10枚の参照写真を1枚に合成できる。すでにある画像を直すときも同じ座標の仕組みを使い、触れていない矩形は公式の説明どおり変わらない。試すにはBlack Forest LabsのPlaygroundかAPIが要る。オープンウェイトとしての配布はないため、自分のサーバーで動かすには別途ライセンス契約を結ぶ必要がある。価格は2026年10月8日まで通常の半額で、もっとも安い768×768なら1枚2セントほどで試せる。
コメント
気づきや感想をどうぞ記事への補足や、読んで考えたことをお寄せください。個人情報や、他の人を傷つける内容の投稿はお控えください。
投稿にはGoogleログインが必要です。
Googleでログイン投稿にはGoogleアカウントの表示名が公開されます。メールアドレスは取得・公開しません。
コメントを読み込んでいます…