Litmus — 話題のニュースを、深く読み解く。 RSS
AI

Qwen-Image-2.1-Turboは、画像生成のステップ数を5分の1にした

Alibabaの画像生成モデルQwen-Image-2.1に高速版が公開された。同じ7Bの重みのまま、1枚の生成に要るステップ数を40から8へ減らした。モデルを軽くせず、計算の再利用で実現した仕組みを確認した。

デジタルタブレットにスタイラスペンで触れようとしている手元の接写

イメージ写真 記事の内容を撮影したものではありません。Photo by Jakub Zerdzicki on Pexels

この記事には Amazon アソシエイトのリンクを含みます。

画像生成AIにプロンプトを打ち込み、プログレスバーが進むのを眺めて待った経験はないだろうか。1枚の画像ができるまでの間、裏側では同じような計算が何十回も繰り返されている。2026年10月9日、AlibabaのQwenチームは、この計算の回数そのものを大きく減らした高速版モデル「Qwen-Image-2.1-Turbo」を公開した。モデルを小さくしたわけではない。同じ重みのまま、1枚を作るのに必要な回数を5分の1まで減らしている。何が変わり、どうやって両立させているのかを確かめていく。

ステップ数が40から8になった

画像生成AIの多くは、ノイズだらけの画像を少しずつ整えていく「デノイジング」という処理を何回も繰り返して1枚の絵に仕上げる。この繰り返しの回数を「ステップ数」と呼ぶ。1ステップあたりの計算量はおおむね一定なので、ステップ数が減れば待ち時間もほぼ比例して縮む。Hugging Face公式のモデルページが示すQwen-Image-2.1のサンプルコードは、いずれもnum_inference_steps=40を使う。1枚の画像に、40回分の計算が要るということだ。

この高速版「Qwen-Image-2.1-Turbo」は、2026年10月9日に重みが公開された(PC Watchの記事)。Hugging Face APIが記録する公開日時も同日だ。公式モデルページによると、この版では8ステップが推奨値になっている。しかもこの設定はモデルのチェックポイントにあらかじめ保存されていて、読み込むだけで自動的に適用される。コード上でnum_inference_stepsの値だけを指定しても上書きされない仕組みだ。

010203040ステップQwen-Image-2.1(ベース): 40Qwen-Image-2.1-Turbo: 8408Qwen-Image-2.1(ベース)Qwen-Image-2.1-Turbo

40から8、5分の1という数字だけ見ると、モデルを簡略化して質を落としたのではないかと身構える。自分も最初はそう思った。だが公開されているのは、ベースモデルと同じパラメータ数7Bの重みだ。Hugging Face APIが返すモデル情報にも、base_modelという項目にQwen-Image-2.1が記録されている。finetune、つまり追加学習による関係だ。モデルの規模はそのままで、繰り返しの回数だけが減っている。では、何を変えてこの差を作ったのか。

計算は減らさず使い回す仕組み

公式モデルページの説明は、この高速化を「prefix KVキャッシュ」という仕組みで実現したとしている。「テキストと参照画像の読み取り結果を、デノイジングの各ステップ間で再利用する」という説明だ。

デノイジングの1ステップごとに、モデルは画像のノイズを少し整えるだけでなく、プロンプトの文章や参照画像を毎回読み込み直している。ノイズの整え方はステップが進むたびに変わるが、プロンプトの中身や参照画像そのものは、1回目のステップでも8回目のステップでも変わらない。それなのに、従来は変わらない部分まで含めて毎回ゼロから計算し直していた。

KVキャッシュは、この「毎回変わらない部分」の計算結果を1回目のステップで取っておき、2回目以降はそれを読み出すだけで済ませる仕組みだ。デノイジングの中身は、この2つに分かれる。

  • ステップごとに変わる部分: ノイズをどう整えるか。8回とも計算し直す
  • ステップをまたいで変わらない部分: プロンプトや参照画像の読み取り。1回目の結果を8回目まで使い回す

変わらない部分の計算を、ステップ数ぶん繰り返すのをやめた、ということになる。

もう一つ、公式モデルページはTurbo版がデフォルトで「CFG=1」という設定を使うとも記している。CFGは、プロンプトにどれだけ忠実な画像にするかを調整する値だ。一般に拡散モデルは1ステップごとに、プロンプトに沿った計算とそうでない計算の両方を行い、その差から画像を整える方向を決めている。CFGの値を1にすると、この2通りの計算が1回分にまとまる性質がある。ステップ数を8に減らしたことに加え、各ステップの計算そのものも軽くしている可能性がある。

Diffusersで使うときは、use_kv_cache=Trueという引数を渡すだけでこの再利用が有効になる(公式モデルページのサンプルコード)。モデル自体を作り直したのではなく、同じモデルを「同じ計算を何度もやり直さない」使い方で動かす仕組みを用意している。

再利用する対象には「参照画像」も含まれている点も見逃せない。既存記事で扱ったとおり、Qwen-Image-2.1は文章からの生成だけでなく、手持ちの画像を渡して編集・合成する使い方もできるモデルだった。公式モデルページのサンプルコードでも、編集の例が示されている。同じQwenImage21Pipelineに、image=という引数で入力画像を渡す形だ。文章からの生成だけでなく、画像を渡しての編集も、同じ8ステップ・同じキャッシュの仕組みで速くなる対象に含まれるということだ。

ステップ数を減らしても画質が保たれるという理屈は分かった。では、実際にそれを確かめられる材料はあるのだろうか。

品質の数値比較はまだない

ここまでの仕組みの説明は、Qwenチーム自身が公式ページに書いたものだ。公式ページには8ステップで生成した作例が並んでいるが、ステップ数を減らす前後で画質を比較した数値(人手評価のスコアや画像の類似度指標など)は見当たらなかった。PC Watchの記事にも、具体的な生成時間や品質のベンチマーク数値の記載はない。

確認できたのは、ステップ数が40から8へ減ったという計算量の指標までで、画質を保てているかどうかの第三者による検証はまだ無い。 自分の用途で試すときは、作例を見て判断するか、実際に自分のプロンプトで生成し比べてみる必要がある。

検証の有無を確認したところで、次に気になるのは実際に使うための条件だ。

無料で試せるが商用は要申請

Qwen-Image-2.1-Turboの重みは、Hugging FaceとModelScopeで公開されている。利用には次が要る。

  • 画像生成ライブラリDiffusers(最新のソース版)と、transformers>=5.17.0
  • GPU環境。推奨解像度は正方形で2,048×2,048ピクセルほか、アスペクト比ごとにプリセットがある(公式モデルページ)
  • 自分でGPUを用意しない場合は、Alibaba Cloud Model StudioのAPIからTurbo版を呼び出すこともできる(PC Watch)

ライセンスは「Qwen Research License Agreement」で、ライセンス原文は利用目的を「非商用」、つまり研究・評価目的に限ると定めている。これはベースモデルのQwen-Image-2.1と同じ条件で、発行日も2026年9月20日と同一の文書だ。商用で使いたい場合は、権利者である杭州通義実験室(Alibaba傘下)への別途申請が要る。申請は文書に記載された窓口([email protected])を通じて行い、商用ライセンスを得る必要がある。

ダウンロードして試すこと自体に制限はないが、その成果物を仕事の制作物にそのまま使ってよいかどうかは別の話になる。自分のショップの商品画像や、仕事のロゴ素材に使うつもりなら、申請を済ませてからのほうがいい。

まとめ

Qwen-Image-2.1-Turboは、2026年10月9日に公開された画像生成モデルQwen-Image-2.1の高速版だ。同じ7Bの重みのまま、1枚の生成に要るステップ数を40から8へ、5分の1に減らした。モデルを軽量化したのではなく、プロンプトや参照画像の読み取り結果をステップ間で使い回す「prefix KVキャッシュ」という仕組みで、無駄な計算をやめている。画質が保たれているかどうかの数値による検証はまだ無いので、作例を見るか自分で試して確かめる必要がある。重みは無料でダウンロードできるが、ライセンスは引き続き非商用限定で、商用で使うには別途申請が要る。

この記事の先を読む本を探す

特定の本を勧めるものではありません。検索結果から、いまの版と目次を確かめて選んでください。

コメント

気づきや感想をどうぞ

記事への補足や、読んで考えたことをお寄せください。個人情報や、他の人を傷つける内容の投稿はお控えください。

コメントを読み込んでいます…

    ほかの記事

    最新の記事 →