9月21日、The Decoderが「Alibaba's open-weight Qwen-Image-2.1 claims to beat closed models in image generation with just 7 billion parameters」と題した記事を公開した。AlibabaのQwenチームが公開したオープンウェイト画像生成モデル「Qwen-Image-2.1」は、わずか70億(7B)パラメータでありながら、自社ベンチマーク上ではGPT-4oやGeminiといったクローズドモデルの多くを上回ると主張している。しかも動作環境はGeForce RTX 3090のような一般的なコンシューマー向けGPUで十分とされており、研究者や個人開発者が手元の環境で試せる点が大きな注目を集めている。
70億(7B)パラメータで「クローズドモデル超え」を主張
AlibabaのQwenチームが、画像生成・編集向けのオープンウェイトモデル「Qwen-Image-2.1」を公開した。
最大の特徴は、視覚生成コンポーネントのパラメータ数がわずか70億(7B)であること。にもかかわらず、Qwen自身のベンチマーク上ではほとんどのクローズドモデルを上回ると主張している。ただし、この評価はあくまで自社ベンチマークに基づくものであり、独立した第三者によるベンチマーク結果はまだ出ていない点には注意が必要だ。
ハードウェア要件の面では、GeForce RTX 3090のような一般的なコンシューマー向けGPUで動作するとされており、研究者や個人開発者にとって実用的な選択肢になりうる。FLUX.1など既存のオープンウェイト画像生成モデルと比べてもパラメータ規模は小さく、民主化という観点では一歩踏み込んだ立ち位置といえる。

Qwen-Image-2.1が生成したグループ写真。それぞれの人物の個別写真から合成したとされる。(画像:Alibaba / Qwen)
主な機能
Qwen-Image-2.1が備える機能は以下のとおりだ。
- 透明画像(RGBA)のネイティブ生成・編集:オブジェクトの切り抜きや、透明レイヤー上のテキスト変更が可能。
- 最大10枚の参照画像への対応:グループポートレートの合成、バーチャル試着、部屋のデザイン変更などに活用できる。
- マスクや塗り込みによるローカル編集:円形選択・マスク・ペイントマークで編集対象の領域を指定できる。
- 推論の高速化:アーキテクチャの改良とKVキャッシュの再利用(KV cache reuse)により、特に複数の参照画像を使う際の推論速度が向上している。KVキャッシュとは、Transformerモデルの推論時に計算済みのKey・Value行列を再利用して処理を省力化する手法のこと。
QwenシリーズはこれまでもQwen2.5-VLなどマルチモーダル方向への展開を続けており、今回のQwen-Image-2.1はその画像生成・編集特化版として位置づけられる。
入手方法とライセンス
モデルはHugging Face、GitHub、Model Scopeで公開されており、Hugging Face上にデモも用意されている。
ただし、ライセンスは研究用途限定であり、商用利用は禁止されている。ビジネス用途での利用を検討する場合は、Qwenへの個別申請が必要となる。
「オープンウェイト」でありながら商用利用不可という構成は、一見するとMetaのLlamaシリーズに似た戦略に映る。しかしLlamaシリーズはLlama Community Licenseのもとで一定規模以下の商用利用を認めているのに対し、Qwen-Image-2.1は商用利用を原則禁止としており、ライセンスの開放度は大きく異なる。研究コミュニティへの開放と商用展開のコントロールを両立しようとするAlibabaの姿勢は共通しているが、具体的な条件は別物として理解しておく必要がある。
性能主張については、自社ベンチマークによる評価である以上、独立した検証を待ってから判断するのが現実的だろう。一方で、7Bというコンパクトな規模でRGBA生成や多参照画像合成といった高度な機能を実装している点は、オープンウェイト画像生成モデルのアーキテクチャ研究において見逃せない事例となりそうだ。
詳細はAlibaba's open-weight Qwen-Image-2.1 claims to beat closed models in image generation with just 7 billion parametersを参照していただきたい。




