結論:当サイトの検証機(RTX 4070 Ti SUPER・VRAM 16GB)では、FLUX.2 [klein] 4B・Z-Image Turbo・LongCat-Imageがそのままの重みで、20BのQwen-Image 2512も量子化(GGUF Q4_K_M)すれば、1024×1024でも推奨の1328×1328でも最後まで動きました。足りなくなるのはモデルがVRAMに載り切らないときで、止まらずに遅くなります。GPUは、使いたいモデルが収まるかから逆算して選ぶのが確実です。
AI画像生成のGPU選びは、使いたいモデルがVRAMに載るかでほぼ決まります。この記事では、当サイトが2026年9月に16GBのGPUで測った結果と、NVIDIA公式の各GPUのVRAM容量から、16GBでどこまで足りるかを整理します。
測った範囲
RTX 4070 Ti SUPER(VRAM 16GB)1台・ComfyUI 0.20.1・Blender 5.2.1(2026年9月)。ほかのVRAM容量のGPUでは測っていません。
VRAM 16GBで実際に動いた画像生成モデルは?(モデル別の実測)
同じ検証機で測った4本は、すべてメモリ不足で止まらずに完了し、画像を出力しました。起動直後の空きVRAMは14.73GiBでした。
| モデル | 使った重み | 16GBでの結果 | 推奨設定の2回目 |
|---|---|---|---|
| FLUX.2 [klein] 4B | bf16(7.75GB) | 動いた | 3.0秒(4ステップ・1024²) |
| Z-Image Turbo(6B) | bf16(12.31GB) | 動いた(生成中の空きは最小0.57GiB) | 8.0秒(9ステップ・1024²) |
| LongCat-Image(6B) | bf16(12.54GB) | 動いた(生成中の空きは最小0.62GiB) | 53.1秒(50ステップ・1024²) |
| Qwen-Image 2512(20B) | GGUF Q4_K_M(13.24GB) | 全部VRAMに載った | 113.3秒(20ステップ・1328²) |
時間はモデルの読み込みが済んだ2回目の値で、1回目は読み込みなどの分だけ16〜23秒ほど長くかかりました。待ち時間の差は主に推奨のステップ数と解像度の違いです。比べ方の詳細はVRAM 16GBで画像生成モデル4本を比べた記事、個別の設定はZ-Image Turbo・LongCat-Imageの記事にまとめています。
注意したいのは余裕の小ささです。6Bの2本は生成中の空きVRAMが0.6GiB前後まで減ったので、GPUを使うアプリは閉じて回しましょう。
16GBで足りなくなるのはどんなとき?
モデルの重みがVRAMに載り切らないときです。ComfyUIは止まらず、載り切らない分をメインメモリから転送しながら動くので遅くなります。
20BのQwen-Image 2512を量子化の段ごとに読み込ませ、ComfyUIのログに出る「あふれた量(MB offloaded)」を見ると、16GBで全部載ったのはQ4_K_Mまでで、ひとつ上からあふれが出ました。
| 量子化 | 重みの大きさ | 16GBでの挙動(実測) |
|---|---|---|
| Q4_K_M | 12.3GiB | 全部載る(余裕 約730MiB) |
| Q5_K_S | 13.3GiB | 約268MiBあふれる |
| Q5_K_M | 14.0GiB | 約937MiBあふれる |
| Q6_K | 15.7GiB | 約2,684MiBあふれる |
同じモデルのまま、空けておくVRAMの量(--reserve-vram)だけを変えてあふれを作ると、あふれ1,000MiBにつき1ステップ約0.42〜0.60秒が上乗せされ、約2,650MiBのあふれで1ステップは1.950秒から3.200秒(+64%)になりました。あふれの量をそろえると、Q4_K_MとQ6_Kの差は0.03秒でした。量子化の段を上げて遅くなる分の大半は、量子化そのものではなく16GBに収まらなくなるためです。測り方と内訳はVRAM不足の遅さを測った記事で詳しく扱っています。
3DCGでも同じです。Blender 5.2.1のCyclesで8Kテクスチャ64枚(画像メモリ16,384MiB)を使うと、一部がメインメモリに置かれて描画は最後まで進み、テクスチャキャッシュのAuto Generateを有効にすると数十MiBに収まりました(Blender 5.2のテクスチャキャッシュの記事)。
GPUごとのVRAMは?(RTX 50シリーズ)
NVIDIA公式の仕様では、16GBはRTX 5060 Ti(16GB版)・5070 Ti・5080、32GBは5090だけです。
| GPU | VRAM(公式) | 当サイトの実測との関係 |
|---|---|---|
| RTX 5060 | 8GB | 測っていない |
| RTX 5060 Ti | 16GB/8GB(2種類) | 16GB版は容量が同じ |
| RTX 5070 | 12GB | 測っていない |
| RTX 5070 Ti | 16GB | 容量が同じ |
| RTX 5080 | 16GB | 容量が同じ |
| RTX 5090 | 32GB | 測っていない |
当サイトが測ったRTX 4070 Ti SUPERは前の世代の16GBのGPUです。「容量が同じ」GPUでも、生成の速さは世代や性能で変わります。RTX 5060 Tiは8GB版もあるので、16GB版かを型番で確かめてください。GPU同士の違いはRTX 5070 Ti/5080/5090の選び方で比べています。
どのVRAMを選ぶ?使いたいモデルから逆算する
実測から言えるのは「16GBなら6Bクラスはそのまま、20Bクラスは量子化で動く」までです。
- 16GB:当サイトで確かめた範囲。余裕は0.6GiB前後まで減ることがあります。
- 12GB以下:当サイトでは測っていません。16GBでも空きがほとんど残らなかったモデルがあるので、同じ重みのまま動くとは言えません。
- 16GBより大きいVRAM:16GBであふれたQwen-ImageのQ5以上を全部載せたい場合の選択肢で、RTX 50シリーズではRTX 5090(32GB)です(当サイトは未測定)。
GPUを決めたら、電源や冷却まで含めて組まれたBTOが手堅い選択です。RTX 5070 Ti・5080・5090を積んだ構成の選び方はローカルAI画像生成のおすすめBTO PC構成で予算別に比べています。導入はComfyUIの使い方完全入門へ。
GPUを買う前にクラウドで試す手も
ConoHa AI CanvasはComfyUI・AUTOMATIC1111をブラウザから使えるサービスです。公式の対応モデルはStable Diffusion 1.5/2.0/2.1/XLで、この記事で測ったモデルは対応一覧にないため、SDXLで画像生成の流れをつかむ用途に向きます。
まとめ:16GBで足りるかをモデルごとに確かめる
- 16GBの検証機では、FLUX.2 [klein] 4B・Z-Image Turbo・LongCat-Imageがそのまま、20BのQwen-ImageがQ4_K_Mで最後まで動いた
- 足りなくなるのは重みが載り切らないとき。止まらずに、あふれ1,000MiBにつき1ステップ約0.42〜0.60秒遅くなる
- 12GB以下・32GBは未測定。使いたいモデルが載るかから逆算して選ぶ

コメント