【2026年版】Z-Image TurboはVRAM 16GBで動く?RTX 4070 Ti SUPERとComfyUI公式サンプルで実測

当ページのリンクには広告が含まれています。
z image turbo 16gb vram comfyui 2026
🔧 インフラエンジニア歴12年(2026年時点)
🖥️ ローカル画像生成(ComfyUI)を検証機で検証
📝 Tech Otaku Lab運営

Z-Image Turbo(6B)は、VRAM 16GB の RTX 4070 Ti SUPER で公式サンプルのまま動きました。1024×1024・9ステップの1枚目(モデルの読み込み込み)は28.2秒でした。

ただし生成中に VRAM の空きは最小で0.57GiBまで減りました(生成で増えた使用量は約14.09GiB)。公式は「16GBの家庭用GPUに余裕をもって収まる」としていますが、この条件では余裕はほとんどありません。ブラウザなど他にGPUを使うものを閉じてから回すのが無難です。

Z-Image Turbo は、Alibaba の Tongyi-MAI が公開している 6B の画像生成モデルです。「16GBで動く」という触れ込みが本当か、ComfyUI の公式サンプルを1か所も変えずに、VRAM 16GB の検証機で測りました。同じ条件で 20B の Qwen-Image とも比べています。

目次

測定条件:公式サンプルをそのまま使った

ComfyUI の公式サンプル(ComfyUI_examples「Z Image」)の画像に埋め込まれたワークフローを読み込み、変えたのは画像の保存先だけです。

項目 内容
モデル z_image_turbo_bf16.safetensors(12.31GB)
テキストエンコーダ qwen_3_4b.safetensors(読み込みの種類は lumina2)
VAE ae.safetensors(Flux 1 と同じ)
生成設定 1024×1024・9ステップ・cfg 1.0・euler/simple
環境 RTX 4070 Ti SUPER(VRAM 16GB)・ComfyUI 0.20.1(デスクトップ版)・Windows 11

つまずきやすいのはテキストエンコーダの読み込みです。ComfyUI の「CLIPLoader」の種類の一覧に z_image はなく、公式サンプルでは lumina2 が選ばれていました。自分でノードを組む場合はここを合わせてください。

結果:動くが、VRAMの余裕は0.57GiB

指標 実測
結果 成功(ジョブの状態は success・1024×1024 の画像が保存された)
1枚目の所要時間(モデル未読み込みから) 28.2秒
測定開始時点の空き 14.66GiB(総容量 15.99GiB)
生成中の空きの最小値 0.57GiB
生成で増えた使用量(開始時の空き − 最小値) 約14.09GiB
生成後も残る使用量 11.69GiB

VRAM の空きは、ComfyUI が報告する GPU の空き容量を0.25秒ごとに107回読み取った値の最小です。所要時間は、ComfyUI の API に投げてから完了を確認するまで(1秒刻みで確認)。2026年9月9日測定。

総容量は約16GBでも、測定を始めた時点で空いていたのは14.66GiBでした。生成中はその空きが0.57GiBまで減りました。「16GBで動く」は正しいが、「余裕がある」とまでは言えない、というのが実測の読み方です。

また、生成が終わっても VRAM の空きは2.97GiBのままで(使用11.69GiB)、ComfyUI の解放(/free)を実行すると14.66GiBに戻りました。読み込んだモデルが残っていたということです。続けて別の大きなモデルを試す場合は、先に解放しておかないと足りなくなるおそれがあります(解放しないまま続けて試すことはしていません)。

SDXLならGPUなしで試せる|ConoHa AI Canvas※ 月額1,100円〜(WebUIの無料時間つき・超過分は時間課金)・ComfyUI・AUTOMATIC1111対応・公式の対応モデルはStable Diffusion 1.5/2.0/2.1/XL(この記事のZ-Imageは対応一覧に無い)

20BのQwen-Imageと比べると?

同じ検証機で、ステップ数(20)・cfg(1.0)・解像度(1024×1024)・プロンプトを揃え、20B の Qwen-Image-2512(GGUF 量子化)とも比べました。

モデル パラメータ 1ステップ 生成で増えた使用量(最大)
Z-Image Turbo bf16 6B 0.80秒 14.15GiB
Qwen-Image-2512 Q4_K_M 20B 2.10秒 12.96GiB
Qwen-Image-2512 Q6_K 20B 3.35秒 13.71GiB

1ステップは、モデルを読み込み済みの2枚目の所要時間を20で割った値です(文字の読み込みや画像の書き出しの時間も含む)。

1ステップの速さは Z-Image が Qwen-Image Q4_K_M の約2.6倍でした。一方、VRAM の使用量は 20B を4ビット級に量子化した版のほうが小さいという結果です。同じ Qwen-Image で精度だけを上げると(Q4_K_M → Q6_K)使用量は増えたので、精度が効いていることは確かですが、Z-Image との差がすべて精度によるとまでは言えません(テキストエンコーダなども違うため)。パラメータ数だけで「載る・載らない」は決まらない、というところまでが言えることです。

なお、テキストエンコーダや VAE はモデルごとに違うため揃えられません。また Z-Image Turbo は本来9ステップ前後で使うよう調整されたモデルです。この表は「同じ設定(ステップ数・cfg・解像度)で回したときの負荷」の比較です。モデルの構造が違うので計算量まで同じとは限らず、画質の優劣も比べていません。VRAM があふれたときに何秒余計にかかるかは、ComfyUI の VRAM 不足のコストを測った記事にまとめています。

この検証機で動かなかったもの・注意点

  • int8 版は読み込めなかった。容量が約半分の z_image_turbo_int8_convrot(6.20GB)は、ComfyUI 0.20.1 では KeyError: 'int8_tensorwise' で止まりました。この版が対応していない形式です。別の版で読めるかは確かめていません。
  • fp16 中間値の設定は、この条件では速度も VRAM もほぼ変わらず、絵だけが変わった。--fp16-intermediates を付けると、1ステップは0.80秒のまま、VRAM のピークは14.15GiBから14.18GiBで、同じシードでも出力が変わりました(元の画像との差は PSNR 24.58dB)。各1回の比較なので、効果が無いとまでは言えません。
  • ダイナミックVRAMを切ると止まった。--disable-dynamic-vram を付けると、このモデルのテキストエンコーダを読み込む段階で応答しなくなりました(詳しくは上のリンク先の記事)。

ComfyUI の基本的な使い方はComfyUI の使い方完全入門、モデルごとに必要な VRAM の目安はAI画像生成のGPUとVRAMの選び方で扱っています。

VRAMに余裕のあるBTOをサイコムで見る※ 構成と価格は公式サイトでご確認ください

よくある質問

Z-Image Turbo は VRAM 16GB で動きますか?
当サイトの RTX 4070 Ti SUPER(16GB)では、ComfyUI の公式サンプルのまま動きました。ただし生成中に VRAM の空きは最小で0.57GiBまで減りました。他にGPUを使うアプリは閉じておくのが無難です。
1枚あたりどれくらいかかりますか?
公式サンプルの設定(1024×1024・9ステップ)で、モデルの読み込みを含む1枚目が28.2秒でした。同じ検証機で20ステップに揃えた比較では、1ステップあたり0.80秒でした。
テキストエンコーダを読み込むときの種類は何を選べばいいですか?
ComfyUI の公式サンプルでは lumina2 が選ばれていました。CLIPLoader の種類の一覧に z_image という項目はありません。
20B の Qwen-Image より VRAM を使うのはなぜですか?
当サイトの比較では、Qwen-Image は4ビット級に量子化した版(Q4_K_M)、Z-Image は bf16 の版でした。同じ Qwen-Image でも精度を上げると使用量が増えたので、精度の違いが大きく効いていると考えられます。ただしテキストエンコーダなども違うため、差のすべてが精度によるとは言えません。
よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!

この記事を書いた人

ITインフラエンジニア歴12年、クラウド(AWSがメイン、一部Azure)の実務は4年目(いずれも2026年時点)。社会人向けの3DCGスクールを2026年9月に卒業。Windows 11 + RTX 4070 Ti SUPER の自宅環境で実際に手を動かしながら、インフラ・クラウド・AI・3DCGの技術記事を書いています。

コメント

コメントする

CAPTCHA


目次