Z-Image Turbo(6B)は、VRAM 16GB の RTX 4070 Ti SUPER で公式サンプルのまま動きました。1024×1024・9ステップの1枚目(モデルの読み込み込み)は28.2秒でした。
ただし生成中に VRAM の空きは最小で0.57GiBまで減りました(生成で増えた使用量は約14.09GiB)。公式は「16GBの家庭用GPUに余裕をもって収まる」としていますが、この条件では余裕はほとんどありません。ブラウザなど他にGPUを使うものを閉じてから回すのが無難です。
Z-Image Turbo は、Alibaba の Tongyi-MAI が公開している 6B の画像生成モデルです。「16GBで動く」という触れ込みが本当か、ComfyUI の公式サンプルを1か所も変えずに、VRAM 16GB の検証機で測りました。同じ条件で 20B の Qwen-Image とも比べています。
測定条件:公式サンプルをそのまま使った
ComfyUI の公式サンプル(ComfyUI_examples「Z Image」)の画像に埋め込まれたワークフローを読み込み、変えたのは画像の保存先だけです。
| 項目 | 内容 |
|---|---|
| モデル | z_image_turbo_bf16.safetensors(12.31GB) |
| テキストエンコーダ | qwen_3_4b.safetensors(読み込みの種類は lumina2) |
| VAE | ae.safetensors(Flux 1 と同じ) |
| 生成設定 | 1024×1024・9ステップ・cfg 1.0・euler/simple |
| 環境 | RTX 4070 Ti SUPER(VRAM 16GB)・ComfyUI 0.20.1(デスクトップ版)・Windows 11 |
つまずきやすいのはテキストエンコーダの読み込みです。ComfyUI の「CLIPLoader」の種類の一覧に z_image はなく、公式サンプルでは lumina2 が選ばれていました。自分でノードを組む場合はここを合わせてください。
結果:動くが、VRAMの余裕は0.57GiB
| 指標 | 実測 |
|---|---|
| 結果 | 成功(ジョブの状態は success・1024×1024 の画像が保存された) |
| 1枚目の所要時間(モデル未読み込みから) | 28.2秒 |
| 測定開始時点の空き | 14.66GiB(総容量 15.99GiB) |
| 生成中の空きの最小値 | 0.57GiB |
| 生成で増えた使用量(開始時の空き − 最小値) | 約14.09GiB |
| 生成後も残る使用量 | 11.69GiB |
VRAM の空きは、ComfyUI が報告する GPU の空き容量を0.25秒ごとに107回読み取った値の最小です。所要時間は、ComfyUI の API に投げてから完了を確認するまで(1秒刻みで確認)。2026年9月9日測定。
総容量は約16GBでも、測定を始めた時点で空いていたのは14.66GiBでした。生成中はその空きが0.57GiBまで減りました。「16GBで動く」は正しいが、「余裕がある」とまでは言えない、というのが実測の読み方です。
また、生成が終わっても VRAM の空きは2.97GiBのままで(使用11.69GiB)、ComfyUI の解放(/free)を実行すると14.66GiBに戻りました。読み込んだモデルが残っていたということです。続けて別の大きなモデルを試す場合は、先に解放しておかないと足りなくなるおそれがあります(解放しないまま続けて試すことはしていません)。
20BのQwen-Imageと比べると?
同じ検証機で、ステップ数(20)・cfg(1.0)・解像度(1024×1024)・プロンプトを揃え、20B の Qwen-Image-2512(GGUF 量子化)とも比べました。
| モデル | パラメータ | 1ステップ | 生成で増えた使用量(最大) |
|---|---|---|---|
| Z-Image Turbo bf16 | 6B | 0.80秒 | 14.15GiB |
| Qwen-Image-2512 Q4_K_M | 20B | 2.10秒 | 12.96GiB |
| Qwen-Image-2512 Q6_K | 20B | 3.35秒 | 13.71GiB |
1ステップは、モデルを読み込み済みの2枚目の所要時間を20で割った値です(文字の読み込みや画像の書き出しの時間も含む)。
1ステップの速さは Z-Image が Qwen-Image Q4_K_M の約2.6倍でした。一方、VRAM の使用量は 20B を4ビット級に量子化した版のほうが小さいという結果です。同じ Qwen-Image で精度だけを上げると(Q4_K_M → Q6_K)使用量は増えたので、精度が効いていることは確かですが、Z-Image との差がすべて精度によるとまでは言えません(テキストエンコーダなども違うため)。パラメータ数だけで「載る・載らない」は決まらない、というところまでが言えることです。
なお、テキストエンコーダや VAE はモデルごとに違うため揃えられません。また Z-Image Turbo は本来9ステップ前後で使うよう調整されたモデルです。この表は「同じ設定(ステップ数・cfg・解像度)で回したときの負荷」の比較です。モデルの構造が違うので計算量まで同じとは限らず、画質の優劣も比べていません。VRAM があふれたときに何秒余計にかかるかは、ComfyUI の VRAM 不足のコストを測った記事にまとめています。
この検証機で動かなかったもの・注意点
- int8 版は読み込めなかった。容量が約半分の
z_image_turbo_int8_convrot(6.20GB)は、ComfyUI 0.20.1 ではKeyError: 'int8_tensorwise'で止まりました。この版が対応していない形式です。別の版で読めるかは確かめていません。 - fp16 中間値の設定は、この条件では速度も VRAM もほぼ変わらず、絵だけが変わった。
--fp16-intermediatesを付けると、1ステップは0.80秒のまま、VRAM のピークは14.15GiBから14.18GiBで、同じシードでも出力が変わりました(元の画像との差は PSNR 24.58dB)。各1回の比較なので、効果が無いとまでは言えません。 - ダイナミックVRAMを切ると止まった。
--disable-dynamic-vramを付けると、このモデルのテキストエンコーダを読み込む段階で応答しなくなりました(詳しくは上のリンク先の記事)。
ComfyUI の基本的な使い方はComfyUI の使い方完全入門、モデルごとに必要な VRAM の目安はAI画像生成のGPUとVRAMの選び方で扱っています。

コメント