AI基盤

高額なAI端末やローカルAI環境を導入しても、社内で使いこなせなければ投資効果は十分に得られません。
本カテゴリでは、外部AIに出しにくい資料や映像を扱う現場向けに、ローカルLLM、RAG、OCR、音声・画像・動画処理の検証を整理しています。
これらの記事は、IT・AI導入前の業務整理、ローカルAI活用のPoC設計、社内担当者の内製化支援などを検討する際の参考情報として掲載しています。

動画生成に128GBのAIマシンは必要か:RTX 5070 Ti (16GB)とNVIDIA Blackwell (GB10)でMiniMax H3を検証

MiniMax H3の動画生成で使う4つのモデルファイルは、今回の構成では合計約39.55 GiBでした。この処理を、RTX 5070 Ti (16GB) とPC本体のメモリを組み合わせる環境、NVIDIA Blackwell (GB10) でCPUとGPUが128GBのメモリを共有する環境で、それぞれ1回実行しました。

約39.55 GiBはモデルファイルの合計サイズであり、実行時のメモリ使用量ではありません。一方、16GBはRTX 5070 Tiの製品仕様上のGPUメモリ容量です。モデルファイルの大きさと、実行中にモデルが置かれるメモリは分けて考える必要があります。

RTX側では、GPUに載りきらないモデルの一部をPC本体のメモリで補いました。GB10側では、CPUとGPUが共有するメモリへモデルを読み込みました。どちらの環境でも141フレームの処理を1回完了しています。

この記事は、2つの環境の優劣や、一般に必要なメモリ容量を決める比較ではありません。1つの処理フローを各環境で1回実行した際の違いを、ログと計測値から整理します。

今回の生成例

今回の処理がどのような出力を作るのかを示すため、RTX 5070 Ti側で生成した5.875秒の動画を1本取り上げます。この動画は具体的な出力例であり、画質、匿名化、教材としての適性、メモリ挙動を証明するものではありません。メモリに関する判断は、後述する実行ログと計測記録に基づきます。

前回の記事では、同じ入力動画を題材に、現場動画を教育素材として扱う際の判断軸を整理しました。今回は視点を変え、MiniMax H3の生成処理を異なるメモリ構成で実行した際の挙動を見ます。生成方式と音声条件は異なるため、掲載する動画同士を出力品質の比較には使いません。

RTX 5070 Ti側の生成例
MiniMax H3による今回の生成例
動画の見方:MiniMax H3による今回のRTX 5070 Ti側の生成例です。前記事とバイト列が同じ入力動画を使用していますが、生成方式と音声条件は異なります。本記事では出力品質の比較ではなく、この動画生成処理を異なるメモリ構成で実行した際の挙動を扱います。

モデルファイルの大きさとGPUメモリは別に考える

重要:約39.55 GiBは、今回使った4つのモデルファイルの合計サイズです。一方、16GBはRTX 5070 Tiの製品仕様上のGPUメモリ容量です。今回の実行環境ではGPUメモリ総量が約15.92 GiBとして報告されました。モデルファイルのサイズとGPUメモリ容量は異なる指標であり、単純に「39.55対16」と比較するものではありません。

今回の処理フローが使うモデルファイルは4つです。約39.55 GiBは、保存されている4ファイルのサイズを合計した値です。実行時のメモリ使用量、同時にGPUへ置かれた量、PC本体のメモリへ退避した量を示す数値ではありません。

今回使った4つのモデルファイルを、役割と参考サイズで整理すると次のとおりです。

役割 モデル 参考サイズ
動画生成本体 MiniMax H3 REF2VA 約19.53 GiB
テキスト理解 Qwen3-VL 32B 約14.61 GiB
映像の圧縮・復元 Video VAE 約4.85 GiB
音声の圧縮・復元 Audio VAE 約0.56 GiB
合計 4モデルファイル 約39.55 GiB

ここからは、保存されているモデルファイルの大きさと、実行中にモデルがどのメモリへ置かれたかを分けて見ていきます。

揃えた条件と処理フローの由来

今回の処理フローは、ComfyUIのMiniMax H3動画から動画への変換(R2V)テンプレートを出発点に、入力動画、参照画像、指示文、出力条件を今回の検証用に調整したものです。両環境では、この調整後の処理フローを固定して使用しました。

両環境で揃えた主な条件は次のとおりです。

項目 確認した内容
モデル 4ファイルすべてでSHA-256が一致
入力動画・参照画像 両環境の保存ファイルでSHA-256が一致
生成条件 141フレーム、1344×768、24 fps、20ステップ、同じ乱数条件
実際に実行する処理内容 20ノードの入力と接続関係が一致
実行回数 完了した実行は各環境1回

2つの実行環境について、記事の読み取りに必要な範囲を整理すると次のとおりです。

項目 RTX 5070 Ti側 NVIDIA Blackwell (GB10)側
GPU / SoC NVIDIA GeForce RTX 5070 Ti(16GB GPU専用メモリ) NVIDIA GB10(CPU/GPU共有メモリ)
CPUアーキテクチャ x86_64 aarch64
OS / 実行環境 Windows 11 + WSL2(Ubuntu 24.04.3 LTS)+ Docker NVIDIA DGX OS 7.5.0(Ubuntu 24.04.4 LTS)+ Docker
ComfyUI / Dockerイメージ ComfyUI v0.30.1(NVIDIA NGC PyTorch 26.07ベース) ComfyUI v0.30.1(NVIDIA NGC PyTorch 26.07ベース)
メモリ構成 PC物理メモリ128GB。WSL2から見えた総量94.29 GiB CPU/GPU共有128GB。実行環境から約119.5 GiBと報告

このように、2環境はCPUアーキテクチャやOS・実行基盤、メモリ構成などが異なります。そのため、ハードウェアだけを入れ替えた厳密な条件統一比較ではありません。入力と処理内容の主要部分を揃え、異なる2環境での実行挙動を確認したものです。

RTX 5070 Ti (16GB) では何が起きたか

RTX側では、GPUに載りきらないモデルの一部をPC本体のメモリで補う仕組み(CPU offload)が使われました。ComfyUIのログには、テキスト理解モデルと動画生成本体の一部だけがGPUへ読み込まれ、合計約16.79 GiBがPC本体のメモリへ退避したと記録されています。

RTX側で確認した主な値は次のとおりです。

項目 観測値 読み方
GPU専用メモリ 最大約15.33 GiB / 総量約15.92 GiB(約96.3%) 今回の1回で観測した最大値。限界値ではない
PC本体のメモリへ退避した量 約16.79 GiB ComfyUIが記録した値
PC本体の物理メモリ 128GB PC本体の搭載容量
WSL2実行環境から見えたメモリ 総量94.29 GiB、利用可能量の最小50.67 GiB WSL2内で報告・観測された値
スワップ領域(swap) 観測最大0 GiB 今回の観測範囲に限定
メモリ表記の補足:128GBはPC本体の物理メモリ仕様です。94.29 GiBはWSL2実行環境から見えたメモリ総量、50.67 GiBは今回の実行中に観測した利用可能量の最小値であり、矛盾する数値ではありません。

今回の処理は、16GBのGPU専用メモリだけで完結したのではなく、PC本体のメモリも併用して完了しました。約96.3%は今回観測した最大値であり、GPU専用メモリの限界や、ほかの条件での成否を示す値ではありません。

NVIDIA Blackwell (GB10) では何が起きたか

GB10ではCPUとGPUが128GBのメモリを共有します。実行環境からは約119.5 GiBとして報告されました。RTX側のように、GPU専用メモリとPC本体のメモリを別々に数える構成ではありません。

4モデルについて、共有メモリ側に約39.54 GiBが読み込まれた状態としてログに記録されました。この値は、RTX側でPC本体のメモリへ退避した量とは異なる概念です。

処理は141フレーム、1344×768で1回完了し、生成ファイルの映像と音声を最後まで読み取れることを確認しました。

実行時は、本体に家庭用の扇風機で送風しました。GPU温度は最大84.0℃でした。本体側の温度センサーでは最大95.5℃を記録し、温度による処理速度の抑制を示すログも確認しました。ただし、室温、風量、配置などの冷却条件を統一した比較ではないため、熱と性能の因果関係は評価していません。

2つのメモリ構成はどう違うか

同じ4モデルを使っても、RTX側とGB10側では、モデルを置く場所と記録された数値の意味が異なります。

MiniMax H3の4モデルファイル計約39.55 GiBを、RTX 5070 Ti (16GB)ではGPUに載りきらない部分をPC本体のメモリで補い、NVIDIA Blackwell (GB10)では128GBのCPU/GPU共有メモリで扱った構成と観測値を示す図。
図:MiniMax H3の4モデルファイル計約39.55 GiBを、RTX 5070 Ti (16GB)ではGPUに載りきらない部分をPC本体のメモリで補い、NVIDIA Blackwell (GB10)では128GBのCPU/GPU共有メモリで扱った今回の実行構成と観測値。

2つの構成の違いを整理すると、次のとおりです。

観点 RTX 5070 Ti (16GB) NVIDIA Blackwell (GB10)
メモリ構成 GPU専用メモリとPC本体のメモリを併用 CPUとGPUで128GBのメモリを共有
モデルの扱い GPUに載りきらない分をPC本体のメモリで補う 共有メモリ側にモデルを読み込む
今回記録された量 PC本体のメモリへの退避 約16.79 GiB 共有メモリ側への読み込み 約39.54 GiB
今回確認した結果 141フレームを1回完了 141フレームを1回完了
数値の意味:モデルファイル計約39.55 GiB、RTX側でPC本体のメモリへ退避した約16.79 GiB、GB10側で共有メモリへ読み込まれた約39.54 GiBは、それぞれ別の指標です。同じ種類のメモリ使用量として比較することはできません。

実行時間は参考値にとどめる

両環境で同じ方法により算出できたのは、ComfyUIが実行開始と成功を記録した時刻の差です。

環境 開始から成功まで 実行回数
RTX 5070 Ti (16GB) 約29分16秒 1回
NVIDIA Blackwell (GB10) 約35分24秒 1回

注意:各環境で完了した実行は1回です。CPUアーキテクチャ、ソフトウェア構成、熱環境などが異なり、反復測定もしていません。この2値は単発実行の参考値であり、ハードウェアの速度順位を示すものではありません。消費電力も測定範囲が異なるため比較していません。

再現性で押さえた点

モデル、入力動画、参照画像、処理内容の主要部分は、SHA-256や構造比較で揃えました。一方、同じ名前のコンテナや設定ファイルだけでは、異なるCPUアーキテクチャの実行環境が完全に同じとは言えませんでした。

今回は、x86_64系とARM系(aarch64)の異なるCPUアーキテクチャに加え、コンテナイメージの識別子(digest)と依存関係を確認しました。また、保存されたノード画面の表示に差があっても、表示専用情報を除くと、実行される20ノードの入力と接続関係は一致していました。

今回の結果から言えること、言えないこと

観測した事実と、今回の条件だけでは判断できないことを分けると次のとおりです。

論点 今回の結論
約39.55 GiBとは何か 今回使った4モデルファイルの合計サイズ
RTX側でPC本体のメモリへ退避した量 約16.79 GiBをログで確認
GB10側で共有メモリへ読み込まれた量 約39.54 GiBをログで確認
2環境での実行 141フレームの処理を各環境1回完了
速度・安定性・必要容量の一般論 反復と条件統一がないため結論を出せない
今回掲載する動画 具体的な出力例。画質、匿名化、教材適性、メモリ挙動の証拠ではない
前回の記事との動画比較 同じ入力動画だが生成条件が揃っておらず、品質比較には使えない

今回の1構成だけから、16GBで一般に十分か、128GBが必要か不要かという一般解は出せません。完了実績は、1つの処理フロー、141フレーム、1344×768、20ステップ、各環境1回という範囲に限られます。

ハードウェア選定で確認したいこと

128GBのAIマシンが必要かどうかは、モデルファイルの合計サイズだけでは決められません。実際の用途に沿って、複数の条件を分けて考える必要があります。

128GBのAIマシンが必要かを、使うモデル、GPUメモリ、PC本体メモリ、GPUに載りきらない部分の扱い、共有メモリ、動画条件、利用回数の視点で整理した図。
図:128GBのAIマシンが必要かを、モデルサイズだけでなく、GPUメモリ、PC本体メモリ、処理方法、動画条件、繰り返し利用の要件から判断するための視点。

候補となる環境を評価するときは、次の点を確認します。

  • 実際に使うモデルと処理フローは何か
  • GPU専用メモリをどれだけ必要とし、どこまで余裕を持たせるか
  • PC本体のメモリをどれだけ用意できるか
  • GPUに載りきらない分をPC本体のメモリで補う構成を許容できるか
  • CPUとGPUが共有するメモリの利点が用途に合うか
  • 必要な動画の長さ、解像度、フレームレート、ステップ数はどこまでか
  • 1回の検証か、繰り返し使う本番運用か

今回の結果は選定の答えではなく、事前検証で何を測るべきかを示す材料です。カタログ上のメモリ容量だけでなく、実際に利用する処理フローでのモデルの扱い、PC本体のメモリ、所要時間、反復結果を確認する必要があります。

検証条件とモデルファイル名

今回固定した条件は、141フレーム、1344×768、24 fps、20ステップ、乱数条件(seed)20260807です。

今回使用した4ファイルは、Hugging Face上のComfy-Org/MiniMax-H3でComfyUI向けに配布されているsingle-fileモデルです。元のMiniMax H3モデルはMiniMaxAI/MiniMax-H3で公開されています。使用したモデルファイルは次の4点です。

  • minimax_h3_ref2va_pruned_int8_convrot.safetensors
  • qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
  • minimax_h3_video_vae_fp16.safetensors
  • minimax_h3_audio_vae_fp32.safetensors

まとめ

ファイルサイズの合計が約39.55 GiBとなる4モデルを使うMiniMax H3の処理は、RTX 5070 Ti (16GB) とPC本体のメモリを組み合わせた環境、NVIDIA Blackwell (GB10) で128GBのメモリをCPUとGPUが共有する環境の双方で、それぞれ1回完了しました。

ただし、2つの環境ではメモリの使い方が異なります。今回の1条件だけで必要容量や優劣を一般化することはできません。導入を検討する際には、実際に利用するモデルや動画条件、PC本体のメモリ、繰り返し運用の要件に沿って確認することが重要です。

関連記事






関連記事一覧