生成AIで声と映像を作る 第2回
AI で長い映像を作る(3 分・10 分の作品の作り方)

この記事でわかること
- 動画の AI が 1 回で作れる長さと、長い作品の作り方
- 編集部が約 9 分のドラマのラフを作った手順と GPU の時間
- 3 分・10 分を Runpod で作るときの費用の目安
確認した環境: ComfyUI 0.39 系 / Wan 2.2 I2V-A14B・InfiniteTalk・Uni3C・FLUX.2 [klein] 4B / 社内の GPU のパソコン(RTX 5060 Ti 8GB)と GPU サーバー(A100 40GB × 3 枚)/ 2026年10月12日に確認
自分の GPU で動かせる動画の生成 AI が 1 回で作れるのは、5 秒前後です。3 分や 10 分の作品は、5 秒前後の場面を何十本も作り、編集でつないで作ります。この記事では、編集部が長いドラマを作ったときの手順と実測の時間をもとに、使える動画のモデル、ComfyUI(画像や動画の AI を動かすアプリ)、GPU を時間で借りられる Runpod の費用の目安を説明します。

動画を作る AI と、文章の AI は別のもの
画像や動画を作る AI には、拡散モデルという仕組みのものがあります。ノイズ(ざらざらの点)だけの状態から、少しずつノイズを取り除いて、画像や動画にしていきます。
- Stable Diffusion は、文章から画像を作る拡散モデルです。公式の GitHub では、VRAM(GPU のメモリ)が 10GB 以上の GPU で動くと説明されています。
- Stability AI の Stable Video Diffusion は、Stable Diffusion をもとにした動画のモデルです。1 回に作れるのは 14 コマか 25 コマです。
- この記事で使う Wan 2.2 も、動画の拡散モデルです。公式の説明では、ノイズの多い前半で全体の配置を決めるモデルと、後半で細部を仕上げるモデルの 2 つを切り替えて使います。
LLM(ChatGPT や Claude のような、文章を作る AI)は、動画を作りません。長い映像づくりで LLM が役に立つのは、次のような文章の仕事です。
- 台本と台詞を書く
- 場面の一覧(絵コンテ)と、場面ごとの撮り方を書く
- 画像・動画のモデルに渡す英語の指示文(プロンプト)を書く
- 何十本もの生成を、順に ComfyUI に頼むプログラムを書く
編集部は、この 4 つを Claude Code(Anthropic の AI の道具)に書いてもらい、担当者の指摘で何度も直しました。台詞は Claude Fable 5.1(Anthropic の LLM)に推敲させ、出てきた案のうち 35 か所を採用しました。
1 回で作れる長さは 5 秒前後
モデルのファイルを手元に置いて、自分の GPU で動かせる動画のモデルを、公式の情報で並べました。どれも、1 回で作れるのは数秒です。

- Wan 2.2 の 14B のモデルは、1 回に 81 コマを作ります。16 コマ/秒なので、約 5 秒です。5B のモデルは 121 コマ・24 コマ/秒で、これも約 5 秒です。
- 表の VRAM は、公式のプログラムをそのまま動かす場合の値です。ComfyUI のドキュメントでは、5B のモデルは 8GB の VRAM でも動くと説明されています。
- InfiniteTalk は、声に合わせて話す動画を作るモデルです。区切りごとに続けて作る仕組みで、長さの制限なく作れます。
- ライセンス(使ってよい条件)は、モデルごとに違います。Wan 2.2 と InfiniteTalk は Apache 2.0 です。ComfyUI のドキュメントでは、Wan 2.2 は商用にも使えると説明されています。HunyuanVideo 1.5 のライセンスは、EU・英国・韓国を対象の地域から外しています。LTX-2.5 は、年商 1,000 万ドルを超える組織が商用に使うには、有料の契約が要ります。
編集部の実測: 8GB でも作れるが、解像度で時間が大きく変わる

- 8GB のパソコンで、Wan 2.2 14B で画像から動画を作ると、640×640 で 1 本 2 分 30 秒〜2 分 50 秒でした。960×960 にすると 21 分かかりました。
- 「4 ステップ(LoRA)」は、少ない回数で作れるように学習させた追加のファイル(LoRA)を使う作り方です。公式の説明では、4 ステップで作れて、20 倍速くなります。使わずに 20 ステップで作ると、640×640 でも 21 分かかりました。
- 同じ処理を社内の GPU サーバー(A100 40GB)で比べると、動きは約 2.8 倍、口パクは約 3.4 倍速くなりました。
ComfyUI で動かす
ComfyUI は、画像や動画の生成 AI を、ノード(処理の箱)を線でつないで動かすアプリです。つないだ処理の全体を、ワークフローと呼びます。
- Windows・Linux・macOS で動きます。NVIDIA のほか、AMD・Intel・Apple Silicon などの GPU にも対応しています。
- 公式の説明では、本体は頼まれたものしかダウンロードせず、インターネットにつながなくても動きます。
- Wan 2.2・LTX-Video 2 と 2.3・HunyuanVideo 1.5 などの動画のモデルに対応しています。ライセンスは GPL-3.0 です。
Wan 2.2 は、ComfyUI のテンプレート(最初から用意されたワークフロー)に入っています。テンプレートを開いて、モデルのファイルを決められたフォルダに置けば動きます。

編集部が画像から動画を作るのに使ったファイルは、次のとおりです。ComfyUI の開発元(Comfy-Org)が Hugging Face で配っているもので、ログインせずに取得できました。高ノイズ(high_noise)と低ノイズ(low_noise)の 2 つが、前半と後半を受け持つモデルです。
models/diffusion_models/wan2.2_i2v_high_noise_14B_fp8_scaled.safetensors (14.3GB)
models/diffusion_models/wan2.2_i2v_low_noise_14B_fp8_scaled.safetensors (14.3GB)
models/loras/wan2.2_i2v_lightx2v_4steps_lora_v1_high_noise.safetensors
models/loras/wan2.2_i2v_lightx2v_4steps_lora_v1_low_noise.safetensors
models/vae/wan_2.1_vae.safetensors
models/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
ComfyUI には、画面のほかに、プログラムから依頼を送る窓口(API)もあります。編集部は、場面ごとに絵と指示文を差し替えた依頼をプログラムで作り、何十本もまとめて送りました。
長い映像の作り方
1. 台本と場面の一覧を作る
最初に、台本を場面に分けた一覧(絵コンテ)を作ります。場面ごとに、画の種類(引き・中・寄りなど)、撮り方(カメラの位置と動き)、台詞を決めます。ここが決まると、場面ごとに、どのモデルで作るかが決まります。

編集部のドラマは、7 章・99 場面で、予定の長さは 13 分 15 秒です。1 回目の台本は「単調」と指摘され、構成から書き直しました。2 回目からは、絵と声を作る前に、場面のイメージと台本だけを文章で固めています。絵や動画を作ったあとで台本を変えると、その場面の素材は作り直しになります。
2. 場面の絵を作り、人物をそろえる
動画は、場面の最初の絵(キーフレーム)から作ります。先に絵を作ると、構図や人物を確かめてから動画に進めます。
場面ごとに別々に絵を作ると、同じ人物でも顔や服が変わります。編集部は、次の 3 つでそろえました。
- 人物ごとに、正面・斜め・横顔・全身の見本の画像を作り、場面の絵を描くときに参照させる
- 服と髪の説明は、毎回同じ英文で書く
- 画風の文(写真のような質感・縦長 9:16・文字やロゴを入れない、など)は、全部の場面で同じものを付ける

見本だけを渡して描くと、人物が中央で正面を向いた、引きの絵になりやすいことがわかりました。そこで、先に見本なしで構図だけの絵を作り、それをぼかして「配置の手本」にして、見本と一緒に渡しています。画像のモデルは FLUX.2 [klein] 4B です。公式の説明では、複数の画像を参照して描けます。
人物の画像で LoRA を作って、モデルに人物を覚えさせる方法もあります。たとえば HunyuanVideo 1.5 は、LoRA を学習させるためのプログラムを公開しています。編集部は人物の LoRA は作らず、見本の画像を参照させる方法にしました。
3. 5 秒の動きを、場面ごとに作る
場面の絵と動きの指示文から、Wan 2.2 で 81 コマ(約 5 秒)の動画を作ります。指示文には、人の動きだけでなく、カメラがどう動いて、どこで終わるかまで書きます。次は、場面 1-7 の指示文です(長いサーバーの通路を、奥の男へゆっくり進む。両側で青い LED が流れていく)。
Slow dolly in down the long server aisle toward the man at the far end; blue LEDs blink past on both sides.
4. カメラの動きを付ける
指示文だけでは、カメラの動きが弱いことがあります。編集部は、カメラの動きを指定する追加のモデル Uni3C を使いました。場面の絵から奥行きを推定して点の集まりにし、決めた軌道でカメラを動かした「お手本の動画」を作って、Wan 2.2 に渡します。

- 動きは、前進・後退・横移動・上下・パン(首振り)・ティルト(上下の首振り)・回り込み・ズーム・手持ちの揺れを組み合わせました。
- カメラの動きを付けた 41 本のうち、寄りとズームの 19 本は、お手本に網目が出たのを直して作り直しました。
- カメラの動きを学習させた別のモデル(Wan2.2 Fun Camera)も試しました。軌道ははっきり出ましたが、光が白く飛ぶ崩れが出て、1 本に約 450 秒(LoRA なし・20 ステップ)かかりました。
5. 5 秒より長い場面は、最後のコマからつなぐ
台詞が 5 秒より長いのに、話す人が画面に映らない場面は、5 秒の動画を何本かつなぎます。2 本目からは、前の動画の最後のコマを最初の絵にして作ります。カメラのお手本は場面全体の長さで作り、区切りごとに同じ範囲を渡しました。

- 区切りの境目(79 コマ目と 80 コマ目)は、つながって見えます。
- 区切りを重ねると、色が濃くなる場面がありました。同じ方法で作った 11 場面のうち 5 場面で、最後の区切りの彩度が、最初の区切りより 1 割以上高くなりました(最大 1.5 倍)。
- 途中から知らない人物が出てくる場面や、人物が画面から外れる場面もありました。長い場面は、区切りごとに確かめて、作り直すかを決めます。
6. 口パク・声・音を付ける
台詞のある場面は、InfiniteTalk で口パクの動画を作ります。場面の絵と台詞の声を渡すと、声に合わせて口・表情・頭が動きます。編集部は Uni3C も一緒に使い、話しながらカメラが寄る動画にしました。

- 2 人が映る場面は、左右の人に別々の声を渡すノードを用意しました。話さない人には無音を渡すと、口を閉じたままになります。
- 576×1024 で作ると、480×832 より、長い場面で顔が崩れにくかったので、576×1024 にしました。
- 声は、全 84 行の台詞を担当者が自分で読んで録音し、AI で役の声に変えました。効果音 29 種類と、BGM 8 曲(7 章ぶんと、短い曲 1 曲)も AI で作りました。声・効果音・BGM には、クラウドのサービス(ElevenLabs)を使っています。
7. 拡大とコマの補間で仕上げる
Wan 2.2 の 14B のモデルは 16 コマ/秒で、編集部の動画は 480×832 や 576×1024 です。仕上げで大きく・なめらかにするのが、拡大とコマの補間です。編集部の確認用のラフでは、まだ行っていません(16 コマ/秒の動画を 25 コマ/秒に合わせるときは、同じコマをくり返して並べています)。ここでは、公式の情報だけを紹介します。
- 拡大: ComfyUI には、拡大のモデル(RealESRGAN など)で画像を大きくするノード(Load Upscale Model と Upscale Image (using Model))があります。編集部のワークフローでも、動画はコマごとの画像として出てきます。
- モデルに付いている拡大: HunyuanVideo 1.5 には 1080P に拡大するモデル、LTX-2.5 には解像度とコマ数をそれぞれ 2 倍にするモデルがあります。
- コマの補間: コマとコマの間のコマを作って、動きをなめらかにします。ComfyUI の追加ノード「ComfyUI-Frame-Interpolation」は、RIFE や FILM などの補間のモデルに対応しています。
8. 編集でつなぐ
最後に、場面の動画を台本の順につなぎます。編集部は、場面の一覧の順に動画をつなぐ短いプログラム(Python)で、確認用のラフを作りました。左上に場面の番号を入れて、作り直す場面を見つけやすくしています。

87 場面で約 9 分 17 秒になりました。1 場面の平均は約 6.4 秒です。黒い画面や画面の文字など、まだ作っていない 12 場面は、生成 AI では作らず、編集で作る場面です。
作る時間: 編集部の実測
社内の GPU サーバー(A100 40GB を 3 枚)で、1 本を作るのにかかった時間です。
| 作ったもの | 大きさ・長さ | A100 1 枚での時間 |
|---|---|---|
| 場面の絵(FLUX.2 [klein] 4B) | 768×1344・1 枚 | 平均 6.8 秒 |
| 動き(Wan 2.2・3 段階) | 480×832・81 コマ(約 5 秒) | 約 97 秒 |
| 動き+カメラ(Uni3C) | 480×832・81 コマ(約 5 秒) | 約 100〜110 秒 |
| 長い場面(最後のコマからつなぐ) | 480×832・11 場面・合計 1 分 53 秒 | 合計 6,905 秒 |
| 口パク+カメラ(InfiniteTalk・Uni3C) | 576×1024・41 場面・合計 5 分 4 秒 | 合計 17,606 秒 |
表の長さは、作った動画の長さです。確認用のラフでは台詞の長さに合わせて切っているため、図の場面ごとの長さとは一致しません。
- 映像 1 秒あたりにすると、口パクは約 58 秒、長い場面は約 61 秒です。動きだけの場面(約 19 秒)の 3 倍ほどかかりました。
- 9 分 17 秒のラフのために GPU を使った時間は、試しと作り直しを含めて合計 45,933 秒(約 12.8 時間)でした。ラフに使った動画を作った時間は約 7.8 時間で、残りの約 5 時間は、場面の絵・試し・作り直しです。
- 3 枚の GPU で並べて作り、最初の依頼から最後の完成までは約 6 時間 10 分でした。
Runpod で GPU を借りる
Runpod は、GPU を 1 秒単位の料金で借りられるクラウドのサービスです。借りた 1 台のサーバーを Pod と呼びます。GPU を持っていなくても、ComfyUI のテンプレートで ComfyUI を動かし、使うモデルを入れて作れます。Runpod の公式の手順では、例として画像のモデル(SDXL-Turbo)を ComfyUI で動かしています。
Pod には 2 つの種類があります。
- Secure Cloud: T3・T4(設備の信頼性の等級)のデータセンターで動きます。公式の説明では、信頼性と安全性が高く、仕事や本番の用途に向いています。
- Community Cloud: 個人などが提供する GPU を、審査された仕組みを通して借ります。料金は Secure Cloud より安くなっています。
料金の例です(1 時間あたり・米ドル。2026年10月12日に料金ページで確認。料金ページの更新日は 2026年9月27日)。
| GPU | VRAM | Secure Cloud | Community Cloud |
|---|---|---|---|
| RTX 4090 | 24GB | 0.89 ドル | 0.34 ドル |
| RTX 5090 | 32GB | 1.19 ドル | 0.69 ドル |
| L40S | 48GB | 1.09 ドル | 0.79 ドル |
| A100 PCIe | 80GB | 1.79 ドル | 1.19 ドル |
| A100 SXM | 80GB | 1.79 ドル | 1.39 ドル |
| H100 PCIe | 80GB | 2.89 ドル | 1.99 ドル |

最新の料金は、Runpod の料金ページで確かめてください。
ComfyUI のテンプレートで始める
Runpod のドキュメントの手順を、短くまとめました。
-
クレジットを入れる
Runpod のアカウントを作り、10 ドル以上のクレジット(前払いの残高)を入れます。Pod を起動するには、選んだ構成の 1 時間ぶん以上の残高が要ります。
-
GPU とテンプレートを選ぶ
Pods の画面で GPU を選び、テンプレートで「ComfyUI」を選びます。RTX 5090 と B200 は「ComfyUI Blackwell Edition」です。モデルや出力を残したいときは、ここでネットワークボリュームを付けます。あとから付けることはできません。
-
起動して ComfyUI を開く
On-Demand で起動し、「Connect」から「Connect to HTTP Service [Port 8188]」を選ぶと、ブラウザで ComfyUI が開きます。初回は、起動に最大 30 分かかります。
-
モデルを入れて作る
テンプレートにはモデルが入っていません。ComfyUI Manager から、使うモデルを入れます。
-
終わったら止める
作ったワークフローを自分のパソコンに保存してから、Pod を止めます。

3 分と 10 分の目安
編集部の実測をもとに、3 分と 10 分の作品を Runpod の A100 で作る場合を計算しました。

計算の前提は、次のとおりです。
- 完成した映像 1 秒あたりの GPU の時間は、編集部の実測で約 83 秒です(試しと作り直しを含む。台詞の多いドラマで、口パクは 576×1024)。
- 1 場面の長さは、編集部のラフの平均の約 6.4 秒です。
- 編集部の GPU は A100 40GB です。Runpod の A100(80GB)でも同じ速さと仮定しました。80GB で速くなるかは確かめていません。
- 料金は、Secure Cloud の A100(1 時間 1.79 ドル)と、Community Cloud の A100 PCIe(1 時間 1.19 ドル)です。声・効果音・BGM、モデルのダウンロード、初回の起動の時間は含めていません。
| 3 分 | 10 分 | |
|---|---|---|
| 場面の数 | 約 28 本 | 約 94 本 |
| GPU を使う時間 | 約 4.1 時間 | 約 13.8 時間 |
| GPU を 3 枚同時に使ったときにかかる時間 | 約 1.4 時間 | 約 4.6 時間 |
| 費用(Secure Cloud) | 約 7.4 ドル | 約 24.6 ドル |
| 費用(Community Cloud) | 約 4.9 ドル | 約 16.4 ドル |
- 結果を見て直している間も Pod を動かしたままにすると、その時間も料金がかかります。編集部の GPU が実際に動いていたのは、確保していた時間の約 69% でした。同じ割合なら、10 分で約 20 時間・約 35.8 ドル(Secure Cloud)です。
- モデルを置くネットワークボリューム(100GB)に、別に月 7 ドルかかります。編集部の ComfyUI のモデルは、合わせて約 69GB でした。
- 8GB のパソコンでは、1 本あたり 2.8〜3.4 倍の時間がかかりました。単純に計算すると、3 分で約 12〜14 時間、10 分で約 39〜47 時間です。576×1024 の口パクが 8GB で作れるかは、確かめていません。
10 分になると変わること
3 分なら場面は 30 本ほどですが、10 分では 100 本近くになります。編集部は、次のようにして数を回しました。
- 場面の番号をそのままファイル名にして、素材を管理する。つなぐときも、番号と台本の順で自動でつなぐ
- 1 本ずつ画面で操作せず、場面の一覧の指示文から依頼を作り、プログラムでまとめて送る
- GPU を何枚か並べて、別々の場面を同時に作る。1 つの場面の中は、前の区切りの続きから作るので、順番にしか進まない
- 途中で全体をつないで見て、作り直す場面を選ぶ
長く作るときに気をつけること
作り直しは、どの工程でも出ます。編集部の場合、GPU を使った時間の約 4 割は、場面の絵と、試し・作り直しの分でした。時間と費用は、作り直しを含めて見積もってください。
連載「生成AIで声と映像を作る」では、声の抑揚の付け方も紹介しています。
参考にした公式の情報
- Wan2.2(Wan-Video の GitHub)
- Wan2.2 の設定ファイル shared_config.py(コマ数とコマ/秒)
- Wan2.2 の設定ファイル wan_ti2v_5B.py(5B のコマ数とコマ/秒)
- Wan2.2-Lightning(ModelTC の GitHub)
- HunyuanVideo-1.5(Tencent-Hunyuan の GitHub)
- HunyuanVideo-1.5 のライセンス(Tencent Hunyuan Community License Agreement)
- LTX-2.5(Lightricks の Hugging Face)
- InfiniteTalk(MeiGen-AI の GitHub)
- Uni3C(GitHub)
- FLUX.2 [klein] 4B(Black Forest Labs の Hugging Face)
- Stable Diffusion(CompVis の GitHub)
- Stability AI「Stable Video Diffusion」
- ComfyUI(GitHub)
- ComfyUI ドキュメント「Wan2.2 Video Generation ComfyUI Official Native Workflow Example」
- ComfyUI ドキュメント「ComfyUI Image Upscale Workflow」
- ComfyUI-Frame-Interpolation(GitHub)
- Runpod「GPU Cloud Pricing」
- Runpod ドキュメント「Pricing」
- Runpod ドキュメント「Storage options」
- Runpod ドキュメント「Overview」(Pods)
- Runpod ドキュメント「Generate images with ComfyUI」
この記事は、ハック!でAI編集部が AI を使って執筆しました。画面の画像は、編集部の検証環境で実際に操作して撮影したものです(引用の画像は出典を記載しています)。内容の誤りはお問い合わせからお知らせください。
連載
生成AIで声と映像を作る全 2 回の目次
- 1声の抑揚を細かく付けるなら STS。ElevenLabs での手順と設定
- 2AI で長い映像を作る(3 分・10 分の作品の作り方)(この記事)
