本文へ移動
ハック!でAI

生成AIで声と映像を作る 第2回

AI で長い映像を作る(3 分・10 分の作品の作り方)

ハック!でAI編集部AIにより執筆読了 約21分
AI で作った架空の 2 人が、オフィスでスマホを見ながら話す場面の動画のコマを並べた画像

この記事でわかること

  • 動画の AI が 1 回で作れる長さと、長い作品の作り方
  • 編集部が約 9 分のドラマのラフを作った手順と GPU の時間
  • 3 分・10 分を Runpod で作るときの費用の目安

確認した環境: ComfyUI 0.39 系 / Wan 2.2 I2V-A14B・InfiniteTalk・Uni3C・FLUX.2 [klein] 4B / 社内の GPU のパソコン(RTX 5060 Ti 8GB)と GPU サーバー(A100 40GB × 3 枚)/ 2026年10月12日に確認

自分の GPU で動かせる動画の生成 AI が 1 回で作れるのは、5 秒前後です。3 分や 10 分の作品は、5 秒前後の場面を何十本も作り、編集でつないで作ります。この記事では、編集部が長いドラマを作ったときの手順と実測の時間をもとに、使える動画のモデル、ComfyUI(画像や動画の AI を動かすアプリ)、GPU を時間で借りられる Runpod の費用の目安を説明します。

1 台本・絵コンテ(LLM と人)、2 場面の絵(画像の生成モデル)、3 5 秒の動き、4 カメラ・長い場面(動画の拡散モデル)、5 口パク・声・音、6 拡大・コマの補間(編集部はまだ)、7 編集でつなぐ(87 場面で 9 分 17 秒のラフ)の 7 つの工程を縦に並べた図
長い映像を作る 7 つの工程と、それぞれで使う AI。動画を作るのは拡散モデルで、LLM は台本や指示文を書くのに使う撮影・作図: 編集部

動画を作る AI と、文章の AI は別のもの

画像や動画を作る AI には、拡散モデルという仕組みのものがあります。ノイズ(ざらざらの点)だけの状態から、少しずつノイズを取り除いて、画像や動画にしていきます。

  • Stable Diffusion は、文章から画像を作る拡散モデルです。公式の GitHub では、VRAM(GPU のメモリ)が 10GB 以上の GPU で動くと説明されています。
  • Stability AI の Stable Video Diffusion は、Stable Diffusion をもとにした動画のモデルです。1 回に作れるのは 14 コマか 25 コマです。
  • この記事で使う Wan 2.2 も、動画の拡散モデルです。公式の説明では、ノイズの多い前半で全体の配置を決めるモデルと、後半で細部を仕上げるモデルの 2 つを切り替えて使います。

LLM(ChatGPT や Claude のような、文章を作る AI)は、動画を作りません。長い映像づくりで LLM が役に立つのは、次のような文章の仕事です。

  • 台本と台詞を書く
  • 場面の一覧(絵コンテ)と、場面ごとの撮り方を書く
  • 画像・動画のモデルに渡す英語の指示文(プロンプト)を書く
  • 何十本もの生成を、順に ComfyUI に頼むプログラムを書く

編集部は、この 4 つを Claude Code(Anthropic の AI の道具)に書いてもらい、担当者の指摘で何度も直しました。台詞は Claude Fable 5.1(Anthropic の LLM)に推敲させ、出てきた案のうち 35 か所を採用しました。

1 回で作れる長さは 5 秒前後

モデルのファイルを手元に置いて、自分の GPU で動かせる動画のモデルを、公式の情報で並べました。どれも、1 回で作れるのは数秒です。

Wan 2.2 TI2V-5B は 121 コマ・24 コマ/秒・720P・24GB 以上、Wan 2.2 I2V-A14B と T2V-A14B は 81 コマ・16 コマ/秒・480P と 720P・80GB 以上、Wan 2.2 S2V-14B は声の長さに合わせる、HunyuanVideo 1.5 は 121 コマ・14GB、LTX-2.5 は映像と音を同時に作る、InfiniteTalk は長さの制限なし、と並べた表
自分の GPU で動かせる主な動画のモデル(2026年10月12日に確認)。長さ・解像度・VRAM は公式の説明と既定の値撮影・作図: 編集部
  • Wan 2.2 の 14B のモデルは、1 回に 81 コマを作ります。16 コマ/秒なので、約 5 秒です。5B のモデルは 121 コマ・24 コマ/秒で、これも約 5 秒です。
  • 表の VRAM は、公式のプログラムをそのまま動かす場合の値です。ComfyUI のドキュメントでは、5B のモデルは 8GB の VRAM でも動くと説明されています。
  • InfiniteTalk は、声に合わせて話す動画を作るモデルです。区切りごとに続けて作る仕組みで、長さの制限なく作れます。
  • ライセンス(使ってよい条件)は、モデルごとに違います。Wan 2.2 と InfiniteTalk は Apache 2.0 です。ComfyUI のドキュメントでは、Wan 2.2 は商用にも使えると説明されています。HunyuanVideo 1.5 のライセンスは、EU・英国・韓国を対象の地域から外しています。LTX-2.5 は、年商 1,000 万ドルを超える組織が商用に使うには、有料の契約が要ります。

編集部の実測: 8GB でも作れるが、解像度で時間が大きく変わる

8GB のパソコンでは Wan 2.2 14B の 640×640・4 ステップが 2 分 30 秒〜2 分 50 秒、5B の 1280×704 が 9 分 27 秒、14B の 960×960 が 21 分、14B の 640×640・20 ステップが 21 分。パソコンと A100 の比較では、動きが 158.9 秒と 56〜57 秒、口パクが 198.8 秒と 58〜59 秒、場面の絵が 14.5 秒と 6.8 秒
1 本を作る時間(編集部の実測)。左は 8GB のパソコンで 5 秒の動画を 1 本作る時間、右は同じ処理をパソコンと GPU サーバーで比べたもの撮影・作図: 編集部
  • 8GB のパソコンで、Wan 2.2 14B で画像から動画を作ると、640×640 で 1 本 2 分 30 秒〜2 分 50 秒でした。960×960 にすると 21 分かかりました。
  • 「4 ステップ(LoRA)」は、少ない回数で作れるように学習させた追加のファイル(LoRA)を使う作り方です。公式の説明では、4 ステップで作れて、20 倍速くなります。使わずに 20 ステップで作ると、640×640 でも 21 分かかりました。
  • 同じ処理を社内の GPU サーバー(A100 40GB)で比べると、動きは約 2.8 倍、口パクは約 3.4 倍速くなりました。

ComfyUI で動かす

ComfyUI は、画像や動画の生成 AI を、ノード(処理の箱)を線でつないで動かすアプリです。つないだ処理の全体を、ワークフローと呼びます。

  • Windows・Linux・macOS で動きます。NVIDIA のほか、AMD・Intel・Apple Silicon などの GPU にも対応しています。
  • 公式の説明では、本体は頼まれたものしかダウンロードせず、インターネットにつながなくても動きます。
  • Wan 2.2・LTX-Video 2 と 2.3・HunyuanVideo 1.5 などの動画のモデルに対応しています。ライセンスは GPL-3.0 です。

Wan 2.2 は、ComfyUI のテンプレート(最初から用意されたワークフロー)に入っています。テンプレートを開いて、モデルのファイルを決められたフォルダに置けば動きます。

ComfyUI の画面。Load Diffusion Model(wan2.2_i2v_high_noise_14B と wan2.2_i2v_low_noise_14B)、Load CLIP、Load VAE、Load Image、CLIP Text Encode、WanImageToVideo、2 つの KSampler (Advanced)、VAE Decode、Create Video、Save Video のノードが線でつながっている
Wan 2.2 14B で画像から動画を作るテンプレート。左でモデルと元の画像を読み込み、中央の 2 つの KSampler で前半と後半を作り、右で動画に保存する。番号は公式ドキュメントの手順の番号出典: ComfyUI 公式ドキュメント「Wan2.2 Video Generation ComfyUI Official Native Workflow Example」(縮小し、上の帯を切り抜いて掲載)

編集部が画像から動画を作るのに使ったファイルは、次のとおりです。ComfyUI の開発元(Comfy-Org)が Hugging Face で配っているもので、ログインせずに取得できました。高ノイズ(high_noise)と低ノイズ(low_noise)の 2 つが、前半と後半を受け持つモデルです。

テキスト
models/diffusion_models/wan2.2_i2v_high_noise_14B_fp8_scaled.safetensors   (14.3GB)
models/diffusion_models/wan2.2_i2v_low_noise_14B_fp8_scaled.safetensors    (14.3GB)
models/loras/wan2.2_i2v_lightx2v_4steps_lora_v1_high_noise.safetensors
models/loras/wan2.2_i2v_lightx2v_4steps_lora_v1_low_noise.safetensors
models/vae/wan_2.1_vae.safetensors
models/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors

ComfyUI には、画面のほかに、プログラムから依頼を送る窓口(API)もあります。編集部は、場面ごとに絵と指示文を差し替えた依頼をプログラムで作り、何十本もまとめて送りました。

長い映像の作り方

1. 台本と場面の一覧を作る

最初に、台本を場面に分けた一覧(絵コンテ)を作ります。場面ごとに、画の種類(引き・中・寄りなど)、撮り方(カメラの位置と動き)、台詞を決めます。ここが決まると、場面ごとに、どのモデルで作るかが決まります。

番号・画・場面のイメージ・撮り方・台詞・作り方の表。1-5 は口パク(2 人)、1-7 は動きとカメラ、1-10 は口パク(1 人)、2-2 は最後のコマからつなぐ(22 秒)、2-13 は動きとカメラ、1-15 は編集で作る
場面の一覧の例。画の種類・撮り方・台詞から、作り方(口パク・動き・つなぐ・編集)が決まる撮影・作図: 編集部

編集部のドラマは、7 章・99 場面で、予定の長さは 13 分 15 秒です。1 回目の台本は「単調」と指摘され、構成から書き直しました。2 回目からは、絵と声を作る前に、場面のイメージと台本だけを文章で固めています。絵や動画を作ったあとで台本を変えると、その場面の素材は作り直しになります。

2. 場面の絵を作り、人物をそろえる

動画は、場面の最初の絵(キーフレーム)から作ります。先に絵を作ると、構図や人物を確かめてから動画に進めます。

場面ごとに別々に絵を作ると、同じ人物でも顔や服が変わります。編集部は、次の 3 つでそろえました。

  • 人物ごとに、正面・斜め・横顔・全身の見本の画像を作り、場面の絵を描くときに参照させる
  • 服と髪の説明は、毎回同じ英文で書く
  • 画風の文(写真のような質感・縦長 9:16・文字やロゴを入れない、など)は、全部の場面で同じものを付ける
上に、主人公の見本の画像 4 枚(正面・斜め・横顔・全身)と、服と髪を書いた英文。下に、見本なしで構図だけ描いた絵、それをぼかした配置の手本、2 人の見本、できた絵、見本だけで描いた引きの絵が並んでいる
人物の見本(上)と、構図の手本を一緒に渡して描いた場面の絵(下)。人物はすべて AI で作った架空の人物撮影・作図: 編集部

見本だけを渡して描くと、人物が中央で正面を向いた、引きの絵になりやすいことがわかりました。そこで、先に見本なしで構図だけの絵を作り、それをぼかして「配置の手本」にして、見本と一緒に渡しています。画像のモデルは FLUX.2 [klein] 4B です。公式の説明では、複数の画像を参照して描けます。

人物の画像で LoRA を作って、モデルに人物を覚えさせる方法もあります。たとえば HunyuanVideo 1.5 は、LoRA を学習させるためのプログラムを公開しています。編集部は人物の LoRA は作らず、見本の画像を参照させる方法にしました。

3. 5 秒の動きを、場面ごとに作る

場面の絵と動きの指示文から、Wan 2.2 で 81 コマ(約 5 秒)の動画を作ります。指示文には、人の動きだけでなく、カメラがどう動いて、どこで終わるかまで書きます。次は、場面 1-7 の指示文です(長いサーバーの通路を、奥の男へゆっくり進む。両側で青い LED が流れていく)。

テキスト
Slow dolly in down the long server aisle toward the man at the far end; blue LEDs blink past on both sides.

4. カメラの動きを付ける

指示文だけでは、カメラの動きが弱いことがあります。編集部は、カメラの動きを指定する追加のモデル Uni3C を使いました。場面の絵から奥行きを推定して点の集まりにし、決めた軌道でカメラを動かした「お手本の動画」を作って、Wan 2.2 に渡します。

1-7 では、サーバー室の通路で奥の人物に向かって進むお手本と、同じように進む動画。2-13 では、夜の屋上でフードの男の背中から回り込むお手本と、男が振り向く動画。それぞれ 0・40・80 コマ目が並んでいる
カメラの動きのお手本(左)と、できた動画(右)。上はゆっくり前進、下は回り込み。お手本の黒い所は、元の絵に写っていなかった所撮影・作図: 編集部
  • 動きは、前進・後退・横移動・上下・パン(首振り)・ティルト(上下の首振り)・回り込み・ズーム・手持ちの揺れを組み合わせました。
  • カメラの動きを付けた 41 本のうち、寄りとズームの 19 本は、お手本に網目が出たのを直して作り直しました。
  • カメラの動きを学習させた別のモデル(Wan2.2 Fun Camera)も試しました。軌道ははっきり出ましたが、光が白く飛ぶ崩れが出て、1 本に約 450 秒(LoRA なし・20 ステップ)かかりました。

5. 5 秒より長い場面は、最後のコマからつなぐ

台詞が 5 秒より長いのに、話す人が画面に映らない場面は、5 秒の動画を何本かつなぎます。2 本目からは、前の動画の最後のコマを最初の絵にして作ります。カメラのお手本は場面全体の長さで作り、区切りごとに同じ範囲を渡しました。

オフィスの場面を 5 つの区切りに分け、それぞれ最初と最後のコマを並べた図。下のグラフでは、彩度が最初の 57 から最後の 106 まで上がっている
22.2 秒の場面を 5 回に分けて作った例と、コマごとの色の濃さ(彩度)。区切りを重ねるほど色が濃くなった撮影・作図: 編集部
  • 区切りの境目(79 コマ目と 80 コマ目)は、つながって見えます。
  • 区切りを重ねると、色が濃くなる場面がありました。同じ方法で作った 11 場面のうち 5 場面で、最後の区切りの彩度が、最初の区切りより 1 割以上高くなりました(最大 1.5 倍)。
  • 途中から知らない人物が出てくる場面や、人物が画面から外れる場面もありました。長い場面は、区切りごとに確かめて、作り直すかを決めます。

6. 口パク・声・音を付ける

台詞のある場面は、InfiniteTalk で口パクの動画を作ります。場面の絵と台詞の声を渡すと、声に合わせて口・表情・頭が動きます。編集部は Uni3C も一緒に使い、話しながらカメラが寄る動画にしました。

オフィスで 2 人の女性がスマホを見ている場面の 0.0・2.0・5.0・7.1 秒のコマ。下に、美咲の台詞が 0.3 秒から 6.6 秒まで、結衣は無音、区切りは 81・72・26 コマと書かれた帯
口パクの場面の例(7.2 秒)。右の美咲にだけ台詞の声を渡し、左の結衣には無音を渡した。下の帯は台詞と、作った区切り撮影・作図: 編集部
  • 2 人が映る場面は、左右の人に別々の声を渡すノードを用意しました。話さない人には無音を渡すと、口を閉じたままになります。
  • 576×1024 で作ると、480×832 より、長い場面で顔が崩れにくかったので、576×1024 にしました。
  • 声は、全 84 行の台詞を担当者が自分で読んで録音し、AI で役の声に変えました。効果音 29 種類と、BGM 8 曲(7 章ぶんと、短い曲 1 曲)も AI で作りました。声・効果音・BGM には、クラウドのサービス(ElevenLabs)を使っています。

7. 拡大とコマの補間で仕上げる

Wan 2.2 の 14B のモデルは 16 コマ/秒で、編集部の動画は 480×832 や 576×1024 です。仕上げで大きく・なめらかにするのが、拡大とコマの補間です。編集部の確認用のラフでは、まだ行っていません(16 コマ/秒の動画を 25 コマ/秒に合わせるときは、同じコマをくり返して並べています)。ここでは、公式の情報だけを紹介します。

  • 拡大: ComfyUI には、拡大のモデル(RealESRGAN など)で画像を大きくするノード(Load Upscale Model と Upscale Image (using Model))があります。編集部のワークフローでも、動画はコマごとの画像として出てきます。
  • モデルに付いている拡大: HunyuanVideo 1.5 には 1080P に拡大するモデル、LTX-2.5 には解像度とコマ数をそれぞれ 2 倍にするモデルがあります。
  • コマの補間: コマとコマの間のコマを作って、動きをなめらかにします。ComfyUI の追加ノード「ComfyUI-Frame-Interpolation」は、RIFE や FILM などの補間のモデルに対応しています。

8. 編集でつなぐ

最後に、場面の動画を台本の順につなぎます。編集部は、場面の一覧の順に動画をつなぐ短いプログラム(Python)で、確認用のラフを作りました。左上に場面の番号を入れて、作り直す場面を見つけやすくしています。

プロローグから第 5 話、エピローグまでの 7 行に、場面を色の帯で並べた図。口パク 41 場面・5 分 4 秒、声あり・話す人が映らない 13 場面・1 分 25 秒、動きだけ 33 場面・2 分 47 秒、まだ作っていない 12 場面
87 場面をつないだ確認用のラフ(約 9 分 17 秒)。横の長さが場面の長さ、色が作り方。灰色はまだ作っていない場面撮影・作図: 編集部

87 場面で約 9 分 17 秒になりました。1 場面の平均は約 6.4 秒です。黒い画面や画面の文字など、まだ作っていない 12 場面は、生成 AI では作らず、編集で作る場面です。

作る時間: 編集部の実測

社内の GPU サーバー(A100 40GB を 3 枚)で、1 本を作るのにかかった時間です。

作ったもの 大きさ・長さ A100 1 枚での時間
場面の絵(FLUX.2 [klein] 4B) 768×1344・1 枚 平均 6.8 秒
動き(Wan 2.2・3 段階) 480×832・81 コマ(約 5 秒) 約 97 秒
動き+カメラ(Uni3C) 480×832・81 コマ(約 5 秒) 約 100〜110 秒
長い場面(最後のコマからつなぐ) 480×832・11 場面・合計 1 分 53 秒 合計 6,905 秒
口パク+カメラ(InfiniteTalk・Uni3C) 576×1024・41 場面・合計 5 分 4 秒 合計 17,606 秒

表の長さは、作った動画の長さです。確認用のラフでは台詞の長さに合わせて切っているため、図の場面ごとの長さとは一致しません。

  • 映像 1 秒あたりにすると、口パクは約 58 秒、長い場面は約 61 秒です。動きだけの場面(約 19 秒)の 3 倍ほどかかりました。
  • 9 分 17 秒のラフのために GPU を使った時間は、試しと作り直しを含めて合計 45,933 秒(約 12.8 時間)でした。ラフに使った動画を作った時間は約 7.8 時間で、残りの約 5 時間は、場面の絵・試し・作り直しです。
  • 3 枚の GPU で並べて作り、最初の依頼から最後の完成までは約 6 時間 10 分でした。

Runpod で GPU を借りる

Runpod は、GPU を 1 秒単位の料金で借りられるクラウドのサービスです。借りた 1 台のサーバーを Pod と呼びます。GPU を持っていなくても、ComfyUI のテンプレートで ComfyUI を動かし、使うモデルを入れて作れます。Runpod の公式の手順では、例として画像のモデル(SDXL-Turbo)を ComfyUI で動かしています。

Pod には 2 つの種類があります。

  • Secure Cloud: T3・T4(設備の信頼性の等級)のデータセンターで動きます。公式の説明では、信頼性と安全性が高く、仕事や本番の用途に向いています。
  • Community Cloud: 個人などが提供する GPU を、審査された仕組みを通して借ります。料金は Secure Cloud より安くなっています。

料金の例です(1 時間あたり・米ドル。2026年10月12日に料金ページで確認。料金ページの更新日は 2026年9月27日)。

GPU VRAM Secure Cloud Community Cloud
RTX 4090 24GB 0.89 ドル 0.34 ドル
RTX 5090 32GB 1.19 ドル 0.69 ドル
L40S 48GB 1.09 ドル 0.79 ドル
A100 PCIe 80GB 1.79 ドル 1.19 ドル
A100 SXM 80GB 1.79 ドル 1.39 ドル
H100 PCIe 80GB 2.89 ドル 1.99 ドル
GPU の一覧。B300 が 8.99 ドル、H200 が 5.29 ドル、B200 が 7.99 ドル、RTX Pro 6000 が 2.49 ドル、H100 NVL が 3.19 ドル、H100 PCIe が 2.89 ドル、H100 SXM が 3.99 ドル、A100 PCIe と A100 SXM が 1.79 ドル(いずれも 1 時間あたり)
Runpod の料金のページ。右上で Community Cloud と Secure Cloud、1 時間と 1 秒の表示を切り替えられる(この画面は Secure Cloud・1 時間あたり)出典: Runpod「GPU Cloud Pricing」(一部を切り抜いて掲載)

最新の料金は、Runpod の料金ページで確かめてください。

ComfyUI のテンプレートで始める

Runpod のドキュメントの手順を、短くまとめました。

  1. クレジットを入れる

    Runpod のアカウントを作り、10 ドル以上のクレジット(前払いの残高)を入れます。Pod を起動するには、選んだ構成の 1 時間ぶん以上の残高が要ります。

  2. GPU とテンプレートを選ぶ

    Pods の画面で GPU を選び、テンプレートで「ComfyUI」を選びます。RTX 5090 と B200 は「ComfyUI Blackwell Edition」です。モデルや出力を残したいときは、ここでネットワークボリュームを付けます。あとから付けることはできません。

  3. 起動して ComfyUI を開く

    On-Demand で起動し、「Connect」から「Connect to HTTP Service [Port 8188]」を選ぶと、ブラウザで ComfyUI が開きます。初回は、起動に最大 30 分かかります。

  4. モデルを入れて作る

    テンプレートにはモデルが入っていません。ComfyUI Manager から、使うモデルを入れます。

  5. 終わったら止める

    作ったワークフローを自分のパソコンに保存してから、Pod を止めます。

GPU・コンテナディスク・ボリュームディスク・ネットワークボリュームについて、動かしている間・止めたとき・消したときの料金と、中身が残るかを並べた表
Runpod の保存の場所と、止める・消すの違い撮影・作図: 編集部

3 分と 10 分の目安

編集部の実測をもとに、3 分と 10 分の作品を Runpod の A100 で作る場合を計算しました。

3 分は GPU 約 4.1 時間・止めずに置くと約 6.0 時間、10 分は約 13.8 時間・約 20.0 時間の棒グラフ。表では、3 分が場面約 28 本・Secure Cloud 約 7.4 ドル・Community Cloud 約 4.9 ドル、10 分が場面約 94 本・約 24.6 ドル・約 16.4 ドル
3 分と 10 分を Runpod の A100 で作る場合の目安。棒は GPU を使う時間の内訳、表は場面の数と費用撮影・作図: 編集部

計算の前提は、次のとおりです。

  • 完成した映像 1 秒あたりの GPU の時間は、編集部の実測で約 83 秒です(試しと作り直しを含む。台詞の多いドラマで、口パクは 576×1024)。
  • 1 場面の長さは、編集部のラフの平均の約 6.4 秒です。
  • 編集部の GPU は A100 40GB です。Runpod の A100(80GB)でも同じ速さと仮定しました。80GB で速くなるかは確かめていません。
  • 料金は、Secure Cloud の A100(1 時間 1.79 ドル)と、Community Cloud の A100 PCIe(1 時間 1.19 ドル)です。声・効果音・BGM、モデルのダウンロード、初回の起動の時間は含めていません。
3 分 10 分
場面の数 約 28 本 約 94 本
GPU を使う時間 約 4.1 時間 約 13.8 時間
GPU を 3 枚同時に使ったときにかかる時間 約 1.4 時間 約 4.6 時間
費用(Secure Cloud) 約 7.4 ドル 約 24.6 ドル
費用(Community Cloud) 約 4.9 ドル 約 16.4 ドル
  • 結果を見て直している間も Pod を動かしたままにすると、その時間も料金がかかります。編集部の GPU が実際に動いていたのは、確保していた時間の約 69% でした。同じ割合なら、10 分で約 20 時間・約 35.8 ドル(Secure Cloud)です。
  • モデルを置くネットワークボリューム(100GB)に、別に月 7 ドルかかります。編集部の ComfyUI のモデルは、合わせて約 69GB でした。
  • 8GB のパソコンでは、1 本あたり 2.8〜3.4 倍の時間がかかりました。単純に計算すると、3 分で約 12〜14 時間、10 分で約 39〜47 時間です。576×1024 の口パクが 8GB で作れるかは、確かめていません。

10 分になると変わること

3 分なら場面は 30 本ほどですが、10 分では 100 本近くになります。編集部は、次のようにして数を回しました。

  • 場面の番号をそのままファイル名にして、素材を管理する。つなぐときも、番号と台本の順で自動でつなぐ
  • 1 本ずつ画面で操作せず、場面の一覧の指示文から依頼を作り、プログラムでまとめて送る
  • GPU を何枚か並べて、別々の場面を同時に作る。1 つの場面の中は、前の区切りの続きから作るので、順番にしか進まない
  • 途中で全体をつないで見て、作り直す場面を選ぶ

長く作るときに気をつけること

作り直しは、どの工程でも出ます。編集部の場合、GPU を使った時間の約 4 割は、場面の絵と、試し・作り直しの分でした。時間と費用は、作り直しを含めて見積もってください。

連載「生成AIで声と映像を作る」では、声の抑揚の付け方も紹介しています。

参考にした公式の情報

XFacebookはてブLINE

この記事は、ハック!でAI編集部が AI を使って執筆しました。画面の画像は、編集部の検証環境で実際に操作して撮影したものです(引用の画像は出典を記載しています)。内容の誤りはお問い合わせからお知らせください。

連載

生成AIで声と映像を作る
全 2 回の目次
  1. 1声の抑揚を細かく付けるなら STS。ElevenLabs での手順と設定
  2. 2AI で長い映像を作る(3 分・10 分の作品の作り方)(この記事)

あわせて読みたい