動画生成AIで広告を作るとき、迷うのは「どのモデルを使うか」と「何本も作るときの設計」だ。本記事では、LIF Techを運営する株式会社LIFRELLがオンラインサービスの縦型動画広告を制作したときの記録をもとに、172本分の台本の作り方、Kling 3.0とSeedance 2.5を同じ条件で作って比べた結果、実際の納品で使った作り方と、途中で出た課題までを具体的に解説する。
この記事の前提:2026年9〜10月の制作記録にもとづく。動画・画像の生成はHiggsfield経由で行い、費用は同サービスのクレジットで記録している。クライアント名は伏せている。比べたのは2026年10月時点のKling 3.0とSeedance 2.5で、新しい版の情報も出ているため、使う前に同じ条件で比べ直すことをおすすめする。
この記事でわかること
- AIで動画広告を作る全体の流れ(図解)
- 何本も作るための台本の設計(172本分の台本の作り方)
- 人物がぶれにくく、日本らしく見えるプロンプトの書き方
- Kling 3.0とSeedance 2.5を同じ条件で比べた結果(費用・画質・指示の守り方)
- 費用を抑える作り方と、実際に出た課題・対処
- 広告に使うときの注意点
結論:モデル選びより「作り方の設計」で質と費用が決まる
| やったこと | 結果・分かったこと |
|---|---|
| 台本を172本分設計 | 7つの悩みのテーマで80篇を作り、60秒版と40秒版を対にした(160本)。ほかに20秒・45秒の版が12本。40秒版は60秒版と同じ素材を使う設計にし、生成は60秒版の分だけで済むようにした |
| Kling 3.0とSeedance 2.5を同じ静止画・同じ指示で比較 | Kling 3.0は7.5クレジット・ほぼ1080p・指示どおりの動き。Seedance 2.5は32.5クレジット・720p・手を早めに下ろしてしまった。今回の用途ではKling 3.0に統一 |
| 試作の1本(28秒) | 静止画と動画あわせて約70クレジットで完成 |
| 実際の納品 | 人物は生成した静止画、タブレットの画面は本物のサービス画面の録画をはめ込み、ナレーションは合成音声で制作。実在しない画面は作らない |
1. AIで動画広告を作る全体の流れ(図解)
実際に回した流れは次のとおりだ。ポイントは、AIに全部を作らせないことにある。文字・ロゴ・サービスの画面のように、AIが苦手なものや作ってはいけないものは、最初から「後で合成する」と決めておく。
青=AIで作る工程、黄=人が作業・確認する工程。
2. 何本も作るための台本の設計——172本分の台本の作り方
台本は、利用者の悩みのテーマ(7つ)ごとに80篇を作り、同じ篇の60秒版と40秒版を隣り合わせに並べて管理した。ほかに20秒・45秒の版が12本あり、合計172本だ。
1本の台本に書いた項目
| 項目 | 中身 |
|---|---|
| 訴求・ターゲット | 誰の、どんな迷いに答える動画か |
| 冒頭のひとこと(フック) | 最初の数秒で止めてもらうための一言 |
| ストーリーとトーン | 大げさにしない、回復を強調しすぎないなど、語り方の方針 |
| 事実の根拠と表現のガード | 出典のページ、使ってよい数字・事実、使ってはいけない表現(ページに書かれていないこと)、改変してはいけない原文の引用 |
| カット割り | 秒数・ナレーション・映像のイメージ・テロップや編集の指示 |
| 生成プロンプト | カットごとの動画生成用プロンプト(英語)。生成しないカットは「生成不要」と明記 |
とくに大事だったのが「使ってはいけない表現」の欄だ。体験談をもとにした広告では、元のページに書かれていない数字や結果(たとえば「完治した」「悩みがなくなった」)を足した瞬間に事実と違う広告になる。台本の段階で、使える事実と使えない表現を書き分けておくと、制作中の判断がぶれない。
40秒版は「60秒版から削るだけ」にした
40秒版は、60秒版から経緯や補足のカットを削った構成にし、ナレーションと映像のプロンプトを60秒版と同じにした。生成するのは60秒版の分だけで、40秒版は編集の組み替えで作れる。生成の費用はほぼ半分で済む。
3. 生成プロンプトの書き方——人物がぶれず、日本らしく見せる
プロンプトは全92本(80篇と短い版12本)・945カット分を書いた。書き方のルールは次の5つだ。
① 「共通スタイル+キャスト+カットの指示」の3層にする
各カットのプロンプトは、全カット共通のスタイル、その篇で固定する登場人物の描写、そのカットの指示を自動でつなげて作った。人物の描写(年齢・髪型・服装)を全カットに同じ文で入れることで、カットごとに別人になるのを防ぐ。
【共通スタイルの例】 STYLE: Photorealistic cinematic documentary. Japanese people, Japanese residential interiors. Natural soft light, muted warm color grade, shallow depth of field, 35mm lens, subtle handheld. IMPORTANT: no on-screen text, no subtitles, no captions. 【キャストの例(その篇の全カットに入れる)】 CAST: Japanese mother in her early 40s, shoulder-length dark hair, beige cardigan; Japanese teenage girl, 14, long black hair, gray loungewear.
② 文字は一切生成させない
AIが映像の中に作る日本語の文字は崩れやすい。すべてのプロンプトに「画面に文字を出さない」と入れ、テロップは編集で載せる前提にした。
③ 画面・ロゴは生成させず、後で合成する
タブレットやスマホの画面は白く光る何も映っていない画面で生成し、あとから本物のサービス画面の録画をはめ込む。ロゴも生成させず、公式の素材を使う。サービスの画面をAIに作らせると、実在しない機能を見せることになり、広告として問題になるからだ。
④ プロンプトは英語、日本らしさは具体的な単語で足す
演出の指示(手前で洗濯物をたたむ人、奥でピントの外れた家族など)は英語のほうが意図どおりに出やすいと考え、英語で書いた。一方で、海外のモデルは家の中や顔立ちが日本らしくなくなることがある。そこで、カットごとに玄関(genkan)、こたつ(kotatsu)のような日本固有の物を具体的に書き込んだ。
⑤ 先に人物の静止画を決め、それをもとに動画にする
同じプロンプトでも、生成のたびに顔が少し変わることがある。そこで、まず静止画で人物を作り、気に入った1枚を参照画像にして動画を作る流れにした。実際の試作でも、静止画2枚で同じ人物に見えること、日本の住宅らしさ(エアコン、フローリング、レースのカーテン)が出ていることを先に確認してから動画にした。
4. Kling 3.0とSeedance 2.5を同じ条件で比べた結果
モデルの比較記事は多いが、条件がそろっていないと参考にならない。今回は同じ静止画を起点に、同じ動きの指示で両方に動画を作らせ、費用・画質・指示の守り方を比べた(2026年10月、Higgsfield経由)。
| 比べた項目 | Kling 3.0 | Seedance 2.5 |
|---|---|---|
| 費用(1カット) | 7.5クレジット | 32.5クレジット(約4.3倍) |
| 出力の解像度 | ほぼ1080p | 720p |
| 指示した動きの守り方 | 指示どおりに動いた | 手を指示より早く下ろしてしまった |
| 顔の安定(別人にならないか) | 良好 | 良好 |
1カットあたりの費用(クレジット)
7.5
32.5
今回の用途(人物が少し動くだけの、落ち着いた生活シーン)では、安くて解像度が高く、指示どおりに動いたKling 3.0に統一した。Seedance 2.5が劣るという意味ではない。大きな動きやカメラワークの多い映像なら結果が変わる可能性はあり、それは今回は試していない。
1本の動画の中でモデルを混ぜない
カットごとに得意なモデルを使い分けたくなるが、モデルが変わると色味・肌の質感・動きのクセが変わり、つないだときに別の映像に見えやすい。モデルを切り替えるなら、カット単位ではなく動画1本単位(またはシリーズ単位)にすると判断しやすい。
自分で比べるときの手順
- 使う予定の場面に近い静止画を1枚決める(これが比較の起点)
- 動きの指示を1文で書く(例:人物がゆっくり手を下ろし、隣の人の方を見る)
- 同じ静止画・同じ指示・同じ秒数で、各モデルに1本ずつ作らせる
- 「費用」「解像度」「指示どおりか」「顔が変わらないか」の4項目を表にする
- 本番に近い長さの試作を1本作り、合計費用を記録してから量産に入る
5. 費用を抑える考え方——「全部を動画で生成しない」
試作の1本(28秒)は、静止画と動画をあわせて約70クレジットで完成した。費用を抑えられた理由は、生成する部分を絞ったことにある。
AIで生成する
人物と生活シーン。動きが必要なカットだけ動画にし、残りは静止画
本物の素材を使う
サービスの画面の録画、ロゴ、料金などの表記
編集で作る
テロップ、図、ナレーション(音声合成は動画生成とは別に用意)
- 静止画で足りるカットは動画にしない:表情や場面を見せるだけのカットは、静止画にゆっくりしたズームをかけるだけで十分なことが多い
- 40秒版・短尺版は組み替えで作る:60秒版の素材を使い回せば、追加の生成はほぼいらない
- ナレーションは動画生成に含めない:音声は別の音声合成で作り、編集で重ねる。差し替えも簡単になる
- 単価は解像度と秒数で決まる:別の企画で見積もったWan 3.0(Higgsfield経由)は、480pが1秒1クレジット、720pが1秒1.75クレジットだった。秒単位で課金されるモデルは、生成する秒数を減らすのがいちばん効く
その別企画(話している人物の口元を音声に合わせる、いわゆるリップシンクの動画を10本)の見積もりでは、480pで1本約39クレジット、720pで約63クレジットになった。口元を合わせる秒数を35秒から25秒に減らし、そのぶん生活シーンの静止画を増やすと1本29クレジットまで下がる計算だった。
6. 実際の納品の作り方——人物素材ライブラリと「画面のはめ込み」
量産を始めると、同じ人物ばかりが映って見た人が飽きる、という問題が出た。そこで、画像生成AI(Nano Banana 2)で人物素材を26点作り、ライブラリとして管理した。
| 分類 | 点数 | 中身の例 |
|---|---|---|
| 合成用プレート | 6 | タブレットの画面が白く光っている場面。年代・性別・時間帯を変えて用意 |
| ひとりの場面 | 8 | 手が止まる、机に伏せる、夜に調べものをするなど、悩み別 |
| 家族の場面 | 4 | 言い合いになる、隣で付き添って疲れる、朝の玄関で動けない など |
| 家族ひとりの場面 | 4 | 夜にスマホで調べる、書類を見つめる など |
| 屋外の場面 | 4 | 帰り道の後ろ姿、建物の前で立ち止まる など |
画面のはめ込みは「四隅の座標」を素材と一緒に保存する
合成用プレートでは、タブレットの画面の四隅の座標を自動で検出し、画面の形とのずれが最小になるまで調整してファイルに保存した。画面の形と四隅で囲んだ形の重なり具合(IoU)は、使った5点で0.931〜0.984。編集のプログラムにこの座標を渡すだけで、本物のサービス画面の録画を傾きに合わせてはめ込める。
画面が白く光るタブレットの場面を作る
画面の四隅を自動で探し、重なりが最大になるよう追い込む
実際に録画をはめ込み、見えるかを人が確かめる
四隅の座標をファイルに残し、以後は使い回す
③の確認は省けない。あるプレートは四隅の検出は正しかった(IoU 0.952)が、タブレットが寝すぎていて画面がほぼ真横からになり、はめ込んだ内容が読めなかった。数値は合格でも使えない素材がある、という教訓で、このプレートは合成に使わず「利用シーンの映像」としてだけ使うことにした。
納品で守ったルール
- サービスの画面は提供された本物の画面の録画だけを使う。架空の画面は作らない
- 人物はすべてAI生成で、実在の人物ではない。体験談の体裁で使う動画には「再現映像です」の注記を入れる
- 1本の動画の語り手は1人の声に統一する(声が途中で変わると、誰の話か分からなくなる)
7. 見えた課題と、どう対処したか
試作から納品までには、思った以上に修正の往復があった。たとえば35秒の型の1本は、確認と修正を18回重ねている。よく出た課題と対処をまとめる。
| 課題 | 原因 | 対処 |
|---|---|---|
| 白いテロップが読めない | 明るい室内の映像に白い文字が溶ける | 文字の下に帯を敷くか、映像を少し暗くしてから文字を載せる |
| 縦長の端末に横長の画面が映る | 提供された録画が横長で、縦に持ったタブレットに合わない | 録画から必要な部分だけを切り出してはめ込む |
| 四隅は合っているのに中身が見えない | 画面の角度が浅すぎる | 合成用には画面が大きく正面に近いプレートを使う(上記の手元アップなど) |
| 文字・ロゴが崩れる | 生成AIは日本語の文字やロゴの再現が苦手 | プロンプトで文字を禁止し、テロップとロゴは編集で載せる |
| 家や顔が日本らしくない | モデルの学習データの偏り | 玄関・こたつなど日本固有の物をプロンプトに入れる |
| 同じ人物ばかりで飽きる | 最初に作った少数の素材を使い回した | 年代・悩み・役を散らした26点のライブラリを作る |
| 生成が途中で失敗する | 生成サービス側の一時的なエラー | やり直す前提で、締め切りに余裕をもって生成する |
8. AI動画を広告に使うときの注意点
- 体験談の内容は元の資料にある事実だけ:AIで映像を作れても、話の中身は実在の声や公式の情報にもとづく。台本の段階で「使ってよい事実」「使ってはいけない表現」を分けておく
- 再現映像であることを明記:AIで作った人物が体験を語る形にするなら、実在の利用者と誤解されないよう注記を入れる
- 実在の人物に似せない:有名人や特定の人を思わせる見た目にしない。生成した人物が誰かに似ていないかも人の目で確認する
- サービスの画面・効果を盛らない:実在しない機能の画面や、資料にない成果を映像で見せると、事実と違う広告になる
- 各サービスの利用規約を確認:動画生成・画像生成・音声合成それぞれで、商用利用の可否や表記の条件が決まっている。使う前に最新の規約を確認する
- 広告の表現ルール:健康・金融などのジャンルは、広告の表現に関するルールや各広告媒体の審査基準も確認しておく
この記事で使った管理シート(無料ダウンロード)
本記事の制作で実際に使った台本の設計シートと進行管理の表を、テンプレートにした。書き方の例を入れた「記入例」シートと、空欄の記入用シートが入っているので、使い方を見ながら自社用に書き換えて使える。
【無料ダウンロード】動画広告の台本設計シート(Excel)
基本設計・事実の根拠と表現のガード・生成のルール・カット構成・40秒版・台本インデックスの6シート。体験談の広告で「使ってよい事実」と「使ってはいけない表現」を書き分ける欄つき。


【無料ダウンロード】AI動画制作の進行管理シート(Excel)
素材の依頼表・秒単位の構成表・音声(話し方の指示つき)・進捗の4シート。AIで作るものと本物の素材を使うものを分けて管理できる。


【無料ダウンロード】動画生成AIの生成キューとコスト管理表(Excel)
動画生成AIに頼むカットを1行ずつ並べ、モデル・解像度・秒数・プロンプトと、使ったクレジットを一緒に管理する表です。予算の残りが行ごとに自動で出るので、作り直しが続いても使いすぎに早く気づけます。
入っているシート:生成キュー・モデル別の単価メモ・プロンプトの型・コストを抑える工夫(ほかに「はじめに」と記入例)。


まとめ
AIで動画広告を量産するとき、効いたのはモデル選びそのものより作り方の設計だった。台本で事実と表現の線を引き、プロンプトを3層にして人物を固定し、文字・ロゴ・画面は後から本物を載せる。モデルは同じ条件で比べてから決め、1本の中では混ぜない。全部を動画で生成せず、静止画・本物の素材・編集を組み合わせれば、費用も修正の手間も抑えられる。
声の作り方はAI動画の音声を差し替える方法(アフレコ)とAIナレーションが片言になる原因と直し方で詳しく書いている。
AIで広告・動画をつくる体制を、自社にも
この記事で紹介した制作の進め方(台本の設計、AIで作る部分と本物の素材を使う部分の分け方、確認の手順)を、広告のバナーや動画の量産に使っています。社内で同じ体制を作りたい、まず数本作ってほしい、という相談を受け付けています。
運営:株式会社LIFRELL
スライドとAI音声でYouTube動画を量産する制作ラインは、YouTube動画をAIで量産する方法で解説している。
広告・動画の制作でAIを使った実例は、AIで広告・動画をつくる実例まとめに工程ごとにまとめている。
この記事で紹介したものを含め、実務で使っている依頼文とプロンプトはAI業務の依頼文・プロンプトテンプレート集にまとめている。
よくある質問
Q. AIで動画広告を作るには、何から始めればいいですか?
A. 最初に台本を書き、AIで生成する部分と本物の素材を使う部分を分けます。文字・ロゴ・サービスの画面は生成させず、人物と生活シーンだけを生成するのが基本です。そのうえで使う場面に近い静止画を1枚作り、本番に近い試作を1本作って費用を記録してから量産に入ります。
Q. Kling 3.0とSeedance 2.5はどちらがいいですか?
A. 用途によります。2026年10月に同じ静止画・同じ指示で比べたところ、Kling 3.0は1カット7.5クレジット・ほぼ1080p・指示どおりの動き、Seedance 2.5は32.5クレジット・720p・手を早めに下ろす結果でした。人物が少し動く落ち着いた場面ではKling 3.0が向いていました。大きな動きの映像では試していません。
Q. AI動画広告の費用はどのくらいかかりますか?
A. 生成する秒数と解像度で決まります。今回の試作1本(28秒)は静止画と動画あわせて約70クレジットでした。静止画で足りるカットを動画にしない、短い版は長い版の素材を組み替えて作る、ナレーションは別の音声合成で作る、の3つで費用を抑えられます。
Q. AIで作った人物がカットごとに別人になるのを防ぐには?
A. プロンプトを「共通スタイル+登場人物の描写+カットの指示」の3層にし、人物の描写を全カットに同じ文で入れます。さらに、先に静止画で人物を決め、その画像を参照して動画を作ると安定します。
Q. AI動画に日本語のテロップやロゴを入れられますか?
A. 生成AIは日本語の文字やロゴの再現が苦手なので、プロンプトで文字を禁止し、テロップとロゴは編集で載せるのが確実です。ロゴは公式の素材を使います。
Q. AIで作った動画を広告に使うときの注意点は?
A. 体験談の中身は元の資料にある事実だけを使い、AIで作った人物には「再現映像」の注記を入れます。実在の人物に似せない、実在しない機能の画面を作らない、各生成サービスの商用利用の規約を確認する、の3点も必要です。
