動画生成AIで作った映像は、絵はきれいでもセリフや声が崩れることが多い。そこで「生成された音声をいったん全部消し、声だけ別のAIで作り直す(アフレコする)」という方法が広がっている。本記事では、SNSで公開されたAI縦型ドラマの作り直し版を実際に測って分かったことと、LIF Techを運営する株式会社LIFRELLが動画広告の制作で声を別に作った記録をもとに、AI動画の音声を差し替える手順、声の選び方と費用、つまずきやすい点を解説する。
この記事の前提:2026年8〜9月の記録にもとづく。前半の分析対象は、SNSで公開された他者の作品(AI縦型ドラマの音声作り直し版)で、こちらでファイルを測定した結果を書いている。後半の制作例は自社の受託案件で、クライアント名は伏せている。声の合成はHiggsfield経由で行い、費用は同サービスのクレジットで記録した。各サービスの料金・声の数は記録時点のもので、変わることがある。
この記事でわかること
- AI動画の音声を「消して作り直す」と何が直り、何が直らないか
- 公開されたAI動画を測って見つかった、作り直し後も残った問題6つ
- AI動画に声を後から付ける手順(図解)
- 音声合成の声の選び方と、1本あたりの費用の目安(実測)
- 音声の付け方3パターンと、使う道具の種類
- 字幕の作り方の基本と、よくある失敗
- 字幕・効果音・BGM・書き出しで失敗しないためのチェック項目
結論:声は作り直せるが、「誰が話しているか」は映像の段階で決まる
| アフレコで直るもの | アフレコでは直らないもの |
|---|---|
| 声の質(片言・聞き取りにくさ)、セリフの言い回し、役ごとの演じ分け、話す速さ、BGMや効果音とのバランス | 画面で口を動かしている人物。別の人物のセリフを流しても、口が動いているのは映像を生成したときの人物のまま |
このため、AI動画に声を後から付けるなら、編集の前に映像の設計を変える必要がある。セリフのあるカットは話す人物を1人に決めて生成するか、口元を見せない構図(後ろ姿・手元・横顔)にして声はナレーションで運ぶ。私たちが動画広告を作ったときは後者を選び、映像は話さない前提で生成し、声は最初から別に作った。
1. AI動画の音声を「消して作り直す」とは
動画生成AIの中には、映像と一緒に効果音やセリフまで生成できるものがある。手軽だが、日本語のセリフは言い回しや発音が崩れやすく、役ごとの声の違いも出しにくい。そこで次のように分業する方法がとられる。
青=AIで生成/緑=編集で組む/黄=人が確認して載せる
映像・声・音・字幕を別々の層(トラック)に分けておけば、セリフだけ直す、声だけ替える、といった修正が全体を作り直さずにできる。
2. 実例:作り直し版のAIドラマを測って分かったこと
2026年8月、SNSで「AIが作った縦型ドラマの会話が崩れていたので、元の音声を消して声だけ作り直した」という作品が公開された。映像は動画生成AIのまま、声は音声合成AIで3役を演じ分け、BGMと環境音を足し、編集はプログラムで行ったという内容だ。この動画ファイル(約33秒)を測定すると、声を作り直しても残っている問題がいくつも見つかった。
| 見つかった問題 | 測定結果 | 原因と対策 |
|---|---|---|
| ① 話している人と口が動く人が違う | 19.2〜21.1秒、字幕は執事のセリフなのに、口を動かしているのは手前の別の人物。執事の口は閉じたまま | 話す人物は映像の生成時に決まる。アフレコでは直らない。セリフごとに話者を決めて生成するか、口元を見せない |
| ② 字幕が速すぎる | 平均7.7字/秒、最大11.0字/秒(22文字を2秒) | 字幕の長さを声の長さに任せきりにしない。1秒あたりの文字数に上限を決め、超えたら台本を削る |
| ③ 字幕の文字の大きさが変わる | 文字の高さが場面ごとに40〜54px(1080px換算)と最大35%変動 | 1行に収めるために自動で縮めていた。大きさを固定し、2行に折り返す |
| ④ 環境音が左右に広がらない | 左右の差を示す成分が中央成分より−50.7dB。ほぼモノラル | 声は中央に固定し、環境音とBGMを左右に振ると、イヤホンで聞いたときの臨場感が増す |
| ⑤ 最後だけフレームレートが違う | 本編は24fps、最後の2.8秒だけ60fps | 別々に作った映像をつなぐときに起きやすい。書き出し時にフレームレートを固定する |
| ⑥ 同じセリフが2回出る | 同じ一言が約10秒と約15秒の2か所に出ていた | 台本の段階での確認漏れ。音を作る前に台本を通しで読む |
逆に、よくできていた点もある。音量は−13.8 LUFS(最大−0.9 dBFS)と、つぶしすぎずに整えられていた。環境音は全編に途切れず敷かれていて、BGMの切り替えもフェードでつながっていた。
分かったこと:問題の多くは「声」ではなく「設計」と「書き出し」
6つのうち、声そのものの問題は1つもない。①は映像の設計、②③は字幕の作り方、④は音の配置、⑤は書き出しの設定、⑥は台本の確認の問題だ。声を良くすることは出発点にすぎず、その前後の工程で品質が決まる。
測定について:SNSに投稿された動画は再圧縮されているため、元の音声の解像度など、このファイルから判断できないことは書いていない。「3役を演じ分けた」という声の高さの違いは、BGMと重なっていて信頼できる測定ができなかった。費用についても、ファイルからは確認できない。
3. 自社の制作では「話さない映像+別に作った声」にした
私たちがオンラインサービスの縦型動画広告を作ったときは、最初から映像に話させない設計にした。理由は2つある。
- 話者のずれを根本から避けられる:語り手(利用者)の声はナレーションで流し、映像は生活の場面や手元を見せる。口元が映らなければ、声と口のずれは起きない
- 参考にした広告も顔をほとんど見せていなかった:参考にした同じジャンルの縦型広告2本を見直すと、出演者は横顔・後ろ姿・うつむき・手元ばかりで、正面の表情カットはなかった。家族が後ろから撮った体裁の映像なので、顔を見せないほうが自然に見える
つまり、声を後から付ける前提なら、「口が映らないカット」で構成するのがいちばん確実だ。どうしても人物が話す場面が必要なら、セリフごとに1人の話者を決め、1セリフ1カットで生成する。
4. AI動画に声を後から付ける手順(図解)
セリフごとに誰が話すか、口を映すかを決める
音声なしで生成。口が映るカットは話者1人に固定
台本をまとめて読ませ、無音の真ん中で行ごとに切る
音声認識で読み上げを台本と照合
声の長さから字幕を作り、環境音・BGMを重ねる
フレームレート固定・音量・字幕の速さを測る
青=AIで生成/緑=プログラムで処理/黄=人が決める・確かめる
手順① 台本の段階で「誰が・どこで話すか」を決める
セリフの横に「話者」と「口を映すか」の欄を作る。口を映すカットは話者を1人にし、それ以外は手元・後ろ姿・風景などにして、声はナレーション(画面の外からの声)として流す。この表があると、映像を生成するときのプロンプトにも話者を書き込める。
手順② 映像は音声なしで生成する
生成された音声は使わないので、最初から音声なしで作るか、編集で完全に消す。口が映るカットでは、プロンプトに話している人物を明記する。
手順③ 声は「まとめて読ませて、無音の真ん中で切る」
私たちは最初、台本を12行に分けて1行ずつ声を作った。ところが使っていた声は1回の生成ごとに費用がかかるため、12回に分けたぶん費用も12倍になっていた。そこで台本全体を1回で読ませ、あとから行ごとに分割する方法に変えた。
分割では別の失敗もした。行の切れ目を「次の行の話し始め」で切ったところ、前の行の語尾(「〜ました」など)が削れてしまった。行と行のあいだにある無音の真ん中で切るように変えて解決した。
手順④ 音声認識で、台本どおりに読んでいるか照合する
聞いて確かめるだけだと、語尾の欠けや読み間違いを見落とす。分割した各行を音声認識にかけ、台本の文と一致するかを確認した。修正後は8行すべてが台本どおりに認識された。ただし、金額を「はち・にじゅうに・はち」のように数字ごとに区切って読む誤りは、人が聞いて気づいた。数字や金額の読み方は、音声認識の照合とは別に人の耳でも確かめる。
手順⑤ 字幕・環境音・BGMを組み立てる
- 字幕:声の長さから表示時間を決める。文字の大きさは固定し、長い行は2行に折り返す。1秒あたりの文字数が多すぎる行は、台本に戻して削る
- 環境音:部屋の空気感、足音、外の音などを全編に薄く敷くと、読み上げっぽさが減る。声は中央、環境音は左右に広げる
- BGM:声が入るところは音量を下げる。場面の切り替えはフェードでつなぐ
手順⑥ 書き出して、数字で点検する
書き出しではフレームレートを固定する。別々に作ったタイトルや最後のカードをつなぐと、そこだけフレームレートが変わることがあるためだ。書き出したら、全体の音量(LUFS)、字幕の文字数/秒、途中の不自然な無音を測って確認する。参考にした縦型広告2本は、全体の音量が−14.5 LUFSと−14.1 LUFSだった。
5. アフレコ用の声の選び方と費用(実測)
2026年9月27日に、同じ台本を7種類の声で読ませて比べた。Higgsfieldの中に音声合成が入っていたため、追加の契約なしで試せ、7種類の比較に使ったのは約5クレジットだった。
| 声(エンジン) | 種類 | 30秒の台本1本あたり |
|---|---|---|
| Inworld(Asuka/Satoshi) | 日本語の話者として用意された声 | 約2クレジット |
| ElevenLabs | 英語系の声で日本語を読ませたもの | 約0.15クレジット |
| MiniMax | 同上 | 約0.15クレジット |
| Seed Speech | 同上 | 約0.1クレジット |
| Seed Audio 1.0 | 同上 | 約0.3クレジット |
| VOICEVOX(参考) | 無料の日本語音声合成 | 無料(利用条件は声ごとに確認) |
声選びで分かったことは次のとおりだ。
- 声の数が多くても、日本語向けの声は少ない:当時Higgsfieldで使える声は113種類あったが、日本語の話者として用意された声はAsuka(女性)とSatoshi(男性)の2つだけだった
- 安い声でも崩れないとは限らない:ある声は、台本の一文がまったく別の音に崩れたため外した。別の声では「テスト」が「ケスト」に聞こえた
- 話す速さを指定できる声が便利:のちに試したQwenの声は速さを1.25倍に指定でき、別の声で12.70秒かかった台本が9.22秒に収まった。1行あたりの費用は0.03クレジットだった
- 話し方の設定が少ない声もある:最初に使った声では感情の強さを指定する設定が見当たらず、句読点・感嘆符・かな書きなど台本の書き方で調整するしかなかった
片言に聞こえる原因と原稿の直し方は、AIナレーションが片言・不自然になる原因と直し方で詳しく書いている。
本物らしい声がほしいときの3つの選択肢
| 方法 | 向いているケース | 注意点 |
|---|---|---|
| 音声合成サービスの声を探す | 本数が多い、修正が多い | サービスによって日本語の声の数が大きく違う |
| 声のクローン(声の複製) | 同じ語り手で何十本も作る | 本人の許可がある声に限る。他人や有名人の声は使わない |
| 人のナレーターに依頼 | 本数が少ない、権利をはっきりさせたい | 本数が増えると費用がかさむ |
6. AI動画の音声の付け方3パターン
AI動画に音声を付ける方法は、大きく3つある。どれが向いているかは、セリフの量と修正の多さで決まる。
| 方法 | 向いているケース | 弱点 |
|---|---|---|
| A. 映像と一緒に音声も生成 | 試作、雰囲気を見るための短い動画、セリフのない環境音だけの動画 | 日本語のセリフが崩れやすい。セリフだけ直すことができず、作り直しになる |
| B. 映像は音声なし、声は後から付ける | ナレーション中心の広告、セリフを何度も直す制作、本数の多い量産 | 口が映るカットでは、話者と口の動きを合わせる工夫が要る |
| C. 生成した音声を消してアフレコ | すでに作った映像を活かしたいとき | 話している人物は変えられない。Bより設計の自由度が低い |
これから作るなら、Bを基本にするのがおすすめだ。私たちの動画広告もBで作った。Cは本記事の前半で分析した作品のやり方で、映像を作り直さずに声を改善できる反面、話者のずれは残る。
7. アフレコに使う道具の種類
| 役割 | 道具の種類 | 選ぶときのポイント |
|---|---|---|
| 声(ナレーション・セリフ) | 音声合成サービス | 日本語向けの声があるか、話す速さ・感情を指定できるか、商用利用の条件 |
| 同じ声で何本も作る | 声のクローン(声の複製)機能 | 本人の許可がある声だけを使う |
| 環境音・効果音 | 効果音の素材、またはプログラムでの合成 | 素材は利用条件を確認。自分で合成すれば権利の心配がない |
| BGM | 音楽素材、または音楽生成AI | 場面ごとに曲を変えるか、1曲で通すか。声が入るところは音量を下げる |
| 字幕 | 動画編集ソフト、またはプログラムで画像として作る | 文字の大きさを固定できるか、2行の折り返しができるか |
| 確認 | 音声認識、音量(LUFS)の測定ツール | 読み上げが台本どおりか、全体の音量がそろっているか |
私たちは、効果音を自分で合成した。テロップが出るときの小さな音、丸がつく瞬間の音などを作り、声の切れ目に寄せて鳴らすようにした。声と効果音が重なると、声が別の音に聞こえることがあるためだ。寄せられない効果音は、鳴らさないことにした。
8. 字幕(テロップ)の作り方の基本
- 文字の大きさは固定する:1行に収めるために自動で縮めると、場面ごとに文字が伸び縮みして見える。長い行は2行に折り返す
- 1秒あたりの文字数に上限を決める:超える行は、字幕を削るのではなく台本に戻して短くする
- 話者の顔と口を隠さない:人物の位置はカットごとに違うので、顔とテロップの重なりを確認し、必要ならカットごとに位置をずらす
- 縦型動画は下部を空ける:ショート動画のアプリは、画面の下側にボタンや説明文が重なる。字幕はそれより上に置く
- 色は絞る:白い文字にフチを基本にし、強調の色は1カットに1語まで。飾りを足しすぎると読みにくく、安っぽく見える
- 明るい背景では帯や影を使う:白い文字が背景に溶けるときは、文字の下に帯を敷くか、映像を少し暗くする
よくある失敗と対処
| 失敗 | 原因 | 対処 |
|---|---|---|
| 語尾が切れる | 先にカットの長さを決め、そこに声を押し込んだ | 声の長さからカットの長さを決める |
| 声と効果音が重なって聞き取れない | 効果音を映像の動きだけに合わせて置いた | 効果音は声の切れ目に寄せる。寄せられないものは鳴らさない |
| 読み上げが不自然に速い・遅い | 声の長さを無理に速めたり、間を足したりした | 速さを指定できる声に替えるか、台本の長さを変える |
| BGMで声が聞こえない | BGMの音量を一定にした | 声が入るところだけBGMを下げる |
| 書き出したら最後だけカクつく | フレームレートの違う映像をつないだ | 書き出し時にフレームレートを固定する |
9. AI動画のアフレコ・チェックリスト
| 工程 | 確認すること |
|---|---|
| 台本 | セリフごとの話者と「口を映すか」が決まっているか/同じセリフが重複していないか |
| 映像 | 口が映るカットの話者は1人か/生成された音声を消したか/画面に文字を描かせていないか |
| 声 | まとめて読ませて分割したか/語尾が欠けていないか(音声認識で照合)/数字・金額・固有名詞の読み |
| 字幕 | 文字の大きさは固定か/1秒あたりの文字数が多すぎないか/話者の口や顔を隠していないか |
| 音 | 環境音が全編に敷かれているか/声は中央、環境音・BGMは左右か/声の入るところでBGMを下げたか |
| 書き出し | フレームレートは全編同じか/全体の音量と最大音量は目標どおりか |
| 権利・表示 | 声・映像・BGMの各サービスの商用利用条件/実在の人物に似せていないか/広告なら広告であることの表示 |
10. 声を差し替えるときの権利と表示の注意点
- 実在の人の声・顔を無断で使わない:声のクローンは本人の許可がある声だけにする。実在の人物の写真から映像を作るのも、肖像やパブリシティの権利の問題になる
- 各サービスの利用規約を確認する:動画生成・音声合成・BGM生成それぞれで、商用利用の可否やクレジット表記の条件が決まっている。無料の音声合成でも、声ごとに条件が違うことがある
- 体験談の形にするなら、事実と表示に気をつける:AIで作った人物と声で「利用者の声」を語らせる場合、元になった事実の範囲を超えないこと、再現であることや広告であることを分かるように表示することが必要になる
この記事で使った管理シート(無料ダウンロード)
声を後から付けるときに使う台本の形を、テンプレートにした。書き方の例を入れた「記入例」シートと、空欄の記入用シートが入っているので、使い方を見ながら自社用に書き換えて使える。
【無料ダウンロード】アフレコ用の音声台本シート(Excel)
元の音声の書き起こしと、作り直す声の台本(話し方の指示・口が映るか)を並べて管理。字幕の字/秒を自動計算し、チェックリストつき。


まとめ
AI動画の声は、元の音声を消して音声合成で作り直せば、片言や言い回しの崩れは大きく改善できる。ただし、誰が話しているかは映像を生成した時点で決まり、アフレコでは直らない。声を後から付けるなら、台本の段階で話者と口元を映すかを決め、映像は話さない前提で作るのが確実だ。声はまとめて読ませて無音の真ん中で切り、音声認識で照合する。そのうえで字幕の大きさと速さ、環境音の配置、書き出しのフレームレートまで数字で点検すると、作り直しの手間を減らせる。
AIで広告・動画をつくる体制を、自社にも
この記事で紹介した制作の進め方(台本の設計、AIで作る部分と本物の素材を使う部分の分け方、確認の手順)を、広告のバナーや動画の量産に使っています。社内で同じ体制を作りたい、まず数本作ってほしい、という相談を受け付けています。
運営:株式会社LIFRELL
広告・動画の制作でAIを使った実例は、AIで広告・動画をつくる実例まとめに工程ごとにまとめている。
よくある質問
Q. AI動画の音声を後から差し替える(アフレコする)ことはできますか?
A. できます。生成された音声を消し、音声合成AIで作った声・効果音・BGMを編集で重ねます。映像・声・音・字幕を別々のトラックに分けておくと、セリフだけ直すなどの修正が簡単になります。
Q. アフレコすれば、AI動画の口の動き(リップシンク)も合いますか?
A. タイミングはある程度合わせられますが、話している人物は変えられません。実測した作品では、執事のセリフが流れているのに口を動かしているのは別の人物でした。口が映るカットは話者を1人に決めて生成するか、口元を映さない構図にするのが確実です。
Q. AI動画の声には、どの音声合成を使えばいいですか?
A. 日本語向けに用意された声かどうか、話す速さを指定できるか、数字や固有名詞を正しく読むかで選びます。2026年9月の比較では、Higgsfieldの113種類の声のうち日本語の話者として用意された声は2つで、英語系の声は日本語の一部が崩れることがありました。同じ台本で数種類を比べてから決めるのがおすすめです。
Q. 音声合成の費用はどのくらいですか?
A. 2026年9月にHiggsfield経由で測った例では、30秒の台本1本あたり約0.1〜2クレジットでした。1回の生成ごとに費用がかかる声は、台本を行ごとに分けずにまとめて読ませると費用を抑えられます。
Q. 字幕はどう作ればいいですか?
A. 声の長さから表示時間を決め、文字の大きさは固定して長い行は2行に折り返します。実測した作品は平均7.7字/秒、最大11.0字/秒で、最後まで読み切れない行がありました。1秒あたりの文字数に上限を決め、超える行は台本を削ります。
Q. 他人の声や顔を使ってAI動画を作ってもいいですか?
A. 許可なく使うのは避けてください。声のクローンは本人の許可がある声に限り、実在の人物の写真から映像を作ることも肖像やパブリシティの権利の問題になります。各サービスの商用利用の条件も確認が必要です。
