Image2 + Seedance 2.0 で AI 長編動画を制作:ブランド広告の実践

·Toolin 編集部

アセット準備から編集・連結までの完全なワークフローを解説。AIツールチェーンで115秒のブランド広告ロング動画を制作し、顔のドリフトやシーンの不統一といった核心的な課題を解決します。

Image2 + Seedance 2.0 で AI 長編動画を制作:ブランド広告の実践

AI生成動画の1回あたりの上限は約15秒です。完全な長編動画を作ろうとすると連結するしかなく、連結するとすぐ問題が起きます。顔のドリフト、動作のフレーム飛び、前後のシーンが合わない。本記事では、実戦で検証された方法論を共有します。Image2 + Seedance 2.0 を使って、115秒のフルAIブランド広告(Laura Geller のリップスティック)を1本作成しました。4つの年齢層の女性が登場し、実写のフレームは一切ありません。

核心的な問題と解決の考え方

AI長編動画の一貫性の問題には、根源が4つあります:

  1. 人物設定の不統一 -- 各セグメントを個別に出力するため、顔立ち、光、スタイルがそれぞれ異なる
  2. シーン設定の不統一 -- 同じシーンがカットによって見え方が一致しない
  3. 生硬な連結 -- トランジション方式の選択を誤る
  4. 音声の不連続 -- 分割生成により、話速や感情が前後で一致しない

解決の考え方は アセット先行 + 絵コンテ計画 + カットタイプ別の生成方式選択 + 正規化された編集 です。

ステップ1:アセットの事前準備

一貫性の問題はすべてこのステップで解決します。4つのカテゴリに分けて準備します:

人物設定

正面、側面、背面を含む人物の全身三面図を1枚出力します。正面はさらに半身版を1枚追加で出力し、近景用に使います。表情は少なくとも3種類(自然な閉じ口、微笑み、集中時のしかめっ面)を用意します。衣装とアクセサリーは別途ディテール図を出力します。モデルはセグメント間でドリフトしやすいので、参考図があって初めて固定できます。

シーン設定

まず人が写っていない空のシーンを出力し、光とトーンを固定します。同じシーンはサイズ別に3枚出力します。全景(空間の提示)、中景(人物と環境の関係)、近景(人物や物のディテール)です。

発展的なやり方:まず360度のシーン見回し動画を1本生成し、人物カットを生成するときにこの動画を添付し、プロンプトで立ち位置を明記します。

人物の三面図と製品設定図

製品設定

  • 正面図(パッケージが完全で、遮りなし)
  • 側面図(カラーバーや質感を確認できる)
  • 45度斜め図(最もよく使うアングル)
  • 製品が使用中の状態図
  • Logo とブランドフォントのクローズアップ(ラストにブランド名を出す用)

製品の多角度設定図

ボイス設定

ナレーションのボイスと人物の台詞ボイスは別々に決め、混用してはいけません。決めたら30秒のサンプルを1本出して試聴確認し、全編で同じ声に統一します。

ツールのおすすめ: 画像生成には Doubao(低コストで大量の試行錯誤が可能)または Image2(品質重視)、ボイスには ElevenLabs または MiniMax。

ステップ2:脚本計画と絵コンテ

まずナラティブ構造を決めます。越境EC広告の汎用ロジックは 痛点 --> 製品の登場 --> 効果の証明 --> 行動喚起 です。

各カットで6つのことを明確に記します:

  1. サイズ(全景/中景/近景/クローズアップ)
  2. 主体の行動
  3. カメラワーク(固定/プッシュイン/プルバック/フォロー)
  4. 感情の雰囲気
  5. 想定尺
  6. 人物が話すかどうか

尺の基準:クローズアップや静止カットは5秒、人物の動きがある中景は5-10秒、情報を完全に伝える必要があるものは10-15秒。分割できるものは分割する、尺が短いほど利用率は高くなります。

絵コンテ脚本は DeepSeek か Gemini で初稿を生成し、その後手動で調整できます。

ステップ3:絵コンテから動画生成 -- 3つの方式をカットタイプで使い分ける

すべてのカットを同じ生成方式にしないでください。

方式1:純プロンプト

オープニング、全新シーンへの切り替え、前のセグメントの画面から接続する必要がないカットに向いています。参考図は普段どおり使いますが、このセグメントは独立して生成し、前段の最終フレームには依存しません。

プロンプト構造: 主体 + 行動 + サイズ + カメラワーク + スタイル制約 + 禁止項。禁止項は必ず書きます。たとえば「参考図の画面スタイルを移行することを禁止」などです。

方式2:絵コンテモード(Storyboard)

1つのプロンプトで複数の画面を記述し、1回で6分割または9分割のグリッドを生成します。各マスがキーフレームです。マルチカットの速い切り替えや、製品の多角度展示など、強い連続性を必要としないセグメントに向いています。

方式3:最終フレーム接続

ストーリーが連続し、人物の動きが引き継がれるカットに向いています。操作フロー:

  1. 前のセグメントを生成
  2. 編集ソフトに読み込んで1回書き出す(エンコード統一)
  3. 最後のフレームを切り出す
  4. このフレーム + 新しいプロンプトで次のセグメントを生成
  5. 連結時に次セグメントの頭1-2フレームを削除してカクつきを防ぐ

落とし穴の注意: 最終フレームを直接切り出して次セグメントの頭フレームに使ってはいけません。接続部分に明らかな色差やジャンプが生じます。必ず前のセグメントをCapCut/PRに読み込んで1回書き出し、書き出した後の最終フレームを次セグメントの頭フレームに使ってください。

実際の絵コンテ生成結果

ツールのおすすめ: 動画生成には Seedance 2.0 または Veo 3.1 の画像から動画への生成が比較的良好です。

ステップ4:編集と連結

トランジション選択のロジック:

場面トランジション方式
同じシーンでサイズが近いハードカット
シーンをまたぐディゾルブ(0.5秒以内)
感情の転換フラッシュホワイト/フラッシュブラック
2つのセグメントが明らかに繋がらない2-3秒の過渡カットを追加生成

編集の順番: 絵コンテ順に素材を繋ぐ --> 接続点を1つずつ確認 --> 字幕を追加 --> 最後に音声を当てる。先に音声を当ててはいけません。編集の過程で尺が変わります。

ステップ5:音声処理

音声は3種類に分かれ、ロジックがまったく異なるため、別々に処理します:

ナレーション: 必ずセグメント全体を1回で生成し、カットごとに一文ずつ分割してはいけません。分割すると話速、感情、口調が前後で一致しなくなります。正しい操作は、ボイスを決めた後で完全なナレーション原稿を一度に生成し、その後編集ソフトで画面の尺に合わせて一文ずつタイミングを合わせることです。音声を画面に合わせて切るのであって、画面を音声に合わせて切るのではない点に注意してください。

環境音: 動画生成時に同期生成するのを優先します。別途補う場合は各カットごとにセグメント単位で合わせ、同じ背景音を全編でループしてはいけません。

BGM: 最低まで抑え、雰囲気の下支えとしてのみ使います。ミキシングの階層は、ナレーション > 台詞 > 環境音 > BGM。BGMはナレーション音量の30%を超えないようにします。

ツールリスト

工程おすすめツール
画像生成Doubao(無料)、Image2(高品質)
動画生成Seedance 2.0、Veo 3.1
絵コンテ脚本DeepSeek、Gemini
ボイスElevenLabs、MiniMax
編集CapCut、Premiere Pro

よくある質問

  • 顔のドリフトはどう解決する? アセット事前準備の段階で三面図とディテールの参考図をきちんと出力し、生成時に参考図を添えて外見を固定します
  • 連結部分の色差が明らかな場合は? 前のセグメントをまず編集ソフトに読み込んで1回書き出し、書き出した後の最終フレームを次セグメントの頭フレームに使います
  • 15秒の制限はどう突破する? 5-15秒の短いセグメントに分割し、最終フレーム接続の方式で連続性を保ちます