Seedance 2.0
ByteDance のフル機能版 Seedance 2.0 動画モデルです。プロンプトのみの生成、フレームを使うアニメーション、画像・動画・音声によるマルチモーダル参照生成に対応しています。開始・終了フレームと各参照素材は、用途に応じて別々に指定できます。
検討する理由
次のタスクに プロンプト、フレーム、または画像/動画/音声参照 が必要な場合に検討できます。
ソース映像の人物、画面構成、動きはそのまま保ち、口の動きだけを別の音声録音に合わせたい場合に Volcengine Video Lip Sync を使用できます。
出力例
Volcengine Video Lip Sync
動画+音声から動画
出力例
Volcengine Video Lip Sync
最適
対応
オンライン試用
結果
ソース映像の人物、画面構成、動きはそのまま保ち、口の動きだけを別の音声録音に合わせたい場合に Volcengine Video Lip Sync を使用できます。
まだ結果はありません。プロンプトを送信して実行を開始してください。
判断材料
判断材料
最適なタスク
タスクがこのような場合に使えます
確認データ
プロバイダー
Volcengine
カテゴリ
動画
機能
動画+音声から動画
クレジットモデル
per_input_second · default=8 · ⌈total⌉
入力経路
最大 2 件の参照ファイル
プロンプト設定
プロンプト主導
Volcengine Video Lip Sync FAQ
ソース動画の映像はそのまま使い、発話表現だけを別の音声トラックに合わせたい場合に使用します。動画と音声を使うリップシンク用のワークフローであり、プロンプト主体の動画生成や、肖像画像のアニメーション用モデルではありません。
95 MB 以下の MP4 または MOV 動画をちょうど 1 本と、10 MB 以下の MP3、M4A、WAV、AAC、OGG 音声ファイルを 1 個アップロードします。動画は 360p~1080p の対応寸法、24~60 fps、1~30 Mbps の範囲内で、両ファイルの検証済み時間が 0 より大きい必要があります。
カメラを正面から向いた 1 人の映像で、高速処理や音声と動画の長さを合わせる設定が役立つ場合は Lite を選びます。より複雑な 1 人のシーン、特にシーン分割や話者識別が必要な場合は Basic を選んでください。
Lite モードでは、対象音声が長い場合に動画をループして音声の長さに合わせられます。逆再生ループは長さ合わせがオンの場合だけ利用でき、テンプレート開始値でソースシーケンスの開始位置を選びます。Basic モードではこれらの設定を使用しません。
Rivya は検証済み音声 1 秒あたり 8 クレジットで計算し、出力時間もその音声に従います。小数の再生時間を計算全体に反映し、予約合計だけを整数クレジットに切り上げます。報告された実使用量が有効で予約量以下の場合は、その実使用量で精算します。実使用量が欠落、無効、または予約量を超えている場合は、見えない追加請求を行わず照合対象として扱います。
既存の 1 人用動画 1 本と対象の音声トラック 1 個を組み合わせ、ソース映像をビジュアルの基準として保ちながら、見えている発話を新しい音声に合わせられます。
話者がはっきり見える、対応形式の MP4 または MOV ファイルを使い、明瞭な音声トラックを準備します。動画が 95 MB 以下で、解像度、フレームレート、ビットレートが記載の上限内にあることを確認してください。
正面向きの分かりやすい映像では Lite から始めます。シーンが複雑な場合や、シーン分割と話者識別が役立つ場合は Basic を使用してください。
詳細は公開されていますが、アップロードと生成にはサインインが必要です。料金は検証済み音声 1 秒あたり 8 クレジットで、結果は音声時間に従い、最終的な計算合計だけを切り上げます。
ソース動画 1 本と音声トラック 1 個のテストにはこのページを使用します。吹き替えを保存したい場合、言語やテイクを繰り返し試したい場合、比較作業を行いたい場合、または長期のローカライズ作業には Studio を開いてください。
代替モデルを比較
ByteDance のフル機能版 Seedance 2.0 動画モデルです。プロンプトのみの生成、フレームを使うアニメーション、画像・動画・音声によるマルチモーダル参照生成に対応しています。開始・終了フレームと各参照素材は、用途に応じて別々に指定できます。
検討する理由
次のタスクに プロンプト、フレーム、または画像/動画/音声参照 が必要な場合に検討できます。
ByteDance の高速な Seedance 2.0 動画モデルです。プロンプトのみの生成、開始・終了フレームを使う画像アニメーション、画像・動画・音声によるマルチモーダル参照生成に対応しています。
検討する理由
次のタスクに プロンプト、フレーム、または画像/動画/音声参照 が必要な場合に検討できます。
テキストから動画と画像から動画に対応し、音声と映像をネイティブに同期できる Seedance 動画モデルです。480p〜1080p、4〜12 秒のクリップ、6 種類のアスペクト比、動的または固定レンズ、任意の音声生成、リップシンクに対応しています。
検討する理由
次のタスクに プロンプト + 任意の画像 が必要な場合に検討できます。