ビデオからAIアバター

ビデオをアップロード

クリックまたはドラッグしてファイルをアップロード
形式:mp4/mov, 時間:最短3秒、最長5分 解像度は720Pまたは1080Pを推奨、最大4K

(ビデオマッティングに必要)

画像をアップロード

クリックまたはドラッグしてファイルをアップロード
形式:jpg/png, サイズ:最大20M

ビデオからAIアバター操作プロセス

  1. MP4またはMOV形式の自分のビデオをアップロードしてください。横向きまたは縦向きで、サイズに制限はありません。ビデオの長さは最低3秒である必要があります。このビデオは、その後のすべてのAI生成キャラクタービデオの基礎となります。ビデオ内の人物がクリアで魅力的であることを確認してください。
  2. アップロード後、「インスタントアバター」をクリックしてAIトレーニングを開始します(期間限定無料)。
  3. 10分待って、「作成」-「マイアバター」から作成したAIクローンビデオを選択してください。
  4. (オプション)クローンのリップシンク効果に満足できない場合は、まずトレーニングビデオが要件を満たしているかを確認してください:ビデオ内に1つの顔だけがある;人物がビデオ内で話している;音声と唇の動きが同期している;背景雑音やその他の音を避ける。トレーニングビデオが要件を満たしている場合、初期トレーニングが完了したキャラクターをクリックし、「スタジオアバター」をクリック(1ダイヤモンドを消費)してキャラクターの追加AIトレーニングを実行できます。2時間後、システムは自動的にAIモデルを更新します。同じキャラクターを選択すると、より良いリップシンク効果のビデオを生成できます。

価格:1回の"スタジオアバター"セッションには100クレジットが必要です。

元素材要件

  • 複数の顔が出現するビデオは使用しないでください。
  • 顔が大きすぎたり小さすぎたりしないようにしてください。顔全体が画面エリア内にあり、顔が画面から出ないようにしてください。顔の幅が全体の画面幅の10分の1から3分の1を占めることを推奨します。
  • 顔の特徴が遮蔽されていないことを確認し、顔の特徴と輪郭がはっきりと見えるようにしてください。
  • 推奨ビデオ解像度は720Pまたは1080Pで、最大解像度は4Kを超えないようにしてください。
  • ビデオの長さは最低3秒、最長5分(3s-5min)である必要があります。
  • より良いリップシンク生成結果を得るために、普通に話している人のビデオを使用することを推奨します。ビデオ内の音声と唇の動きは同期している必要があり、背景雑音やその他の音(会話以外)は避けてください。適度な話速を保ってください。話速が遅すぎるとリップシンクの精度が下がり、話速が速すぎるとリップシンクの震えを引き起こす可能性があります。
顔がはっきりしている
顔がはっきりしている
横顔
横顔
遮蔽あり
遮蔽あり
ぼやけすぎ
ぼやけすぎ
複数の顔
複数の顔
比率が大きすぎ
比率が大きすぎ

元の背景要件

  • アップロードした画像またはビデオから背景を削除する必要がある場合は、対応する背景の画像をアップロードしてください。背景画像は元の画像またはビデオのサイズと解像度と一致している必要があります。背景画像は将来置き換える画像ではなく、元の画像またはビデオの背景部分です。例えば、ビデオが部屋でのトーキングヘッドショットの場合、背景画像は同じ角度から撮影された部屋の写真である必要があります。
  • 元の画像またはビデオが緑のスクリーンなどの単色背景の場合、ビデオの背景色と一致するカラーパレットから色を選択することもできます。
  • 背景を削除する必要がない場合は、背景画像のアップロードを無視してください。
元素材
元素材
元の背景
元の背景
切り抜き効果
切り抜き効果

スタジオアバター

提供されたビデオ素材に基づいてディープラーニングモデルの継続トレーニングを行い、生成される顔の鮮明度と類似度をさらに向上させます。ビデオ素材が良好な音声と映像の同期性を持っている場合、継続トレーニング後のモデルはより高い同期度の口の動きを生成できます。音声と映像が同期していない、または音質が悪い場合は、"スタジオアバター"を実行しないでください。

  • 複数の顔が出現するビデオは使用しないでください。
  • 顔が大きすぎたり小さすぎたりしないようにしてください。顔全体が画面エリア内にあり、顔が画面から出ないようにしてください。顔の幅が全体の画面幅の10分の1から3分の1を占めることを推奨します。
  • 顔の特徴が遮蔽されていないことを確認し、顔の特徴と輪郭がはっきりと見えるようにしてください。
  • 推奨ビデオ解像度は720Pまたは1080Pで、最大解像度は4Kを超えないようにしてください。
  • ビデオの長さは最低3秒、最長5分(3s-5min)である必要があります。
  • より良いリップシンク生成結果を得るために、普通に話している人のビデオを使用することを推奨します。ビデオ内の音声と唇の動きは同期している必要があり、背景雑音やその他の音(会話以外)は避けてください。適度な話速を保ってください。話速が遅すぎるとリップシンクの精度が下がり、話速が速すぎるとリップシンクの震えを引き起こす可能性があります。