MakeFun AI 動画・画像 iOS 版をダウンロード

公開中

MiniMax H3:ネイティブ音声付きの動画

MiniMax のオムニモーダル生成モデルが、MakeFun で利用できます。H3 はテキスト・画像・動画・音声をひとつの文脈として理解し、ネイティブのステレオ音声付きで、最大 15 秒・2K 解像度の動画を生成します。

このモデルの出力

以下のクリップはすべて MiniMax の公式デモです。費用をかける前に画質を確かめられます。ここでは無音でループ再生しています —— ネイティブステレオ音声については下で説明します。

得意なこと 5 つ

記載の内容は MiniMax の公式発表によるもので、クリップも公式デモです。MakeFun での実際の結果は、ご自身の生成によって決まります。

ネイティブなマルチモーダル理解と生成

テキスト・画像・音声・動画を入力として受け取ります。人物・動き・音・感情・カメラワーク・スタイル・意図を理解し、複数の参照素材をひとつの映像音声出力にまとめます。MiniMax 自身の例は一文です:「動画 1 のヒッチコック風のカメラワークを参照し、画像 2 の人物に歌わせ、歌声は音声 3 に合わせる」。3 種類の素材にそれぞれ役割を与えて、ひとつのプロンプトに収めています。

精密なマルチモーダル編集と制御

人物・物体・場面・音・テンポを複数の軸で編集でき、細かい指示にも従うため、既存のコンテンツを予測可能な形で作り込めます。ひとつ変えるために全部を作り直す必要はありません。何を保ち、何を動かすかを伝えれば、いま手元にあるクリップから続けられます。

実制作に耐えるコンテンツを、幅広い用途で

映像制作・広告・ブランディング・EC・ゲームを想定し、画面上の文字、ブランド素材、クリエイティブ効果、商品紹介、UI/UX のモーション、ゲームのビジュアル、様式化された表現まで対応します。これらの仕事に共通するのは、画面の中に文字・ロゴ・商品そのものが入っていることで、そのどれも輪郭が崩れては使えません。

映像と同時に作られるネイティブステレオ音声

H3 はネイティブのステレオ音声付きで動画を生成します —— 音声は後から吹き替えるのではなく、映像と同じ生成過程から出てきます。セリフ・音楽・環境音・効果音を動作と並べてプロンプトに書けば、音がショットに追従します。「レンダリング → 音付け → 同期」の往復が丸ごと不要になります。

最大 2K、小さな文字も読める

クリップは最大 15 秒・最大 2K で、2K がモデルの既定です。ピクセルを創作する従来の超解像とは違い、低解像度の結果を元のマルチモーダルな文脈と一緒にモデルへ戻し、文脈込みで再生成します。そのため字幕・ロゴ・インターフェース要素は推測ではなく再構成されます。これは「文字とブランド表現の正確さ」を裏側から見たものです。

設定より先にモードを選ぶ

MakeFun では MiniMax H3 に 3 つのモードを用意しています。どれを選ぶかで、プロンプトを書き始める前に用意すべきものが決まります。

Text to Video

場面・人物・動作・カメラ・音をひとつのプロンプトに書けば、ネイティブステレオ音声付きの完成クリップができます —— 素材は不要です。何もない状態からアイデアを画面に出すのに最速の方法です。

Image to Video

画像 1 枚を動かすことも、開始フレームと終了フレームをアップロードして始まりと終わりを正確に決めることもできます。ポスター・商品紹介・UI デモに向いています。開始・終了フレームは独立したモードではなく、このモードに含まれています。始点と終点の両方が重要なときは、画像を 2 枚ともアップロードしてください。

Reference to Video

画像・動画・音声の参照素材を同じジョブで組み合わせられます。画像は人物の同一性に、動画は動きとカメラワークに、音声は声と音に使います。どの素材がどの役割を担うかを明示することが、このモードを安定させるコツです。

最初の 1 本までの 3 ステップ

MakeFun での実際の操作順です。事前に有効化しておくものはありません。

1. モードを選ぶ

テキストから動画、開始・終了フレームを使う画像から動画、複数種類の参照素材を使う参照から動画のいずれかを選びます。3 つは上で説明したとおりです。ここを間違えると、その後どれだけパラメータを調整しても噛み合いません。

2. プロンプトを書く

動画に求める場面・動き・スタイルを書きます。音も同じ段落に書いてください —— 動作の隣に書いたセリフ・音楽・環境音が、同じ生成で返ってきます。

3. パラメータを設定して生成

尺・解像度・アスペクト比を選んで生成をクリックします。結果は My Result に入り、そこから超解像や字幕削除など、他のツールへそのまま引き継げます。

生成ごとに設定できること

現在 MakeFun 上で MiniMax H3 が公開している設定項目です。納品基準を満たせるかどうかの判断材料になります。

設定項目 内容
1 本あたり最大 15 秒。物語の起伏をそのなかに収める必要があるため、終わり方をモデル任せにせず、テンポをプロンプトに書き込んでください。
解像度 2K で、既定も 2K です —— 別途「高画質」を有効にする設定はありません。
音声 ネイティブのステレオ音声で、映像と同じ生成過程から出力されます。有効化する設定も、あとからの同期作業もありません。
入力画像 JPG・PNG・WebP、1 枚 30 MB 以内、短辺 300 ピクセル以上、アスペクト比は 1:2.5〜2.5:1 の範囲。
プロンプト 7,000 文字まで —— 一文だけでなく、ショットごとの台本を書ける長さです。
出力数 1 回の送信につき 1 本。
利用条件 有料アカウントのみ。

やり直しを減らす 5 つのこと

参照素材ごとに役割を与える

各素材が何を決めるのか(人物の同一性・商品の見た目・動き・スタイル・声)を明示して、入力どうしの衝突を避けます。複数参照のジョブがうまくいかないときは、たいてい 2 つの素材が同じ役割を奪い合っています。

長いシーケンスは構造化する

複数ショットの構想は順序立てて分解してください(例:[0-3秒]… [3-7秒]…)。そうすればクリップ全体でテンポが保たれます。区切りのない説明は、最初の 3 秒で演じ切られてしまいがちです。

音は映像と一緒に指示する

セリフ・音楽・環境音・効果音を動作と並べて書いてください。H3 は同じ生成過程でネイティブステレオ音声を作ります。映像だけを書けば、音の設計はモデルに委ねたことになります。

カメラワークを定義する

構図・動き・ピント・レンズの挙動を指定すれば、ありきたりな動きではなく意図したカメラワークになります。「シネマティック」だけではモデルに手がかりがありません。動きに名前を付けてください。

保つものと避けるものを挙げる

一貫させる必要がある顔・小道具・文字・ブランドのディテールを挙げ、避けたいもの(急なカット、モーフィング、余計な文字)も書いてください。納品する仕事では、写ってはいけないものは写るべきものと同じくらい重要です。

ドキュメントと API

MiniMax H3 を自社プロダクトに組み込む場合、エンドポイント・パラメータ・認証・課金はMakeFun の開発者ドキュメントにまとめてあります。MCP からの利用もそちらで案内しています。

MiniMax H3 を MakeFun で使う理由

いま使っているアカウントのままで

H3 は手持ちの MakeFun クレジットで動きます。インストールも、別の登録も、生成物を管理する二つ目の場所も必要ありません。

すべてのモデルをひとつの場所で

MiniMax・Wan・Seedance・Kling・Sora・Veo・Seedream などが、ひとつのアカウントと残高で使えます。複数のツールに支払う代わりに、同じ企画を複数のモデルに通せます。

納品まで見据えた設計

リップシンク・音声クローン・顔交換や頭部交換・字幕削除・超解像が生成のすぐ隣にあるため、プロンプトから完成素材まで、サイトを離れずに仕上げられます。

MakeFun にある関連 AI 動画モデル

  • Wan 3.0 — 通義万相のオールインワン動画モデル。単一ショットでネイティブ 30 秒に対応します。複数参照よりも尺が必要な場合は、こちらが対になる選択肢です。
  • Seedance 2.5 — ByteDance のプロ向けマルチモーダルモデル。MakeFun で同じく利用できます。同じ企画で 2 つを比べてみてください。
  • Wan 2.6Wan 2.6 Flash — ひとつ前の世代。速くて経済的な選択肢として今も有効です。
  • Kling 2.6Sora 2 — 同じプロンプトを通してみる価値のある、別の動画モデルです。
  • リップシンク動画から音声へ — 生成した映像を仕上げるためのツールです。