Jetzt live
MiniMax H3: Video mit nativem Ton
MiniMax’ omnimodales Generierungsmodell, ab heute live auf MakeFun. H3 versteht einen einheitlichen Kontext über Text, Bild, Video und Audio hinweg und erzeugt Video mit nativem Stereoton, bis zu 15 Sekunden in 2K-Auflösung.
Was das Modell ausgibt
Alle Clips unten stammen aus MiniMax’ eigenen Launch-Demos — so kannst du die Bildqualität beurteilen, bevor du etwas ausgibst. Hier laufen sie stumm in Schleife; der native Stereoton kommt weiter unten.
Fünf Dinge, die es gut kann
Die Aussagen stammen von MiniMax, die Clips sind deren Demos. Was du auf MakeFun bekommst, ist das Ergebnis deiner eigenen Erzeugung.
Natives multimodales Verstehen & Erzeugen
Nimmt Text, Bilder, Audio und Video als Eingabe. Es versteht Figuren, Bewegung, Klang, Emotion, Kameraarbeit, Stil und Absicht und verschmilzt mehrere Referenzen zu einer einheitlichen audiovisuellen Ausgabe. MiniMax’ eigenes Beispiel ist ein einziger Satz: „Übernimm die Hitchcock-Kamerafahrt aus Video 1, lass die Figur in Bild 2 singen, wobei der Gesang zu Audio 3 passt.“ Drei Arten von Material, jedes mit einer Aufgabe, in einem Prompt.
Präzises multimodales Bearbeiten & Steuern
Bearbeitet Figuren, Objekte, Szenen, Ton und Tempo über mehrere Dimensionen hinweg und folgt Anweisungen feingranular, sodass du an vorhandenem Material planbar weiterarbeitest. Eine Änderung bedeutet nicht, alles neu zu erzeugen: Sag, was bleiben und was sich bewegen soll, und mach mit dem Clip weiter, den du schon hast.
Produktionsreife Inhalte für viele Einsatzzwecke
Gebaut für Film, Werbung, Branding, E-Commerce und Gaming — deckt Bildschirmtext, Markenelemente, Kreativeffekte, Produktpräsentationen, UI/UX-Bewegung, Spielgrafik und stilisierten Ausdruck ab. All diesen Aufgaben ist gemeinsam, dass im Bild Schrift, ein Logo oder das Produkt selbst steckt — und nichts davon überlebt es, verschmiert zu werden.
Nativer Stereoton, mit dem Bild zusammen erzeugt
H3 erzeugt Video mit nativem Stereoton — der Ton wird nicht nachträglich dazugemischt, sondern entsteht im selben Durchgang wie das Bild. Schreib Dialog, Musik, Atmo und Geräusche zusammen mit der Handlung in den Prompt, und die Tonspur folgt der Einstellung. Der Umweg über Rendern, Vertonen und Synchronisieren entfällt komplett.
Bis 2K — und die kleine Schrift bleibt lesbar
Clips laufen bis zu 15 Sekunden in bis zu 2K, und 2K bietet das Modell standardmäßig an. Es ist kein klassischer Upscaler, der Pixel erfindet: Das Ergebnis geringerer Auflösung geht zusammen mit dem ursprünglichen multimodalen Kontext zurück ins Modell und wird im Kontext neu erzeugt — Untertitel, Logos und Interface-Elemente werden also rekonstruiert statt geraten. Das ist dieselbe Eigenschaft wie „exakte Text- und Markendarstellung“, nur von der anderen Seite betrachtet.
Erst den Modus wählen, dann die Einstellungen
MakeFun öffnet drei Modi für MiniMax H3. Deine Wahl bestimmt, was du vorbereiten musst, bevor du das erste Wort des Prompts schreibst.
Text zu Video
Beschreibe Szene, Figuren, Handlung, Kamera und Ton in einem Prompt und erhalte einen kompletten Clip mit nativem Stereoton — ganz ohne Material. Der schnellste Weg, eine Idee auf den Schirm zu bringen, wenn du bei null anfängst.
Image to Video
Animiere ein einzelnes Bild oder lade erstes und letztes Einzelbild hoch, um exakt zu steuern, wie die Sequenz beginnt und endet. Ideal für Poster, Produktpräsentationen und UI-Demos. Erstes-und-letztes-Bild ist hier kein eigener Modus, sondern steckt in diesem — lade also beide Bilder hoch, wenn Anfang und Ende gleichermaßen zählen.
Referenz zu Video
Kombiniere Bild-, Video- und Audioreferenzen in einem Auftrag. Nutze Bilder für die Identität, Video für Bewegung und Kamerasprache, Audio für Stimme und Ton. Jedem Asset seine Aufgabe zuzuweisen, ist das, was diesen Modus verlässlich macht.
In drei Schritten zum ersten Clip
So ist der tatsächliche Ablauf auf MakeFun. Vorher muss nichts zusätzlich aktiviert werden.
1. Modus wählen
Wähle Text zu Video, Bild zu Video mit erstem und letztem Einzelbild oder Referenz zu Video mit gemischten Referenzen. Die drei sind oben beschrieben; wählst du falsch, fühlt sich danach kein noch so feines Parameter-Tuning richtig an.
2. Prompt schreiben
Beschreibe Szene, Bewegung und Stil, die du im Video willst. Der Ton gehört in denselben Absatz — Dialog, Musik und Atmo neben der Handlung geschrieben kommen in derselben Erzeugung zurück.
3. Parameter setzen & erzeugen
Wähle Dauer, Auflösung und Seitenverhältnis und klicke auf Generieren. Das Ergebnis landet in My Result, von wo aus du es ins Hochskalieren, Untertitel-Entfernen und den Rest des Werkzeugkastens weiterreichen kannst.
Was du pro Erzeugung einstellen kannst
Das sind die Regler, die MiniMax H3 heute auf MakeFun bietet — genug, um zu beurteilen, ob es deine Abgabemesslatte reißt.
| Einstellung | Was du bekommst |
|---|---|
| Dauer | Bis zu 15 Sekunden in einem Clip. Der ganze Bogen muss hineinpassen, also schreib das Tempo in den Prompt, statt zu hoffen, dass das Modell das Ende trifft. |
| Auflösung | 2K, und 2K ist der Standard — es gibt keine separate HD-Stufe, an deren Aktivierung du denken müsstest. |
| Audio | Nativer Stereoton, im selben Durchgang wie das Bild erzeugt. Nichts zu aktivieren, nichts nachträglich zu synchronisieren. |
| Eingangsbilder | JPG, PNG oder WebP, je höchstens 30 MB, kürzeste Seite mindestens 300 Pixel, Seitenverhältnis zwischen 1:2,5 und 2,5:1. |
| Prompt | Bis zu 7.000 Zeichen — Platz für ein Drehbuch Einstellung für Einstellung, nicht nur einen Satz. |
| Anzahl der Ergebnisse | Ein Clip pro Anfrage. |
| Zugang | Nur für zahlende Konten. |
Fünf Dinge, die dir einen zweiten Versuch sparen
Gib jeder Referenz eine Rolle
Sag, was jedes Asset steuert — Identität der Figur, Produktlook, Bewegung, Stil oder Stimme — um Konflikte zwischen den Eingaben zu vermeiden. Wenn ein Auftrag mit gemischten Referenzen schiefgeht, streiten sich meist zwei Assets um dieselbe Sache.
Längere Sequenzen strukturieren
Zerlege Ideen mit mehreren Einstellungen in eine geordnete Abfolge (z. B. [0–3 s]… [3–7 s]…), damit das Tempo über den ganzen Clip trägt. Eine unsegmentierte Beschreibung wird meist in den ersten drei Sekunden abgespielt.
Den Ton mit dem Bild führen
Beschreibe Dialog, Musik, Atmo und Geräusche neben der Handlung; H3 erzeugt nativen Stereoton im selben Durchgang. Schreibst du nur das Bild, hast du die Tonspur dem Modell überlassen.
Kamerasprache festlegen
Gib Bildausschnitt, Bewegung, Fokus und Objektivverhalten an, um bewusste Kameraarbeit statt generischer Bewegung zu bekommen. „Kinoreif“ allein gibt dem Modell nichts, woran es sich hält; eine benannte Kamerafahrt schon.
Bewahren und ausschließen
Liste Gesichter, Requisiten, Text und Markendetails auf, die konsistent bleiben müssen, und sag, was zu vermeiden ist (harte Schnitte, Morphing, zusätzlicher Text). Bei Arbeiten, die du übergeben musst, zählt das, was nicht auftauchen darf, genauso wie das, was auftauchen soll.
Doku und API
Du willst MiniMax H3 in dein eigenes Produkt einbauen? Endpunkte, Parameter, Authentifizierung und Abrechnung stehen in der MakeFun-Entwicklerdokumentation, und MCP-Zugang gibt es dort ebenfalls.
Warum MiniMax H3 auf MakeFun laufen lassen
Läuft mit dem Konto, das du schon hast
H3 greift auf deine vorhandenen MakeFun-Credits zu. Nichts zu installieren, keine separate Anmeldung, kein zweiter Ort, an dem du deine Renderings im Blick behalten musst.
Ein Ort für jedes Modell
MiniMax, Wan, Seedance, Kling, Sora, Veo, Seedream und mehr liegen hinter einem Konto und einem Guthaben. Schick dasselbe Briefing durch mehrere Modelle, statt mehrere Tools zu bezahlen.
Für die Auslieferung gebaut
Lippensync, Stimmklon, Gesichts- und Kopftausch, Untertitel entfernen und Hochskalieren liegen direkt neben der Erzeugung — so wird aus einem Prompt ein fertiges Asset, ohne die Website zu verlassen.
Verwandte KI-Videomodelle auf MakeFun
- Wan 3.0 — das All-in-one-Videomodell von Tongyi Wanxiang, mit einer nativen 30-Sekunden-Einstellung. Die andere Hälfte des Paars, wenn dein Schnitt Länge braucht statt gemischter Referenzen.
- Seedance 2.5 — ByteDances professionelles multimodales Modell, ebenfalls live auf MakeFun. Vergleiche beide am selben Briefing.
- Wan 2.6 und Wan 2.6 Flash — eine frühere Generation, immer noch schnell und günstig.
- Kling 2.6 und Sora 2 — alternative Videomodelle, durch die sich derselbe Prompt lohnt.
- Lippensync und Video zu Audio — Finishing-Werkzeuge für erzeugtes Material.