Disponible
MiniMax H3 : la vidéo avec son natif
Le modèle de génération omni-modal de MiniMax, disponible dès aujourd’hui sur MakeFun. H3 comprend un contexte unifié entre texte, images, vidéo et audio, et génère de la vidéo avec un son stéréo natif, jusqu’à 15 secondes en 2K.
Ce que le modèle produit
Tous les clips ci-dessous proviennent des démos de lancement de MiniMax : vous pouvez juger la qualité d’image avant de dépenser quoi que ce soit. Ils tournent ici en boucle et sans son — le son stéréo natif est abordé plus bas.
Cinq points forts
Les affirmations sont celles de MiniMax et les clips sont leurs démos. Ce que vous obtenez sur MakeFun, c’est le résultat de votre propre génération.
Compréhension & génération multimodales natives
Il accepte texte, images, audio et vidéo en entrée. Il comprend personnages, mouvement, son, émotion, travail de caméra, style et intention, et fusionne plusieurs références en une sortie audiovisuelle unifiée. L’exemple de MiniMax tient en une phrase : « Reprends le mouvement de caméra hitchcockien de la Vidéo 1, fais chanter le personnage de l’Image 2, avec une voix qui correspond à l’Audio 3. » Trois types de matériau, chacun avec une mission, dans un seul prompt.
Montage & contrôle multimodaux précis
Il retouche personnages, objets, décors, son et rythme sur plusieurs dimensions, avec un suivi d’instruction très fin : vous itérez sur du contenu existant de façon prévisible. Changer une chose n’oblige pas à tout régénérer : dites ce qui doit rester et ce qui doit bouger, et repartez du clip que vous avez déjà.
Des contenus prêts pour la production, tous usages confondus
Conçu pour le cinéma, la publicité, le branding, l’e-commerce et le jeu vidéo — il couvre les textes à l’écran, les éléments de marque, les effets créatifs, les vitrines produit, les animations d’interface, les visuels de jeu et l’expression stylisée. Le point commun de ces travaux : l’image contient de la typo, un logo ou le produit lui-même, et rien de tout cela ne survit à un rendu baveux.
Un son stéréo natif, fabriqué avec l’image
H3 génère de la vidéo avec un son stéréo natif — l’audio n’est pas ajouté après coup, il sort de la même passe que l’image. Écrivez dialogues, musique, ambiance et effets dans le prompt, à côté de l’action, et la bande-son suit le plan : l’aller-retour rendre puis sonoriser puis synchroniser disparaît complètement.
Jusqu’en 2K, avec les petits caractères encore lisibles
Les clips vont jusqu’à 15 secondes en 2K maximum, et le 2K est ce que le modèle propose par défaut. Ce n’est pas un agrandisseur classique qui invente des pixels : le résultat en résolution inférieure repasse dans le modèle avec le contexte multimodal d’origine et est régénéré en contexte, si bien que sous-titres, logos et éléments d’interface sont reconstruits plutôt que devinés. C’est la même propriété que le « rendu fidèle du texte et de la marque », vue de l’autre côté.
Choisissez le mode avant les réglages
MakeFun ouvre trois modes pour MiniMax H3. Votre choix détermine ce que vous devez préparer avant d’écrire le premier mot du prompt.
Texte vers vidéo
Décrivez la scène, les personnages, les actions, la caméra et le son dans un seul prompt pour créer un clip complet avec audio stéréo natif — aucun média requis. Le moyen le plus rapide de mettre une idée à l’écran quand vous partez de rien.
Image to Video
Animez une seule image, ou importez une première et une dernière image pour contrôler précisément le début et la fin de la séquence. Idéal pour les affiches, les vitrines produit et les démos d’interface. Ici, première-et-dernière image n’est pas un mode à part : il est inclus dans celui-ci — importez donc les deux images quand le début et la fin comptent autant.
Référence vers vidéo
Combinez des références image, vidéo et audio dans une même tâche. Utilisez les images pour l’identité, la vidéo pour le mouvement et le langage de caméra, l’audio pour la voix et le son. C’est le fait d’attribuer un rôle à chaque élément qui rend ce mode fiable.
Trois étapes jusqu’à votre premier clip
Voici l’ordre réel des opérations sur MakeFun. Rien d’autre à activer au préalable.
1. Choisissez le mode
Choisissez texte vers vidéo, image vers vidéo avec première et dernière image, ou référence vers vidéo avec des références mixtes. Les trois sont décrits ci-dessus ; en cas de mauvais choix, aucun réglage de paramètre ne semblera juste ensuite.
2. Rédigez le prompt
Décrivez la scène, le mouvement et le style souhaités. Le son fait partie du même paragraphe — dialogues, musique et ambiance écrits à côté de l’action reviennent dans la même génération.
3. Réglez les paramètres & générez
Choisissez la durée, la résolution et le format d’image, puis lancez la génération. Le résultat arrive dans My Result, d’où vous pouvez l’envoyer vers l’agrandissement, la suppression de sous-titres et le reste de la boîte à outils.
Ce que vous pouvez régler à chaque génération
Voici les réglages que MiniMax H3 propose aujourd’hui sur MakeFun — de quoi juger s’il passe votre exigence de livraison.
| Réglage | Ce que vous obtenez |
|---|---|
| Durée | Jusqu’à 15 secondes par clip. Tout l’arc doit y tenir : écrivez donc le rythme dans le prompt plutôt que d’espérer que le modèle trouve la fin. |
| Résolution | 2K, et le 2K est la valeur par défaut — pas de palier haute définition séparé à penser à activer. |
| Audio | Stéréo natif, généré dans la même passe que l’image. Rien à activer, rien à synchroniser ensuite. |
| Images d’entrée | JPG, PNG ou WebP, 30 Mo maximum chacune, plus petit côté d’au moins 300 pixels, format compris entre 1:2,5 et 2,5:1. |
| Prompt | Jusqu’à 7 000 caractères — de quoi écrire un scénario plan par plan, pas seulement une phrase. |
| Nombre de sorties | Un clip par demande. |
| Accès | Comptes payants uniquement. |
Cinq réflexes qui évitent une seconde tentative
Donnez un rôle à chaque référence
Précisez ce que chaque élément contrôle — identité du personnage, look du produit, mouvement, style ou voix — pour éviter les conflits entre entrées. Quand une tâche à références mixtes rate, ce sont généralement deux éléments qui se disputent la même chose.
Structurez les séquences longues
Découpez les idées à plusieurs plans en une progression ordonnée (par ex. [0-3 s]… [3-7 s]…) pour que le rythme tienne sur tout le clip. Une description non segmentée a tendance à être jouée dans les trois premières secondes.
Dirigez l’audio avec l’image
Décrivez dialogues, musique, ambiance et effets sonores à côté de l’action ; H3 génère le son stéréo natif dans la même passe. Si vous n’écrivez que l’image, vous avez confié la bande-son au modèle.
Définissez le langage de caméra
Précisez cadrage, mouvement, mise au point et comportement de l’objectif pour obtenir une image pensée plutôt qu’un mouvement générique. « Cinématographique » seul ne donne aucune prise au modèle ; un mouvement nommé, si.
Préservez et excluez
Listez les visages, accessoires, textes et détails de marque qui doivent rester constants, et dites ce qu’il faut éviter (coupes franches, morphing, texte parasite). Sur un travail à livrer, ce qui ne doit pas apparaître compte autant que ce qui doit apparaître.
Docs et API
Vous voulez intégrer MiniMax H3 à votre propre produit ? Endpoints, paramètres, authentification et facturation figurent dans la documentation développeur de MakeFun, où l’accès MCP est également disponible.
Pourquoi utiliser MiniMax H3 sur MakeFun
Fonctionne avec le compte que vous avez déjà
H3 puise dans vos crédits MakeFun existants. Rien à installer, pas d’inscription séparée, pas de second endroit où suivre vos rendus.
Un seul endroit pour tous les modèles
MiniMax, Wan, Seedance, Kling, Sora, Veo, Seedream et d’autres tiennent dans un seul compte et un seul solde. Passez le même brief dans plusieurs d’entre eux au lieu de payer plusieurs outils.
Pensé pour la livraison
Synchro labiale, clonage vocal, échange de visage et de tête, suppression de sous-titres et agrandissement voisinent avec la génération : un clip passe du prompt au livrable sans quitter le site.
Modèles vidéo IA associés sur MakeFun
- Wan 3.0 — le modèle vidéo tout-en-un de Tongyi Wanxiang, avec un plan-séquence natif de 30 secondes. L’autre moitié du duo si votre montage a besoin de longueur plutôt que de références mixtes.
- Seedance 2.5 — le modèle multimodal professionnel de ByteDance, également disponible sur MakeFun. Comparez les deux sur le même brief.
- Wan 2.6 et Wan 2.6 Flash — une génération antérieure, toujours rapide et économique.
- Kling 2.6 et Sora 2 — d’autres modèles vidéo à essayer avec le même prompt.
- Synchro labiale et vidéo vers audio — des outils de finition pour vos rushes générés.