Tutorial: Erste Schritte mit der MakeFun-Plattform für digitale Menschen
Danke, dass du dich für die MakeFun-Plattform zur Avatar-Videosynthese entschieden hast. MakeFuns Technologie für Avatar-Lippensync und Stimmklon wird seit 2021 entwickelt und soll die einfachste und zugleich leistungsfähigste Avatar-Plattform sein. Hier erstellst du deinen eigenen KI-Avatar samt Stimme und erzeugst anschließend Videos deines digitalen Gegenübers, indem du einfach Text eintippst. Alternativ nutzt du fertige Avatare und Stimmen und erstellst Videos über Skripte.
Anmelden
-
Melde dich mit deiner Gmail- oder anderen E-Mail-Adresse an unter https://makefun.ai/app. Empfohlene Browser: Microsoft Edge oder Chrome auf dem Desktop für das beste Erlebnis.
-
Wenn du noch kein Konto hast, klicke auf „Register“, um eines anzulegen. Falls du einen Einladungscode hast, findest du im Q&A-Abschnitt die Anleitung zur Eingabe.
-
Für die mobile Nutzung öffne https://makefun.ai/app. Hinweis: Die mobile Version hat weniger Funktionen. Nutze nach Möglichkeit die Desktop-Version.
Dein erstes Video erstellen
Nach dem Login kannst du direkt ein Avatar-Video erstellen:
-
Gehe zum Modul „Create“.
-
Gib dem Video einen Namen.
-
Trage das Skript ein, das der Avatar sprechen soll.
-
Wähle die passende Sprache und Stimmfarbe und klicke dann auf „Preview Audio“.
-
Nach erfolgreicher Audiovorschau ändert sich die Schaltfläche zu „Create Video“. Zusätzlich hörst du die synthetisierte Avatar-Stimme auf deinem Rechner.
-
Das System zeigt an, wie viele Coins die Erzeugung des Videos aus dem Audio kostet. Wenn dir Vorschau und Preis zusagen, klicke auf „Synthesize Video“, um das Video zu erzeugen.
-
Die Plattform leitet dich zur Ergebnisseite weiter, wo du das Video nach kurzer Wartezeit herunterladen kannst.
-
Den Fortschritt und fertige Videos findest du im Modul „My Results“.
Erweiterte Funktionen der Videosynthese
Verschiedene Avatare wählen
Du hast die Wahl zwischen:
- My Avatars: So erstellst du deinen eigenen Avatar hier.
- Public Avatars: Diese dienen als Beispiele zur Orientierung. Hinweis: Für diese Avatare gibt es in deinem Land möglicherweise keine Urheber- oder Nutzungsrechte für kommerzielle Zwecke.
Avatar-Typen: Wenn du auf „My Avatars“ klickst, siehst du, dass jeder Avatar gekennzeichnet ist mit oder .
- Diamant: Ergebnis von „Continue Training“. Diese Avatare sind auf höhere Lippensync-Qualität und mehr Realismus trainiert. So funktioniert „continue training“ hier.
- Blitz: Ergebnis von „Quick Preview“. Bietet grundlegende Lippensync-Qualität. Wenn du „continue training“ gestartet hast, das Training aber noch läuft, siehst du ebenfalls. Anders gesagt: Nur der fertig trainierte Avatar wird gekennzeichnet mit . Blitz eignet sich für Avatare aus einem einzelnen Bild oder für Trainingsvideos ohne synchrone Audio-Lippen-Bewegung.
Eine Stimme wählen
- Wähle eine Stimme, die zu deinem Skript passt. MakeFun unterstützt Dutzende Sprachen und Hunderte Stimmfarben.
- Du kannst auch deine geklonte Stimme für die Vertonung nutzen. So erstellst du deine eigene geklonte Stimme hier.
Automatische Untertitel
- Wenn du Untertitel im Video möchtest, aktiviere unter dem Avatar-Video „Caption“ und stelle Schrift, Farbe und Hintergrund ein.
- Hinweis: Automatische Untertitel gibt es nur für textgesteuerte Videos, nicht für audiogesteuerte.
Hintergrund ändern
- Wenn du den Hintergrund deines Avatar-Videos ändern willst, klicke auf „Background“. Beachte, dass nicht alle Avatare einen Hintergrundwechsel unterstützen. Prüfe dazu die Option „Background“. Ist sie nicht verfügbar, wähle einen anderen Avatar.
- Damit ein eigener Avatar unter „My Avatars“ einen Hintergrundwechsel erlaubt, musst du den Hintergrund bereits beim Erstellen des Avatars konfigurieren.
Unterstützt der gewählte Avatar den Hintergrundwechsel, kannst du:
- von der Plattform bereitgestellte Bilder verwenden.
- ein eigenes Bild oder Video als Hintergrund hochladen.
Eigene Avatare aus Videos erstellen
Mit MakeFun kannst du einen Avatar entweder aus einem kurzen Videoclip (dem sogenannten Basisvideo) oder aus einem Bild erstellen. In diesem Abschnitt erfährst du, wie du ein kurzes Basisvideo einer echten Person hochlädst, das als Trainingsmaterial für deine personalisierten KI-Avatar-Videos dient. Das Basisvideo bestimmt Auflösung, Lippenbewegung, Gestik, Kleidung und Requisiten aller späteren Videos. Für hochwertige Avatare muss das Basisvideo bestimmte Anforderungenerfüllen. Wenn du APInutzen möchtest, lies diesen Abschnitt, um die Bedeutung jedes API-Parameters zu verstehen. Für „My Avatars“ gibt es zwei Trainingsverfahren:
- „Quick Preview “: Das Training dauert in der Regel unter 1 Minute. Dieser Vorgang ist kostenlos (keine Diamanten werden verbraucht). Dieser Modus ist die einzig geeignete Option für Avatare aus einem einzelnen Bild oder für Trainingsvideos ohne synchrone Audio-Lippen-Bewegung. Das Ergebnis wird gekennzeichnet mit .
- „Continue Training “: Das Training dauert in der Regel unter 60 Minuten. Dieser Vorgang kostet 1 . Das Ergebnis von „continue training“ liefert meist eine deutlich bessere Lippensync-Qualität als „Quick Preview“. Es wird gekennzeichnet mit . Um „continue training“ zu nutzen, lade zuerst ein Basisvideo hoch und führe „quick preview“ aus; klicke dann auf Symbol am Avatar-Symbol. Danach erscheint „Continue Training “ — klicke darauf. Warte etwa 60 Minuten. Am Ende ist das Avatar-Symbol gekennzeichnet mit im Modul „Create“.
Schritte: eigenen Avatar aus Videos erstellen
-
Lade im Modul „Add Avatars“ ein Video hoch, das die Anforderungen erfüllt
- Name: Gib deinem Avatar einen Namen.
- Geschlecht: Wähle passend zum Video. Das beeinflusst die Lippensync-Ergebnisse leicht.
- Ausgangsmaterial: Wähle Video zum Klonen.
- Ursprünglicher Hintergrund: Wenn der Hintergrund entfernt werden soll, lade ein Hintergrundbild hoch. So erfährst du, wie du das Hintergrundbild aufnimmst.
-
Klicke auf „Quick Preview“, um das Klonen im Sofortmodus zu starten.
-
Nach dem Training findest du den Avatar unter „My Avatars“ und kannst ihn zur Videoerstellung nutzen.
-
Für bessere Qualität klicke auf das Symbol am Avatar-Symbol und dann im Pop-up-Fenster auf „Continue Training“.
Eigene Avatare aus Bildern erstellen
Mit MakeFun kannst du einen Avatar entweder aus einem kurzen Videoclip (dem sogenannten Basisvideo) oder aus einem Bild. In diesem Abschnitt erfährst du, wie du das Bild einer echten Person als Trainingsmaterial für deine personalisierten KI-Avatar-Videos nutzt. Im Bildmodus ist „continue training“ nicht möglich. Nach einem Klick auf „Quick Preview “ dauert das Training in der Regel unter 1 Minute. Dieser Vorgang kostet 1 . Für aus Bildern erzeugte Avatare ist „continue training“ danach weder nötig noch möglich.
Schritte: eigenen Avatar aus Bildern erstellen
-
Lade im Modul „Add Avatars“ ein Video hoch, das die Anforderungen erfüllt
- Name: Gib deinem Avatar einen Namen.
- Geschlecht: Wähle passend zum Video. Das beeinflusst die Lippensync-Ergebnisse leicht.
- Ausgangsmaterial: Wähle Image Modus zum Klonen.
- Ursprünglicher Hintergrund: Wenn der Hintergrund entfernt werden soll, lade ein Hintergrundbild hoch.
-
Klicke auf „Quick Preview“, um das Klonen im Sofortmodus zu starten.
-
Nach dem Training findest du den Avatar unter „My Avatars“ und kannst ihn zur Videoerstellung nutzen.
Deine eigene Stimme nutzen
Mit MakeFun kannst du aus einem kurzen Audioclip eine personalisierte Stimme erstellen. Bitte beachte: Unser System erkennt automatisch die Stimmen von Personen des öffentlichen Lebens und Prominenten. Verstößt dein Upload gegen unsere Nutzungsbedingungen, wird die Stimme deaktiviert und dein Konto kann gesperrt werden.
-
Klicke zuerst auf Voice Clonelege dann den Namen der Stimme fest und wähle das Geschlecht.
-
(a) Lade einen Audioclip hoch und klicke auf Start Training. So erfährst du, so bekommst du eine hochwertige Audioaufnahme. (b) Wenn du keinen Audioclip zur Hand hast, kannst du direkt auf unserer Seite aufnehmen. Klicke auf Start Recordingwähle ein Skript, das zu deinem Einsatzzweck passt, und klicke dann auf das Symbol, um zu starten. Die Aufnahme sollte 15–20 Sekunden dauern. Ist die Dauer erreicht, klicke auf Stop um die Aufnahme abzuschließen.
-
Die Ergebnisse liegen in der Regel innerhalb einer Minute vor und erscheinen im rechten Bereich. Die geklonte Stimme lässt sich im Abschnitt Voices des Moduls Create auswählen. Im Dropdown-Menü findest du deine geklonte Stimme im Abschnitt Voice Clone Abschnitt.
FAQ
F: Wie bekomme ich ein hochwertiges „Base Video“?
Empfehlungen zur Beleuchtung:
- Nutze ein Porträt-Lichtsetup im Studio, mit mindestens einer Frontlichtquelle und einem Gegenlicht (für die Kantenzeichnung).
- Bei einem Greenscreen sollte die Person mindestens 2 Meter Abstand zur Wand halten, damit das Keying sauber gelingt.
- Vermeide Kleidung oder Requisiten, die grünes Licht reflektieren.
Empfehlungen zu Umgebungsgeräuschen:
- Achte darauf, dass die Hintergrundgeräusche unter 45 dB liegen, ohne Echo oder Nachhall.
- Vermeide Geräusche von Klimaanlage und Computerlüftern. Wir empfehlen, die Klimaanlage während der Aufnahme auszuschalten.
- Prüfe vor der Aufnahme immer dein Mikrofon.
Empfehlungen zur Kamera:
- Empfohlen wird eine Spiegelreflexkamera mit mindestens 30 FPS Videoaufnahme. Die meisten unserer öffentlichen Avatare wurden mit einer Sony A7S3 oder A7M4 gefilmt.
- Auflösung: 2K bei 30 fps (oder höher, wenn es besonders scharf sein soll). MakeFun unterstützt maximal 4K.
- Format: kein HDR. MakeFun kann HDR-Video grundsätzlich dekodieren, empfehlenswert ist es aber nicht.
- Objektiv: Für Porträtaufnahmen eignet sich ein 40- oder 50-mm-Objektiv (z. B. eine 50-mm-F1.8-Festbrennweite). Blende F1.8–F2.5, Verschlusszeit höchstens 1/100 und ISO unter 800. Passe die Einstellungen an das tatsächliche Licht an.
- Je nach Hardware kannst du weitere Geräte wie Computer, Videograbber oder Teleprompter einsetzen, um die Aufnahmeanforderungen zu erfüllen.
Empfehlungen zum Mikrofon:
- Ansteckmikrofone (Lavalier) sind ideal. Platziere das Mikrofon nicht zu weit von der Person entfernt.
- Für die beste Synchronisation muss das Mikrofon mit der Kamera verbunden sein.
- Das aufgenommene Video muss den aufgenommenen Ton enthalten, exakt synchron zum Bild.
Verhalten des Modells:
- Die Kamera muss das Gesicht der Person klar erfassen.
- Das Modell sollte im Material durchgehend sprechen und darf dabei auf einen Teleprompter schauen. Der Teleprompter muss mit der Kamera fluchten.
- Die Person kann ein eigenes Skript vorbereiten oder einfaches Material nutzen, etwa bekannte Gedichte, Zahlen oder Buchstaben. Wichtig ist deutliches, lautes Sprechen. Gelegentliche Versprecher sind kein Problem — achte nicht auf Fehler, sondern auf Emotion und Mimik beim Sprechen.
- Bleibe mit den Bewegungen im Bildausschnitt und verdecke das Gesicht nicht. Allgemeine Gesten (leichte Handbewegungen, Nicken) sind in Ordnung; vermeide bedeutungstragende Gesten wie Zustimmung oder Ablehnung.
- Die Bewegungen sollten weder zu übertrieben noch zu häufig sein und dürfen das Gesicht nicht verdecken.
- Die Lippenbewegungen dürfen etwas ausgeprägter sein als beim natürlichen Sprechen.
- Alle im Video aufgenommenen Aktionen erscheinen im erzeugten Ergebnis in derselben Reihenfolge.
- Brillengestelle sind in Ordnung
Hintergrundwechsel aktivieren:
- Wenn ein Hintergrundwechsel nötig ist, nimm 1–2 Sekunden „Leeraufnahme“ ohne Person im Bild auf. Lade dann einen Screenshot dieser Leeraufnahme beim Schritt „Add Avatars“ als Original Background hoch.
- Das Hintergrundbild muss kein Greenscreen sein. Unser KI-Algorithmus unterstützt jeden Hintergrund, solange er exakt zum Hintergrund des Avatar-Videos passt.
- Wenn du vor einem Greenscreen filmst, achte darauf, dass die Person keine grüne oder blaue Kleidung trägt — sonst gibt es Probleme beim Keying.
Anforderungen an das Material:
- Das Filmmaterial sollte zwischen 30 Sekunden und 5 Minuten lang sein.
- Das Video muss Sprache enthalten, exakt synchron zu den Lippenbewegungen.
- Im Video darf nur ein Gesicht zu sehen sein.
- Umgebungsgeräusche oder andere Töne (außer der Sprache der Person) sind nicht erlaubt.
- Sprich in gemäßigtem Tempo.
- Zu langsames Sprechen kann die Lippensync-Genauigkeit verringern.
- Zu schnelles Sprechen kann die Lippensynchronisation verzerren.
F: Wie nehme ich ein hochwertiges „Base Audio“ auf?
Audiodauer: 15–60 Sekunden.
Anforderungen an die Umgebung:
- Die Hintergrundgeräusche müssen unter 45 dB liegen, ohne Echo oder Nachhall.
- Mach vor der Aufnahme einen Soundcheck.
Anforderungen an die Ausrüstung:
- Verwende ein gerichtetes Kondensatormikrofon (z. B. mit Nierencharakteristik).
Anforderungen an die Aufnahme:
- Nimm mit dem Mikrofon Audio auf, dessen Klangfarbe und Stimmung zum späteren Einsatzzweck passen (dieser Ton spiegelt sich in der synthetisierten Ausgabe wider).
- Halte das Mikrofon nicht zu nah an den Mund, um Popplaute zu vermeiden.
- Wenn du dich versprichst, mach mit dem nächsten Satz weiter, statt neu anzufangen.
- Achte darauf, dass Hall ausgeschaltet ist, und bearbeite die Originaldatei nicht nach.
Aufnahmeparameter:
- Abtastrate: 48 kHz
- Bittiefe: 16 Bit
- Kanal: Mono
- Nach der Normalisierung sollte der Pegel über 0,4 liegen.
Empfohlene Software: Adobe Audition.