튜토리얼: MakeFun 디지털 휴먼 영상 합성 플랫폼 시작하기
MakeFun 아바타 영상 합성 플랫폼을 선택해 주셔서 감사합니다. 2021년부터 개발해 온 MakeFun의 아바타 립싱크·보이스 클론 기술은 가장 간단하면서도 가장 강력한 아바타 생성 플랫폼을 지향합니다. 이곳에서 나만의 AI 아바타와 목소리를 만들고, 텍스트를 입력하는 것만으로 디지털 분신의 영상을 생성할 수 있습니다. 또는 미리 준비된 아바타와 목소리를 사용해 스크립트를 구성하는 방식으로 영상을 만들 수도 있습니다.
로그인
-
Gmail 또는 다른 이메일로 다음 주소에서 로그인하세요: https://makefun.ai/app. 권장 브라우저: Microsoft Edge 또는 Chrome 데스크톱 환경에서 가장 쾌적하게 이용할 수 있습니다.
-
아직 계정이 없다면 “Register”를 눌러 새 계정을 만드세요. 초대 코드가 있다면 Q&A 섹션에서 입력 방법을 확인하시면 됩니다.
-
모바일에서는 다음 주소로 접속하세요: https://makefun.ai/app. 참고: 모바일 버전은 기능이 제한적입니다. 가능하면 데스크톱 버전을 이용해 주세요.
첫 영상 만들기
로그인한 뒤 아바타 영상을 한번 만들어 보세요:
-
“Create” 모듈로 이동합니다.
-
영상 이름을 정합니다.
-
아바타가 읽을 스크립트를 입력합니다.
-
알맞은 언어와 음색을 선택한 뒤 “Preview Audio”를 누릅니다.
-
오디오 미리듣기가 정상적으로 끝나면 버튼이 “Create Video”로 바뀝니다. 컴퓨터에서 합성된 아바타 목소리도 들을 수 있습니다.
-
오디오로 영상을 생성하는 데 필요한 코인 수가 표시됩니다. 미리듣기 결과와 코인 비용이 괜찮다면 “Synthesize Video”를 눌러 영상을 생성하세요.
-
플랫폼이 결과 페이지로 이동시켜 주며, 잠시 기다리면 영상을 내려받을 수 있습니다.
-
진행 상황을 확인하고 완성된 영상을 찾으려면 “My Results” 모듈로 이동하세요.
영상 합성 고급 기능
다른 아바타 선택하기
다음 중에서 선택할 수 있습니다:
- My Avatars: 나만의 아바타를 만드는 방법은 여기에서 확인하세요.
- Public Avatars: 참고용 예시로 제공됩니다. 참고: 이 아바타들은 사용자의 국가에서 저작권이나 상업적 이용이 보장되지 않을 수 있습니다.
아바타 종류: “My Avatars”를 누르면 각 아바타에 다음 표시가 붙어 있는 것을 볼 수 있습니다 — 또는 에서 확인하세요.
- 다이아몬드: “Continue Training”의 결과입니다. 더 높은 립싱크 품질과 사실감을 위해 학습된 아바타입니다. “continue training” 사용 방법 알아보기 여기에서 확인하세요.
- 번개: “Quick Preview”의 결과입니다. 기본적인 립싱크 품질을 제공합니다. “continue training”을 눌렀지만 학습이 아직 끝나지 않았다면 표시도 함께 나타납니다. 다시 말해, 학습이 완료된 아바타에만 다음 표시가 붙습니다 — 에서 확인하세요. 번개 는 이미지 한 장으로 만든 아바타나, 오디오와 입 모양이 동기화되지 않은 학습 영상에 적합합니다.
목소리 선택하기
- 스크립트에 어울리는 목소리를 고르세요. MakeFun은 수십 개 언어와 수백 가지 음색을 지원합니다.
- 복제한 내 목소리로 더빙할 수도 있습니다. 나만의 복제 음성을 만드는 방법은 다음에서 확인하세요 여기에서 확인하세요.
자동 자막
- 영상에 자막을 넣으려면 아바타 영상 아래의 “Caption”을 켜고 글꼴과 색상, 배경을 설정하세요.
- 참고: 자동 자막은 텍스트 기반 영상에서만 지원되며, 오디오 기반 영상에서는 사용할 수 없습니다.
배경 바꾸기
- 아바타 영상의 배경을 바꾸고 싶다면 “Background”를 누르세요. 모든 아바타가 배경 변경을 지원하지는 않습니다. “Background” 옵션에서 지원 여부를 확인하고, 지원하지 않으면 다른 아바타를 선택하세요.
- “My Avatars”의 맞춤 아바타에서 배경 변경을 사용하려면, 아바타를 만드는 단계에서 배경을 미리 설정해 두어야 합니다.
선택한 아바타가 배경 변경을 지원한다면 다음이 가능합니다:
- 플랫폼이 제공하는 이미지를 사용합니다.
- 직접 만든 이미지나 영상을 배경으로 업로드합니다.
영상으로 맞춤 아바타 만들기
MakeFun에서는 짧은 영상 클립(이른바 베이스 영상) 또는 이미지로 아바타를 만들 수 있습니다. 이 섹션에서는 실제 인물의 짧은 베이스 영상 을 업로드해 개인 맞춤 AI 아바타 영상 생성을 위한 학습 데이터로 사용하는 방법을 설명합니다. 베이스 영상 이 이후 영상의 해상도와 입 모양, 동작, 의상, 소품을 결정합니다. 고품질 아바타를 만들려면 베이스 영상 이 특정 요건을 충족해야 합니다. 다음을 사용하려면 API, 이 섹션에서 API의 각 파라미터가 무엇을 뜻하는지 확인하세요. “My Avatars”를 얻는 학습 방식은 두 가지입니다:
- “Quick Preview ”: 학습은 보통 1분 이내에 끝납니다. 이 과정은 무료입니다 (다이아몬드가 소모되지 않습니다). 이미지 한 장으로 만든 아바타나 오디오와 입 모양이 동기화되지 않은 학습 영상에는 이 방식만 적합합니다. 학습 결과에는 다음 표시가 붙습니다 — 에서 확인하세요.
- “Continue Training ”: 학습은 보통 60분 이내에 끝납니다. 이 과정에는 다음이 1개 소모됩니다 — . “continue training”의 결과는 대체로 “Quick Preview”보다 립싱크 품질이 훨씬 좋습니다. 결과에는 다음 표시가 붙습니다 — . “continue training”을 적용하려면 먼저 다음을 업로드하고 베이스 영상 “quick preview”를 마친 뒤 다음을 누르세요 — 아이콘을 누르세요. 그러면 “Continue Training ”이 나타나고, 이를 클릭합니다. 약 60분을 기다리면 아바타 아이콘에 다음 표시가 붙습니다 — “Create” 모듈에서 확인할 수 있습니다.
영상으로 맞춤 아바타를 만드는 단계
-
“Add Avatars” 모듈에서 요건에 맞는 영상을 업로드합니다
- 이름: 아바타 이름을 입력합니다.
- 성별: 영상에 맞게 선택합니다. 립싱크 결과에 약간의 영향을 줍니다.
- 원본 소재: 복제에 사용할 Video 항목을 선택합니다.
- 원본 배경: 배경을 제거하려면 배경 이미지를 업로드하세요. 배경 이미지를 촬영하는 방법은 여기에서 확인하세요.
-
“Quick Preview”를 눌러 즉시 모드 복제를 시작합니다.
-
학습이 끝나면 “My Avatars”에서 아바타를 확인하고 영상 제작에 사용할 수 있습니다.
-
품질을 더 높이려면 아바타 아이콘의 아이콘을 누른 뒤, 팝업 창에서 “Continue Training”을 선택하세요.
이미지로 맞춤 아바타 만들기
MakeFun에서는 짧은 영상 클립(이른바 베이스 영상) 또는 이미지로 만들 수 있습니다. 이 섹션에서는 실제 인물의 이미지를 학습 데이터로 사용해 개인 맞춤 AI 아바타 영상을 생성하는 방법을 설명합니다. 이미지 모드를 선택하면 “continue training”은 사용할 수 없습니다. “Quick Preview ”를 누르면 학습은 보통 1분 이내에 끝납니다. 이 과정에는 다음이 1개 소모됩니다 — . 이미지로 만든 아바타에는 이후 “continue training”이 필요하지도, 가능하지도 않습니다.
이미지로 맞춤 아바타를 만드는 단계
-
“Add Avatars” 모듈에서 요건에 맞는 영상을 업로드합니다
- 이름: 아바타 이름을 입력합니다.
- 성별: 영상에 맞게 선택합니다. 립싱크 결과에 약간의 영향을 줍니다.
- 원본 소재: 복제에 사용할 Image 모드를 복제에 사용합니다.
- 원본 배경: 배경을 제거하려면 배경 이미지를 업로드하세요.
-
“Quick Preview”를 눌러 즉시 모드 복제를 시작합니다.
-
학습이 끝나면 “My Avatars”에서 아바타를 확인하고 영상 제작에 사용할 수 있습니다.
내 목소리 사용하기
MakeFun에서는 짧은 오디오 클립으로 개인 맞춤 음성을 만들 수 있습니다. 저희 시스템은 공인과 유명인의 목소리를 자동으로 감지합니다. 제출물이 이용약관을 위반하면 해당 음성은 비활성화되고 계정이 정지될 수 있습니다.
-
먼저 다음을 누른 뒤 Voice Clone음성 이름을 정하고 성별을 선택합니다.
-
(a) 오디오 클립을 업로드하고 다음을 누릅니다 — Start Training에서 확인하세요. 배경 이미지를 촬영하는 방법은 고품질 오디오를 녹음하는 방법. (b) 준비된 오디오 클립이 없다면 웹페이지에서 바로 녹음할 수 있습니다. 다음을 누르고 Start Recording용도에 맞는 스크립트를 고른 다음, 시작하려면 다음 아이콘을 누르세요. 녹음은 15~20초 분량이어야 합니다. 해당 길이에 도달하면 다음을 눌러 Stop 녹음을 마무리합니다.
-
결과는 보통 1분 이내에 준비되며 오른쪽 패널에 표시됩니다. 복제된 음성은 다음 모듈의 Voices 섹션에서 선택할 수 있습니다 — Create 드롭다운 메뉴의 다음 섹션에서 복제된 음성을 찾을 수 있습니다 — Voice Clone 섹션.
자주 묻는 질문
Q: 고품질 “Base Video”는 어떻게 촬영하나요?
조명 권장 사항:
- 스튜디오에서 인물용 조명을 구성하고, 최소한 전면 광원 하나와 백라이트(윤곽을 살리는 역광)를 사용하세요.
- 그린스크린을 사용한다면 인물(모델)을 배경에서 최소 2미터 떨어뜨려야 키잉 결과가 가장 좋습니다.
- 초록빛을 반사하는 의상이나 소품은 피하세요.
주변 소음 권장 사항:
- 배경 소음은 45dB 미만으로 유지하고, 울림이나 잔향이 없어야 합니다.
- 에어컨과 컴퓨터 팬 소음을 피하세요. 촬영 중에는 실내 에어컨을 끄시길 권장합니다.
- 녹화 전에는 항상 마이크를 점검하세요.
카메라 권장 사항:
- 최소 30FPS 영상 녹화가 가능한 DSLR을 권장합니다. 저희 공개 아바타 대부분은 Sony A7S3 또는 A7M4로 촬영했습니다.
- 해상도: 30fps에서 2K(고화질이 필요하면 그 이상). MakeFun은 최대 4K까지 지원합니다.
- 포맷: HDR이 아닌 영상. MakeFun은 기본적인 HDR 디코딩을 지원하지만 권장하지는 않습니다.
- 렌즈: 인물 촬영에는 40mm 또는 50mm 렌즈(예: 50mm F1.8 단렌즈)를 사용하세요. 조리개 F1.8~F2.5, 셔터 속도는 1/100 이하, ISO는 800 미만이 좋습니다. 실제 조명 조건에 맞춰 조정하세요.
- 보유한 장비에 따라 컴퓨터, 캡처 카드, 프롬프터 등 다른 기기를 활용해 촬영 요건을 맞추세요.
마이크 권장 사항:
- 라발리에 마이크(클립형)를 권장합니다. 마이크를 인물에게서 너무 멀리 두지 마세요.
- 가장 정확한 동기화를 위해 마이크는 카메라에 연결해야 합니다.
- 녹화된 영상에는 녹음된 오디오가 포함되어야 하며, 오디오와 영상이 정확히 동기화되어 있어야 합니다.
모델의 동작:
- 카메라가 인물의 얼굴을 또렷하게 담아야 합니다.
- 모델은 촬영 내내 말을 이어가야 하며, 말하는 동안 프롬프터를 봐도 됩니다. 프롬프터는 카메라와 같은 방향에 두어야 합니다.
- 인물은 직접 준비한 대본을 쓰거나 익숙한 시, 숫자, 알파벳처럼 간단한 소재를 사용해도 됩니다. 또렷하고 충분한 크기로 말하세요. 중간에 실수가 있어도 괜찮습니다. 실수에 신경 쓰지 말고, 말할 때의 감정과 표정에 집중하세요.
- 동작은 화면 안에서만 하고 얼굴을 가리지 마세요. 손을 살짝 움직이거나 고개를 끄덕이는 일반적인 제스처는 괜찮지만, 찬성·반대처럼 의미가 담긴 동작은 피하세요.
- 동작이 지나치게 과장되거나 잦아서는 안 되며, 얼굴을 가려서도 안 됩니다.
- 입 모양은 평소 말할 때보다 약간 크게 해도 좋습니다.
- 영상에 담긴 모든 동작은 생성 결과물에도 같은 순서로 나타납니다.
- 뿔테 안경은 착용해도 괜찮습니다
배경 변경을 사용하려면:
- 영상에서 배경 교체 기능을 사용하려면, 인물이 프레임에 없는 상태로 1~2초 분량의 ‘빈 장면’을 촬영하세요. 그런 다음 “Add Avatars” 과정에서 이 빈 장면의 스크린샷을 Original Background로 업로드하면 됩니다.
- 배경 이미지가 반드시 그린스크린일 필요는 없습니다. 아바타 영상의 배경과 정확히 일치하기만 하면 어떤 배경이든 저희 AI 알고리즘이 처리할 수 있습니다.
- 그린스크린 환경에서 모델을 촬영한다면, 키잉 문제를 막기 위해 초록색이나 파란색 의상은 피해야 합니다.
결과물 요건:
- 촬영 영상은 30초에서 5분 사이여야 합니다.
- 영상에는 말소리가 포함되어야 하며, 오디오와 입 모양이 정확히 동기화되어야 합니다.
- 영상에는 얼굴이 하나만 나와야 합니다.
- 인물의 말소리 외에 환경 소음이나 다른 소리가 들어가서는 안 됩니다.
- 말하는 속도는 적당하게 유지하세요.
- 너무 느리게 말하면 립싱크 정확도가 떨어질 수 있습니다.
- 너무 빠르게 말하면 립싱크가 어긋날 수 있습니다.
Q: 고품질 “Base Audio”는 어떻게 녹음하나요?
오디오 길이: 15~60초.
환경 요건:
- 배경 소음은 45dB 미만이어야 하며, 울림이나 잔향이 없어야 합니다.
- 녹음 전에 사운드 체크를 하세요.
장비 요건:
- 지향성 콘덴서 마이크(예: 카디오이드 마이크)를 사용하세요.
녹음 요건:
- 실제 용도에 맞는 음색과 분위기로 마이크에 녹음하세요(이 톤이 합성 결과물에 그대로 반영됩니다).
- 파열음이 생기지 않도록 마이크를 입에 너무 가까이 두지 마세요.
- 실수를 했다면 처음부터 다시 하지 말고 다음 문장으로 넘어가세요.
- 리버브는 반드시 끄고, 원본 오디오 파일에는 어떤 후처리도 하지 마세요.
녹음 파라미터:
- 샘플레이트: 48kHz
- 비트 심도: 16비트
- 채널: 모노
- 노멀라이즈 후 게인은 0.4 이상이어야 합니다.
권장 소프트웨어: Adobe Audition.