MakeFun AI 영상 및 이미지 iOS 앱 다운로드

MakeFun에 출시

Seedance 2.5: 전문가급 멀티모달 AI 영상

ByteDance의 차세대 전문가용 멀티모달 영상 제작 모델입니다. 긴 서사, 강력한 레퍼런스, 정밀한 편집, 다국어까지 네 가지 강화를 한 번에 담았습니다. 실제 제작 현장을 위해 만들어져, 촬영 소재를 재사용하고 납품하고 대규모로 반복 활용할 수 있습니다.

Seedance 2.5의 네 가지 강화

아래 수치는 모두 ByteDance의 공식 릴리스 노트에서 가져온 것입니다. 모델은 지금 MakeFun에서 사용할 수 있으며, 실제로 얻게 되는 것은 직접 생성한 결과물입니다.

긴 서사

한 컷이 이제 15초가 아니라 30초까지 이어집니다. 후반 작업에서 클립을 이어 붙이지 않고도 감정의 흐름을 온전히 담을 만한 길이입니다. 고품질 시간 확장 기능으로 짧은 촬영본을 더 긴 컷으로 늘리면서도 인물과 장면, 카메라의 일관성을 유지할 수 있습니다.

강력한 레퍼런스

한 번 생성할 때 최대 50개의 레퍼런스 자료를 쓸 수 있습니다. Seedance 2.0의 12개에서 크게 늘었습니다. 출연진과 여러 장소, 참고할 카메라 워크, 브랜드 음악을 한꺼번에 넣으면 모델이 이를 함께 읽어 기획안에 맞는 컷을 만들어 냅니다. 얼굴과 표정, 의상이 컷이 바뀌어도 안정적으로 유지됩니다.

정밀한 편집

기존 컷을 다음으로 넣고 @video1, 프롬프트에 바꿀 내용을 설명하면 모델이 그 부분만 다시 만들고 나머지는 그대로 둡니다. 제품을 바꾸거나 영상 스타일을 손보거나 배우의 나이나 표정을 조정하고, 워터마크를 지우거나 배경 음악을 교체할 수 있습니다.

다국어

열 개가 넘는 언어를 기본 지원해, 창작자가 번역을 거치지 않고 자기 언어로 의도를 설명할 수 있습니다. 한 번 촬영한 소재를 여러 언어의 보이스오버 버전으로 내보낼 수도 있습니다. 왼쪽 클립은 같은 장면을 영어, 프랑스어, 일본어, 스페인어, 한국어, 힌디어로 전달한 것입니다.

Seedance 2.0에서 달라진 점

ByteDance는 2.5가 2.0이 1.5를 넘어섰던 것과 같은 세대 도약은 아니라고 분명히 밝히고 있습니다. 핵심 역량의 돌파는 이미 2.0에서 이뤄졌고, 2.5는 실제 제작 현장을 겨냥한 체계적인 보강입니다.

역량 Seedance 2.0 Seedance 2.5
단일 컷 길이 15초 30초
1회 생성당 레퍼런스 자료 12 50
— 이미지 9 30 (최대 4K)
— 영상 클립 3 10
— 오디오 클립 3 10
영상 / 오디오 레퍼런스 총 길이 15초 30초
오디오만 레퍼런스로 사용 지원하지 않음 지원
기본 지원 언어 10개 이상

지금 어떤 작업을 하는지 분명히 하세요

ByteDance가 여기에 따로 한 절을 할애한 데는 이유가 있습니다. 실제 작업에서는 레퍼런스와 편집, 확장이 뒤섞이기 쉬운데, 그러면 프롬프트가 엉뚱한 곳에 들어가고 잘못된 자료를 인용하게 되어 제어력과 안정성을 잃습니다. 먼저 작업을 정하고, 그에 맞는 프롬프트를 쓰세요.

레퍼런스 생성

이럴 때: 기존 컷이 없는 경우입니다. 이미지나 영상, 오디오를 레퍼런스로 삼아 새 영상을 처음부터 만듭니다.

프롬프트 형식: 생성하고 싶은 내용을 평문으로 쓰고, 여기에 @video N @image N @audio N 를 덧붙여 각 자료를 인용합니다.

고정되는 설정: 없습니다. 화면 비율과 길이를 직접 고르시면 됩니다.

영상 편집

이럴 때: 이미 컷이 있고 그중 일부를 다시 쓰거나 교체하거나 추가하거나 지우고 싶은 경우입니다.

프롬프트 형식: 원하는 변경 내용과 함께 @video1 원본 컷을 지정하고, 필요하면 @image N 또는 @audio N에서 확인하세요.

고정되는 설정: 화면 비율은 원본을 그대로 따르므로 늘어나거나 잘리지 않습니다. 결과 길이도 원본과 약 0.3초 이내로 맞춰집니다. 출력 형식은 MOV를 권장합니다. 입력 영상은 20초 이내로 유지하세요.

영상 확장

이럴 때: 이미 컷이 있고 같은 분위기와 호흡, 스타일로 이어 가고 싶은 경우입니다.

방향: 마지막 프레임에서 앞으로, 첫 프레임에서 뒤로, 또는 두세 개 클립 사이의 빈 구간을 채우는 방식이 있습니다.

고정되는 설정: 화면 비율은 원본을 따릅니다. 새로 만들 구간의 길이는 직접 정하시면 되며, 프롬프트에 명시하세요. 여기서도 MOV를 권장합니다.

첫 프레임 및 첫·마지막 프레임

시작 프레임으로 이미지 한 장을 주거나, 시작과 끝 프레임으로 두 장을 주면 됩니다. 화면 비율은 첫 프레임을 따르며, 끝 프레임의 비율이 다르면 맞춰 늘어나므로 같은 비율의 이미지를 준비하세요. 길이는 계속 직접 정할 수 있습니다.

2.5용 프롬프트 작성법

이번 버전에서 프롬프트 엔지니어링이 달라져, 모델이 텍스트에 더 많은 것을 기대합니다. ByteDance는 감독처럼 생각하고 네 부분으로 구조화된 프롬프트를 쓰라고 안내합니다.

  • 자료를 인용하세요. 모든 이미지와 영상, 오디오 파일에 업로드 순서대로 번호를 붙이고 각각의 용도를 밝히세요. 누구의 외모인지, 어느 것이 목소리인지, 어느 것이 동작을 제공하는지, 어느 것이 장소를 정하는지 적으면 됩니다.
  • 한 줄 요약. 인물과 장소, 사건, 장르나 스타일, 그리고 특별한 카메라 워크가 있다면 함께 적습니다.
  • 장면별 상세 묘사. 컷을 순서대로 짚어 가세요. 타임스탬프도, “컷 N”도 모두 괜찮습니다. 화면 구성과 카메라 움직임, 동작, 대사, 효과음을 설명하고, 긍정문으로 쓰세요.
  • 마무리하세요. 작품 전체를 관통하는 요소를 덧붙입니다. 렌즈와 카메라 위치, 환경, 목소리, 분위기 등입니다.

공식 프롬프트 튜닝 스킬

ByteDance는 Seedance 2.5용 자체 프롬프트 엔지니어링 스킬을 적극 권장합니다. npx로 로컬에 설치되어 사용자의 AI 채팅 창 안에서 실행되며, 제3자 서비스는 개입하지 않습니다.

npx --yes skills@latest add \
  "https://arkdocs.tos-cn-beijing.volces.com/skills/" \
  --skill sd25-pe \
  --yes

그다음 이렇게 입력하세요 /sd25-pe 뒤에 초안 프롬프트를 이어서 씁니다.

네거티브 제어도 지원합니다

원하는 것을 요청하는 것만큼 원치 않는 것을 배제할 수도 있습니다. 자막과 오디오에는 각각 별도의 스위치가 있으며(“화면 자막 없음”, “배경 음악 없이 환경음과 동작음만”), 오디오는 효과음과 배경 음악, 대사로 나누어 따로 지시할 수 있습니다.

소리 없이 어긋나는 것들

  • 타임스탬프는 1초 단위로 읽힐 때 가장 정확합니다. “1초 안에 고개를 세 번 흔든다”처럼 구간 안의 횟수를 지정하는 방식은 권장하지 않습니다.
  • 스토리보드 그리드는 15컷 정도까지 잘 작동합니다. 완성도 높은 그림보다 졸라맨이나 선화가 낫고, 컷 안에 글자가 많으면 오히려 방해가 됩니다.
  • 그레이박스 프리비주얼은 정교할수록 좋은 것이 아니라 거칠수록 낫습니다. 단순한 도형을 대충 배치한 쪽이 세밀한 모델보다 더 또렷하게 읽힙니다.
  • 인물과 자료를 명시적으로 연결하세요. 이미지에만 이름을 적어 두고 프롬프트에서 그 이름을 쓰면 모델이 사람을 헷갈리기 쉽습니다.

생성할 때 조정할 수 있는 항목

위 항목은 ByteDance가 모델에 대해 공개한 설정입니다. 실제로 작업에 적용되는 것은 MakeFun 생성 폼이 제공하는 항목입니다.

  • 모드 — 레퍼런스 생성, 첫 프레임 / 첫·마지막 프레임, 영상 편집, 영상 확장 중에서 고릅니다. 이것을 가장 먼저 정하세요. 아래 설정 중 어떤 것이 자동으로 결정될지가 여기서 갈립니다.
  • 해상도 — 480p 또는 720p.
  • 화면 비율 — 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 중에서 고르거나, 올린 자료를 보고 모델이 정하게 할 수 있습니다.
  • 길이 — 초 단위로 직접 정하거나 모델에 맡기세요.
  • 출력 형식 — 편집과 확장 작업에는 MOV를 권장합니다. 색과 밝기, 영상·오디오 싱크를 더 잘 유지합니다.
  • 오디오 — 켜기 또는 끄기.
  • 배치 크기 — 한 번에 최대 8개 클립.

문서와 API

Seedance를 직접 만든 서비스에 넣으시려나요? 엔드포인트와 파라미터, 인증, 과금 정보가 모두 MakeFun 개발자 문서에 있으며, MCP 접근도 그곳에서 제공됩니다.

레퍼런스 50개, 실제로는 몇 개를 쓰는 게 좋을까

상한은 자료 50개입니다. 이미지 30개, 영상 클립 10개, 오디오 클립 10개입니다. 다만 ByteDance는 상한을 채우는 것이 목표가 아니라는 점도 분명히 밝히고 있습니다. 아래 비율은 그들의 대규모 평가 결과에서 나온 것입니다.

하드 제한

  • 이미지: 최대 30장, 4K 이하, 장당 30MB. JPEG, PNG, WebP, BMP, TIFF, GIF, HEIC, HEIF.
  • 영상: 최대 10개 클립, 480p~4K, 개당 200MB. MP4 또는 MOV. 클립당 2~30초, 합계 30초.
  • 오디오: 최대 10개 클립, 개당 15MB. MP3 또는 WAV. 클립당 2~30초, 합계 30초.
  • 영상과 오디오 한도는 합산하지 않고 각각 따로 계산합니다.

실제로 효과가 있는 방식

  • 영상이나 오디오로 인물을 지정하는 경우: 자료 1~5개가 잘 작동합니다. 6~10개도 시도해 볼 만하지만 안정성이 떨어져 여러 번 시도해야 할 수 있습니다.
  • 이런 클립은 5~10초 길이가 가장 좋습니다. 2초는 식별하기에 정보가 너무 적고, 30초는 특징이 희석되고 노이즈가 늘어납니다.
  • 정지 이미지로 인물을 지정하는 경우: 1~8장이 잘 작동하고, 9~12장도 시도해 볼 만합니다.
  • 인물은 최대 5명까지이며, 단일 시점 이미지와 다중 시점 이미지 모두 괜찮습니다. 5명을 넘으면 단일 시점이 더 안정적이므로, 여러 각도를 한 장에 몰아넣지 말고 각각 다른 이미지로 나누세요.

‘주체’란 컷 전체에서 흔들리지 않게 유지하고 싶은 핵심 요소를 뜻합니다. 인물이나 대표 제품·소품, 장소, 전체 스타일이 여기 해당합니다. “숲에서 활로 토끼를 쏘는 사람”이라면 사람과 활, 토끼가 세 개의 주체입니다.

MakeFun에서 Seedance를 쓰는 이유

구독 없이 무료로 시작

월 정액제 없이 생성할 수 있습니다. Seedance 2.5는 보유한 크레딧으로 작동하며, 첫 클립을 만들기 전에 따로 활성화할 것도 없습니다.

모든 모델이 한곳에

Seedance, Kling, Wan, Sora, Veo, Seedream 등이 계정 하나, 잔액 하나로 묶여 있습니다. 여러 도구를 각각 결제하는 대신 같은 기획안으로 비교해 보세요.

납품을 염두에 둔 설계

립싱크와 보이스 클론, 페이스·헤드 스왑, 자막 제거, 업스케일이 생성 기능과 나란히 있어, 한곳에서 프롬프트부터 완성 결과물까지 이어집니다.

MakeFun의 관련 AI 영상 모델

  • Wan 3.0 — 통이완샹의 올인원 모델로, MakeFun에서도 사용할 수 있습니다. 같은 기획안으로 둘을 비교해 보세요.
  • Seedance 2.0 — 네이티브 오디오와 멀티 컷 스토리텔링을 갖춘 이전 세대 모델입니다.
  • Seedance 1.5 Pro — 이전 세대 모델로, 여전히 빠르고 경제적인 선택지입니다.
  • Kling 2.6Sora 2 — 같은 기획안으로 비교해 볼 만한 다른 영상 모델들입니다.
  • 립싱크영상에서 오디오 추출 — 생성된 영상을 마무리하는 도구입니다.