Skip to main content
Wan FLF2V (첫 번째와 마지막 프레임 동영상 생성)는 알리바바 퉁이 완샹팀이 개발한 오픈소스 동영상 생성 모델입니다. 이 모델의 오픈소스 라이선스는 Apache 2.0입니다. 사용자는 시작 프레임과 종료 프레임으로 두 장의 이미지만 제공하면, 모델이 자동으로 중간 전환 프레임을 생성해 논리적으로 일관되고 자연스럽게 흐르는 720p 고화질 동영상을 출력합니다. 핵심 기술 포인트
  1. 정밀한 첫 번째와 마지막 프레임 제어: 첫 번째와 마지막 프레임의 일치율은 98%에 달하며, 시작 및 종료 장면을 통해 동영상 경계를 정의하고, 중간의 역동적 변화를 지능적으로 채워 장면 전환과 객체 변형 효과를 구현합니다.
  2. 안정적이고 부드러운 동영상 생성: CLIP 시맨틱 특징과 교차 어텐션 메커니즘을 사용해 비슷한 모델 대비 동영상의 흔들림률을 37% 줄여 자연스럽고 매끄러운 전환을 보장합니다.
  3. 다양한 창작 기능: 중국어 및 영어 자막의 동적 삽입, 애니메이션/리얼리즘/판타지 등 다양한 스타일의 생성을 지원해 다양한 창작 요구에 맞춥니다.
  4. 720p HD 출력: 후처리 없이 바로 1280×720 해상도의 동영상을 생성하며, 소셜미디어 및 상업적 응용에 적합합니다.
  5. 오픈소스 생태계 지원: 모델 가중치, 코드 및 학습 프레임워크가 완전히 오픈소스로 공개되어 주류 AI 플랫폼에서도 배포 가능합니다.
기술 원리 및 아키텍처
  1. DiT 아키텍처: 확산 모델과 Diffusion Transformer 아키텍처를 기반으로 하며, Full Attention 메커니즘을 결합해 시공간 의존성 모델링을 최적화해 동영상의 일관성을 보장합니다.
  2. 3D 인과 변분 인코더: Wan-VAE 기술은 HD 프레임을 1/128 크기로 압축하면서 미세한 동적 디테일을 유지해 메모리 요구량을 크게 줄입니다.
  3. 3단계 학습 전략: 480P 해상도 사전 학습에서 시작해 점진적으로 720P로 업그레이드하며 단계별 최적화를 통해 생성 품질과 계산 효율성을 균형 있게 조절합니다.
관련 링크
ComfyUI가 최신 버전으로 업데이트되었는지 확인하세요.이 가이드의 워크플로는 워크플로 템플릿에서 확인할 수 있습니다. 템플릿에서 찾을 수 없다면, 귀하의 ComfyUI가 오래된 버전일 수 있습니다.워크플로를 로드할 때 노드가 누락되는 경우, 가능한 원인:
  1. 최신 ComfyUI 버전(최신 테스트 버전(nightly))을 사용하고 있지 않음
  2. 일부 노드가 시작 시 가져오기에 실패함

Wan2.1 FLF2V 720P ComfyUI 네이티브 워크플로 예제

1. 워크플로 파일 및 관련 입력 파일 다운로드

이 모델은 고해상도 이미지로 학습되었으므로 작은 크기를 사용하면 좋은 결과를 얻기 어려울 수 있습니다. 예제에서는 720×1280 크기를 사용하며, 이는 낮은 VRAM을 가진 사용자가 원활하게 실행하기 어려울 수 있고 생성 시간도 오래 걸립니다. 필요하다면 동영상 생성 크기를 조정해 테스트해보세요. 작은 크기로 생성하면 이 모델에서 좋은 출력을 얻기 어려울 수 있으니 참고하세요.
ComfyUI를 최신 버전으로 업데이트한 후, 워크플로 파일을 다운로드하여 ComfyUI로 드래그하거나, WorkflowBrowse TemplatesVideo에 있는 템플릿 라이브러리에서 “Wan2.1 FLF2V 720P”를 찾으세요. Wan2.1 FLF2V 720P 워크플로 미리보기

Comfy Cloud에서 실행

Comfy Cloud에서 열기

워크플로 다운로드

템플릿 라이브러리에서 “Wan2.1 FLF2V” 검색하거나 JSON 다운로드

시작 이미지: wan2.1_flf2v_720_f16_start_image.png

동영상 생성을 위한 시작 프레임 (LoadImage 노드 52). 이 이미지를 다운로드하여 사용하거나, 원하는 이미지로 대체하세요.

종료 이미지: wan2.1_flf2v_720_f16_end_image.png

동영상 생성을 위한 종료 프레임 (LoadImage 노드 72). 이 이미지를 다운로드하여 사용하거나, 원하는 이미지로 대체하세요.

2. 수동 모델 설치

이 가이드에 포함된 모든 모델은 여기에서 확인할 수 있습니다. Diffusion Models: 하드웨어에 따라 버전을 선택하세요.

Diffusion Model: Wan2.1 FLF2V 14B FP16

wan2.1_flf2v_720p_14B_fp16.safetensors: 전체 정밀도, 더 많은 VRAM 필요. ComfyUI/models/diffusion_models/에 배치

Diffusion Model: Wan2.1 FLF2V 14B FP8

wan2.1_flf2v_720p_14B_fp8_e4m3fn.safetensors: 양자화 버전, 더 낮은 VRAM 사용. ComfyUI/models/diffusion_models/에 배치
이전에 Wan Video 관련 워크플로를 시도해 보셨다면 다음 파일들을 이미 가지고 계실 수 있습니다.
Text Encoders: 하나의 버전을 선택하세요.

Text Encoder: UMT5 XXL FP16

umt5_xxl_fp16.safetensors: 전체 정밀도 텍스트 인코더. ComfyUI/models/text_encoders/에 배치

Text Encoder: UMT5 XXL FP8

umt5_xxl_fp8_e4m3fn_scaled.safetensors: 양자화 텍스트 인코더. ComfyUI/models/text_encoders/에 배치
VAE

VAE: Wan2.1 VAE

wan_2.1_vae.safetensors: 인코딩/디코딩용 Wan2.1 VAE. ComfyUI/models/vae/에 배치
CLIP Vision

CLIP Vision: CLIP Vision H

clip_vision_h.safetensors: CLIP Vision 인코더. ComfyUI/models/clip_vision/에 배치
파일 저장 위치

3. 워크플로 단계별 실행

Wan2.1 FLF2V 720P 네이티브 워크플로 단계
  1. Load Diffusion Model 노드가 wan2.1_flf2v_720p_14B_fp16.safetensors 또는 wan2.1_flf2v_720p_14B_fp8_e4m3fn.safetensors를 로드했는지 확인합니다.
  2. Load CLIP 노드가 umt5_xxl_fp8_e4m3fn_scaled.safetensors를 로드했는지 확인합니다.
  3. Load VAE 노드가 wan_2.1_vae.safetensors를 로드했는지 확인합니다.
  4. Load CLIP Vision 노드가 clip_vision_h.safetensors를 로드했는지 확인합니다.
  5. 시작 프레임을 Start_image 노드에 업로드합니다.
  6. 종료 프레임을 End_image 노드에 업로드합니다.
  7. (선택 사항) 긍정 및 네거티브 프롬프트를 수정합니다. 중국어와 영어 모두 지원됩니다.
  8. (중요) WanFirstLastFrameToVideo에서는 기본 크기로 7201280을 사용합니다. 720P 모델이므로 작은 크기를 사용하면 좋은 출력을 얻을 수 없습니다. 좋은 생성 결과를 위해 7201280 정도의 크기를 사용하세요.
  9. Run 버튼을 클릭하거나 단축키 Ctrl(cmd) + Enter를 사용해 동영상 생성을 실행합니다.