Skip to main content
Qwen-Image-Layered는 알리바바의 Qwen팀에서 개발한 모델로, 이미지를 여러 개의 RGBA 레이어로 분해할 수 있습니다. 이 계층적 표현은 각 레이어가 독립적으로 조작 가능하도록 하여 다른 콘텐츠에 영향을 주지 않고도 각 레이어를 개별적으로 수정할 수 있게 합니다. 주요 특징:
  • 본질적인 편집 가능성: 각 레이어는 다른 콘텐츠에 영향을 주지 않고 독립적으로 조작 가능합니다.
  • 고화질 기본 연산: 세미틱 구성 요소를 물리적으로 분리하여 크기 조정, 위치 변경 및 색상 재조정을 지원합니다.
  • 가변 레이어 분해: 고정된 레이어 수에 제한되지 않으며 필요에 따라 3개, 4개, 8개 이상의 레이어로 분해 가능합니다.
  • 재귀적 분해: 어떤 레이어든 추가로 분해할 수 있어 무한한 분해 깊이를 구현할 수 있습니다.
관련 링크:

Qwen-Image-Layered 워크플로

ComfyUI가 최신 버전으로 업데이트되었는지 확인하세요.이 가이드의 워크플로는 워크플로 템플릿에서 확인할 수 있습니다. 템플릿에서 찾을 수 없다면, 귀하의 ComfyUI가 오래된 버전일 수 있습니다.워크플로를 로드할 때 노드가 누락되는 경우, 가능한 원인:
  1. 최신 ComfyUI 버전(최신 테스트 버전(nightly))을 사용하고 있지 않음
  2. 일부 노드가 시작 시 가져오기에 실패함

Qwen-Image-Layered 분해

이미지를 편집 가능한 RGBA 레이어로 분해하여 색상 변경, 교체, 크기 조정, 위치 변경 워크플로에 사용할 수 있습니다. Qwen-Image-Layered 워크플로 미리보기

워크플로 다운로드

JSON 워크플로 파일을 다운로드하세요

Comfy Cloud에서 실행

별도 설정 없이 ComfyUI를 온라인으로 실행하세요
입력 자료 이 파일을 LoadImage 노드 74에 업로드하세요:

coastal_smiling_woman.png

LoadImage 노드 74 · coastal_smiling_woman.png
coastal_smiling_woman.png

모델 링크

text_encoders diffusion_models vae 모델 저장 위치

FP8 버전

기본적으로 bf16을 사용하며, 이는 높은 VRAM을 요구합니다. 더 낮은 VRAM 사용을 위해 fp8 버전을 사용할 수 있습니다: 그런 다음 서브그래프 내의 Load Diffusion model 노드를 업데이트하여 이를 사용하세요.

레이어와 출력

레이어 수는 서브그래프 내의 Empty Qwen Image Layered Latent 노드에 있는 layers 위젯으로 설정합니다. 이 모델은 레이어와 함께 전체 이미지도 다시 생성하므로, 한 번의 생성은 항상 layers + 1개의 이미지로 디코딩됩니다. 첫 번째 이미지는 전체 이미지이며 레이어가 아닙니다. 이미지를 레이어로 분해하는 워크플로우에서는 입력 이미지를 재현한 것이므로, 레이어만 필요하다면 이 이미지는 버리세요. layers에는 0을 지정할 수 있으며, 이 경우 해당 이미지 하나만 얻게 됩니다. 모든 레이어를 다시 합성하면 전체 이미지가 재현됩니다. 이를 검증에 사용하세요. 레이어를 쌓아도 첫 번째 이미지가 재현되지 않는다면 분해가 의도대로 이루어지지 않은 것입니다.

레이어가 개별 이미지가 되는 방식

Empty Qwen Image Layered Latent 노드는 [batch_size, 16, layers + 1, height // 8, width // 8] 형태의 5D Latent를 할당합니다. 레이어는 세 번째 축에 놓이며, 이는 비디오 모델이 프레임을 두는 것과 같은 시간 축입니다. LatentCutToBatch 노드의 dimt로 설정하면 그 축이 배치 차원으로 옮겨지므로, VAE Decode 이후 각 레이어는 배치 안의 개별 이미지가 됩니다. 따라서 레이어의 쌓임 순서는 배치 안에서의 인덱스 그 자체이며, 인덱스 0의 전체 이미지부터 셉니다. z-index 필드도, 그 순서를 담는 레이어별 메타데이터도 없으므로 배치를 재정렬하거나 걸러내는 것은 곧 레이어를 재정렬하는 것입니다. Qwen-Image-Layered VAE는 4채널로 디코딩하므로 디코딩된 레이어는 알파 채널을 가집니다.

워크플로우 설정

샘플러 설정

이 모델은 느립니다. 원래 샘플링 설정은 단계: 50, CFG: 4.0이며, 이는 생성 시간을 최소 두 배로 늘릴 것입니다.

입력 크기

입력 크기로는 640px를 권장합니다. 고해상도 출력을 위해서는 1024px를 사용하세요.

프롬프트 (선택사항)

텍스트 프롬프트는 입력 이미지의 전반적인 내용을 설명하는 것을 목표로 하며, 부분적으로 가려진 요소들까지 포함합니다(예를 들어, 전경 객체 뒤에 숨겨진 텍스트를 명시할 수 있음). 개별 레이어의 의미적 내용을 명시적으로 제어하도록 설계된 것은 아닙니다.