본문으로 이동

ControlNet

Conaonda Wiki

ControlNet은 확산 모델의 출력을 추가 입력 신호로 정밀하게 제어할 수 있는 신경 네트워크 구조이다. 2023년 Stanford 대학에서 제안하였으며, 원본 모델의 가중치를 그대로 두고 별도의 제어 신호를 학습하는 방식으로 작동한다.

개요

기존 텍스트-이미지 생성 모델은 프롬프트로만 제어할 수 있어 정확한 구도, 자세, 깊이 등을 제어하기 어려웠다. ControlNet은 케니 엣지(Canny edge), 깊이 지도(Depth map), 자세 감지(Pose detection), 스케치(Scribble) 등 다양한 조건 신호를 모델의 추가 입력으로 사용할 수 있게 한다.

작동 원리

ControlNet은 원본 확산 모델의 가중치를 가져와 동결시킨 듀얼 브랜치를 학습한다. 학습 과정에서 원본 모델의 UNet 가중치는 고정되고, ControlNet의 복사본만 학습되어 원본 모델의 성능이 손상되지 않는다. 추론 시 두 브랜치의 출력을 합성하여 최종 이미지를 생성한다.

제어 신호의 종류

  • Canny Edge — 윤곽선 검출로 구조 제어
  • Depth Map — 깊이 정보로 공간 구성 제어
  • OpenPose — 사람의 자세를 감지하여 포즈 제어
  • Scribble — 간단한 스케치로 구도 제어
  • Normal Map — 표면 방향으로 질감 제어
  • Segmentation — 영역 분할로 색상 및 구성 요소 제어

응용 =

Stable Diffusion 생태계에서 가장 널리 사용되며, ComfyUI에서도 커스텀 노드로 지원된다. 애니메이션, 게임 에셋, 사진 편집 등 정밀한 이미지 생성이 요구되는 분야에서 활용된다.

함께 보기

  • Stable Diffusion — ControlNet이 주로 사용되는 기반 모델
  • ComfyUI — ControlNet을 노드로 지원하는 인터페이스

출처