1년 전
이스라엘의 연구소 Technion – Israel Institute of Technology 에서 지난 12월 이미지를 편집하는 기술을 발표했습니다.
해당 기술은 흔히 활용되는 Diffusion 기반의 모델이 아니라 Flow-based 모델을 활용하였는데요,
Flow-based모델의 특성을 살려서 Image-Editing기술에 적용한 것이 큰 특징이라고 볼 수 있겠네요.
결과물을 먼저 보면, 텍스트만 바꾸었을 뿐인데 상당히 이미지를 잘 수정하는 것을 볼 수 있습니다.

일부 변화를 의도하지 않은곳도 변화하긴 하지만 상당히 잘 반영되는 것을 알 수 있습니다.
기술적인 특성을 짚어보겠습니다.
Diffusion 모델: 원래 모델을 noising & Denoising하고 그 과정에서 이미지를 편집함.
FlowEdit 모델: 기존 프롬프트와 변경하고자하는 텍스트 프롬프트의 차이를 계산하여 그 만큼 이미지를 변환함.
이 과정을 통해 이미지에서 변화하고자하는 부분을 최대한 유지하면서 이미지를 수정할 수 있게 됩니다. 또한 가역적인 함수를 활용하는 Flow-Based모델의 특성상 계산량도 Diffusion모델보다 줄어들게 됩니다.
FlowEdit은 Diffusion모델에서 익숙한 CLIP이라는 이미지-텍스트 이해 모델을 바탕으로 텍스트간의 차이를 비교하고 이를 이미지에 반영합니다.
따라서 생성된 이미지를 변경할 때에는 최대한 프롬프트의 구조적인 모습을 지켜주는 것이 잘 활용할 수 있는 방법이 되겠네요.
특정 모델 구조에 종속적이지 않기 때문에 어떠한 모델에도 함께 사용될 수 있다는 장점이 있습니다.
프롬프트가 없는 실제 이미지의 경우, 이미지의 CLIP 표상과 목표 텍스트의 CLIP 표상을 비교하여 이미지를 편집하게 됩니다.
아래에서 각각의 다른 모델에 활용된 예시와 기존의 방법론과 비교한 이미지를 확인하실 수 있습니다.

프롬프트를 변경하여 실제 이미지를 편집한 예시

Stable Diffusion3와 Flux에 적용한 모습. 다른 이미지 편집 모델과의 비교.
아직은 해당 연구에서 사용한 기반 모델의 성능으로 인해 조금은 어색한 모습이지만
더 좋은 생성모델을 기반으로 한다면 편집도 상당히 괜찮은 결과물을 얻을 수 있을것 같네요.
출처:
https://matankleiner.github.io/flowedit/
Kulikov, Vladimir, et al. "FlowEdit: Inversion-Free Text-Based Editing Using Pre-Trained Flow Models." arXiv preprint arXiv:2412.08629 (2024).
1.7천
2
2
7
0

당신의 생각을 들려주세요
7
0
1.7천
2
