spark logo
Spark AI 순위
커뮤니티 홈으로
아이언맨
AI 전문가
1년 전

1년 전

ImageFX(Imagen3)

다양한 이미지 생성 서비스가 있지만, 거의 미드저니가 압도적으로 좋은 성능을 보여주고 있었죠,

최근 Google의 ImageFX를 써보시면서 과연 ImageFx가 미드저니를 대체할것인가 궁금하신 분들이 많으실것 같습니다.

이번 글에서는 ImageFX서비스의 메인 엔진인 Google DeepMind의 Imagen3를 분석한 내용을 공유드리고자 합니다.


Imagen3의 특징 크게 2 가지로 정리해보았습니다.

1 Data

  • 데이터 구성: 측면에서 구체적인 내용을 밝히고 있지는 않지만 이미지, 텍스트 및 관련 어노테이션으로 이루어져있다고 합니다. 이미지와 텍스트는 일반적인 부분이고 관련 어노테이션은 이미지의 메타데이터로 이루어져 있을것으로 추측해볼 수 있을것 같네요.

  • 데이터 필터링: 좋은 데이터를 사용하기 위하여 많은 필터링을 거쳤다고 합니다. 안전, 폭력, 낮은 품질의 데이터를 배제하고 특이점으로는 AI가 만든 데이터를 배제하기 위해 노력했다고 하네요. 또한 데이터의 다양성과 균일성을 위해 을 위해 유사한 데이터가 너무 많아지지 않도록 노력했다고 하네요.

2 LLM

  • 합성 텍스트: 다만 텍스트 데이터에서는 오히려 AI의 힘을 빌렸다고 하는데요, Gemini가 생성한 텍스트를 활용하여 학습했다고 합니다.

  • 이를 통해 긴 텍스트의 입력도 더 잘 이해할 수 있게 되었고, 데이터의 다양성과 균일성도 향상되었기 때문에 소규모의 언어모델이 탑재된 다른 모델에 비해 이전에는 잘 만들지 못했던 이미지들도 만들 수 있게 된것으로 추측해볼 수 있습니다.(예: 한국적인 이미지)


다만, 최근 인공지능 서비스를 활용하는 시장들이 커지면서 기업들이 점점 기술을 공개하지 않는 방향으로 돌아서고 있는것이 아쉽게 느껴집니다. 제가 참고한 기술 보고서에도 간략하게 언급되어있을 뿐, 이후에는 성능적인 면만 언급이 되어있는것을 볼 수 있었습니다.

그럼에도 불구하고 사용자 입장에서는 여러개의 서비스를 활용할 수 있는 선택지가 늘어나는 것이 좋은 일이라 생각합니다.

출처: Baldridge, Jason, et al. "Imagen 3." arXiv preprint arXiv:2408.07009 (2024).

service icon

Midjourney

미드저니

verified mark
service icon

Imagen

이마젠

verified mark

1.6천

2

1

4

0

당신의 생각을 들려주세요

4

0

1.6천

2

mobile bookmark image
문화데이터 활용 영상 제작 AI 챌린지
하루동안 보지않기