프롬프트 엔지니어링

오픈AI의 DALL-E 3에 대한 자세한 분석

mm
Unite.AI를 Google의 선호 소스에 추가
DALL·E 3

생성적 AI 세계에서 최신 기술을 따라가기란 이름만으로도 게임의 이름입니다. 그리고 이미지 생성에 관해서는 Stable Diffusion과 Midjourney가 모두 사람들이 관심을 가지고 있는 플랫폼이었습니다 – 하지만 지금은 그렇지 않습니다.

마이크로소프트가 후원하는 오픈AI는 2023년 9월 20일에 DALL·E 3을 발표했습니다.

DALL-E 3은 단순히 이미지를 생성하는 것이 아닙니다. 그것은 당신의 아이디어를 당신이 상상한 대로 현실화하는 것입니다. 그리고 가장 좋은 부분은 무엇일까요? 그것은 빠르다는 것입니다. 정말 빠르다는 것입니다. 당신은 아이디어를 가지고 있습니다. 그것을 DALL-E 3에 입력하면, 붐! 이미지가 준비됩니다.

따라서, 이 기사에서 우리는 DALL-E 3이 무엇인지에 대해 깊이 있게 다루어 보겠습니다. 우리는 그것이 어떻게 작동하는지, 무엇이 그것을 다른 것과 차별화하는지, 그리고 왜 그것이 당신이 필요로 하는 도구일 수 있는지에 대해 이야기하겠습니다. 당신이 디자이너, 아티스트, 또는 많은 멋진 아이디어를 가진 사람이라면, 당신은 이것을 위해 남아있을 것입니다. 시작해 봅시다.

DALL·E 3의 새로운 점은 그것이 이전 버전보다 맥락을 더 잘 이해한다는 것입니다. 이전 버전은 몇 가지 세부 사항을 놓치거나 여기저기서 몇 가지 세부 사항을 무시할 수 있었지만, DALL·E 3은 정확합니다. 그것은 당신이 요청하는 정확한 세부 사항을 잡아냅니다. 따라서 당신이 상상한 그림을 제공합니다.

재미있는 부분은 무엇일까요? DALL·E 3과 ChatGPT가 이제 통합되어 있습니다.它们는 함께 당신의 아이디어를 정제하는 데 도움을 줍니다. 당신은 개념을 쏘아 올리면, ChatGPT는 프롬프트를 세부적으로 조정하는 데 도움을 주고, DALL·E 3은 그것을 현실화합니다. 만약 당신이 이미지에 만족하지 않는다면, 당신은 ChatGPT에게 프롬프트를 조정해달라고 요청할 수 있고, DALL·E 3이 다시 시도할 수 있습니다. 20달러의 월간 요금으로, 당신은 GPT-4, DALL·E 3, 그리고 많은 다른 멋진 기능에 접근할 수 있습니다.

마이크로소프트의 Bing Chat은 오픈AI의 ChatGPT보다 먼저 DALL·E 3을 사용하기 시작했습니다. 이제それは 큰 기업뿐만 아니라 모든 사람들이 무료로 사용할 수 있습니다. Bing Chat과 Bing Image Creator에 대한 통합은 그것을 사용하기 더 쉽게 만들었습니다.

확산 모델의 부상

過去 3年間, 비전 AI는 확산 모델의 부상으로 큰 발전을 이루었습니다. 특히 이미지 생성 분야에서 큰 발전을 이루었습니다. 확산 모델 이전에는 생성적 적대적 네트워크(GANs)가 이미지 생성을 위한 기술로 사용되었습니다.

GANs

GANs

그러나, 그것들은 많은 데이터와 계산 능력이 필요하다는 문제점이 있었습니다. 이것은 그것들을 다루기 어렵게 만들었습니다.

그런데, 확산 모델이 등장했습니다. 확산 모델은 데이터에 노이즈를 추가하여 데이터를 흐리게 만듭니다. 그리고나서, 그것은 이 노이즈를 제거하여 의미 있는 데이터를 재구성합니다. 이 과정은 효과적이고 자원 집중적이지 않기 때문에, 확산 모델은 AI 커뮤니티에서 핫한 주제가 되었습니다.

진짜 전환점은 2020년으로, 혁신적인 논문과 오픈AI의 CLIP 기술의 도입으로 확산 모델의 능력이 크게 향상되었습니다. 이것은 확산 모델이 텍스트-이미지 합성에서 매우 뛰어난 능력을 가지게 만들었습니다. 이것은 이미지 생성뿐만 아니라 음악 작곡과 생물의학 연구 등 다른 분야에서도 발전을 이루었습니다.

오늘날, 확산 모델은 학술적 관심의 대상뿐만 아니라 실제 상황에서 사용되고 있습니다.

생성적 모델링과 셀프 어텐션 레이어: DALL-E 3

이 분야에서 중요한 발전은 생성적 모델링의 진화입니다. 샘플링 기반 접근 방식인 오토레그레시브 생성적 모델링과 확산 프로세스가 주도하고 있습니다. 이것은 텍스트-이미지 모델에서 큰 성능 향상을 이루었습니다. 이미지 생성을离散한 단계로 나누어, 이러한 모델은 더 다루기 쉽고 신경망이 학습하기 쉽게 되었습니다.

병렬로, 셀프 어텐션 레이어의 사용이 중요한 역할을 했습니다. 이러한 레이어는 함께 쌓여, 공간적 편향 없이 이미지를 생성하는 데 도움을 주었습니다. 이것은 확산 모델이 규모가 크고 안정적이며 효율적인 대안으로 등장하는 데 기여했습니다.

이미지 생성의 도전과 해결

이미지 생성에서 제어 가능성은 여전히 도전입니다. 프롬프트를 따르는 문제, 즉 모델이 입력 텍스트에 충실히 따르지 않는 문제가 있습니다. 이를 해결하기 위해 새로운 접근 방식인 캡션 개선이 제안되었습니다. 훈련 데이터 세트에서 텍스트와 이미지의 짝을 향상시키는 데 도움을 주는 것입니다.

캡션 개선: 새로운 접근

캡션 개선은 이미지에 대한 더 나은 캡션을 생성하는 것을 포함합니다. 이것은 텍스트-이미지 모델을 더 정확하게 훈련하는 데 도움을 줍니다. 강력한 이미지 캡션어가 이미지에 대한 자세한 설명을 생성합니다. DALL-E 3은 이러한 개선된 캡션을 사용하여 인상적인 결과를 달성했습니다.

합성 데이터를 사용한 훈련

합성 데이터를 사용한 훈련의 개념은 새로운 것이 아닙니다. 그러나 여기서의 독창적인 기여는 새로운 설명적 이미지 캡션 시스템을 만드는 것입니다. 합성 캡션을 사용하여 생성적 모델을 훈련하는 것은 모델의 프롬프트를 따르는 능력에서 큰 발전을 이루었습니다.

DALL-E 3의 평가

다양한 평가와 이전 모델인 DALL-E 2와 Stable Diffusion XL과의 비교를 통해, DALL-E 3은 뛰어난 성능을 보여주었습니다. 특히 프롬프트를 따르는 능력에서 그렇습니다.

Comparison of text-to-image models on various evaluations

Comparison of text-to-image models on various evaluations

자동화된 평가와 벤치마크의 사용은 모델의 능력을 명확하게 보여주었습니다. 이것은 상태 오프 더 아트 텍스트-이미지 생성기로서의 그들의 위치를 굳혔습니다.

DALL-E 3의 프롬프트와 능력

DALL-E 3은 더 논리적이고 정제된 시각적 생성을 제공합니다. 스크롤을 내리면, DALL-E이 각 이미지를 생성하는 것을 볼 수 있습니다. 프롬프트에 대한 정확성과 상상력이 조화된 것입니다.

이전 버전과 달리, 업그레이드된 버전은 장면 내에서 객체를 자연스럽게 배치하고, 인간의 특징을 정확하게 묘사하는 데 뛰어납니다. 향상된 세부 사항과 더 높은 해상도로, 더 현실적이고 전문적인 출력을 제공합니다.

텍스트 렌더링 능력도 크게 향상되었습니다. 이전 버전의 DALL-E는 무의미한 텍스트를 생성했지만, DALL-E 3은 읽을 수 있고 전문적으로 스타일링된 텍스트를 생성할 수 있습니다.

복잡하고 세부적인 이미지 요청에 대한 모델의 이해가 크게 향상되었습니다. DALL-E 3은 자세한 설명과 여러 요소 및 특정 지침이 있는 시나리오에서 정확하게 따라갈 수 있습니다. 이것은 일관성 있고 잘 구성된 이미지를 생성하는 능력을 보여줍니다. 몇 가지 프롬프트와 해당 출력을 살펴보겠습니다.

유기차 차량용 포장지를 디자인하세요. 제품 이름과 설명을 위한 공간을 포함하세요.

DALL-E 3 images based on text prompts

DALL-E 3 images based on text prompts (Note that the left poster have wrong spelling)

야외 가구에 대한 여름 세일을 광고하는 웹 배너를 생성하세요. 이미지는 해변의 배경에 다양한 야외 가구와 'Huge Summer Savings!'이라는 텍스트를 포함합니다.

DALL-E 3 images based on text prompts

DALL-E 3 images based on text prompts

파리 여행의 빈티지 여행 포스터를 생성하세요. 아래에 'Visit Paris'라는 볼드하고 스타일링된 텍스트를 포함하세요.

DALL-E 3 images based on text prompts

DALL-E 3 images based on text prompts (Note that both posters have wrong spellings)

인도의 디와리 축제의 번잡한 장면을 생성하세요. 등불을 밝히는 가족들, 하늘에 불꽃, 전통적인 과자와 장식이 포함되어 있습니다.
DALL-E 3 images based on text prompts

DALL-E 3 images based on text prompts

고대 로마의 시장 장면을 생성하세요. 시대에 맞는 의복을 입은 사람들, 다양한 판매 물품, 그리고 당時の 건축물이 포함되어 있습니다.
DALL-E 3 images based on text prompts

DALL-E 3 images based on text prompts

유명한 역사적 인물을 현대적인 환경에 배치하여 스마트폰이나 랩톱을 사용하는 이미지를 생성하세요.
DALL-E 3 images based on text prompts

DALL-E 3 images based on text prompts

DALL-E 3의 한계와 위험

오픈AI는 DALL-E 3의 훈련 데이터에서 명시적인 내용을 필터링하기 위해 큰 걸음을 내디뎠습니다. 이것은 편향을 줄이고 모델의 출력을 개선하는 것을 목표로 합니다. 이것에는 특정한 내용 범주에 대한 특정한 필터의 적용과 더 넓은 필터의 임계값을 조정하는 것이 포함됩니다. 완화 스택에는 여러 계층의 안전 장치가 포함됩니다. 예를 들어, ChatGPT의 민감한 주제에 대한 거부 메커니즘, 정책 위반을 방지하기 위한 프롬프트 입력 분류기, 특정 내용 범주에 대한 블록 리스트, 그리고 지침에 따라 프롬프트를 조정하는 변환입니다.

그럼에도 불구하고, DALL-E 3는 공간적 관계를 이해하고, 긴 텍스트를 정확하게 렌더링하고, 특정한 이미지를 생성하는 데 한계가 있습니다. 오픈AI는 이러한 도전을 인정하고 향후 버전의 개선을 위해 노력하고 있습니다.

회사는 또한 AI 생성 이미지와 인간이 만든 이미지의 차이를 구분하는 방법을 연구하고 있습니다. 이것은 투명성과 책임 있는 AI 사용에 대한 그들의 헌신을 반영합니다.

DALL·E

DALL·E 3

DALL-E 3의 최신 버전은 특정 고객 그룹에서 시작하여 연구실과 API 서비스로 확대될 예정입니다. 그러나 무료 공개 릴리즈 날짜는 아직 확인되지 않았습니다.

오픈AI는 DALL-E 3을 통해 AI 분야에서 새로운 표준을 설정하고 있습니다. 복잡한 기술 능력과 사용자 친화적 인터페이스를 무리 없이 연결하고 있습니다. DALL-E 3을 널리 사용되는 플랫폼인 Bing에 통합하는 것은 전문 응용 프로그램에서 더 넓고 접근하기 쉬운 형태의 오락과 유틸리티로의 전환을 나타냅니다.

향후 몇 년 동안의 실제 게임 체인저는 혁신과 사용자 권한의 균형이 될 것입니다. 성공하는 회사는 단순히 AI의 한계를 넓히는 것뿐만 아니라 사용자에게 그들이 원하는 자율성과 통제를 제공하는 회사가 될 것입니다. 오픈AI는 책임 있는 AI에 대한 헌신과 함께 이 길을 조심스럽게 나아가고 있습니다. 목표는 명확합니다: 신뢰할 수 있고 포용적이며, AI의 이점이 모든 사람에게 접근 가능하도록 하는 도구를 만들기 위한 것입니다.

지난 5년 동안私は Machine Learning과 Deep Learning의 매혹적인 세계에 몰두해 왔습니다.私の熱情と専門知識は私を50以上의多様한 소프트웨어 엔지니어링 프로젝트에 기여하게 했으며, 특히 AI/ML에 중점을 두었습니다.私の継続的な 호기심은 또한私를自然어 처리로 끌어들였습니다.私は이 분야를さらに 탐구하기를熱望합니다.