AI 모델 및 플랫폼
InstructIR: 고화질 이미지 복원
이미지는 많은 것을 전달할 수 있지만 다양한 문제들로 인해 손상될 수 있습니다. 이러한 문제들은 컴퓨터 비전의 저수준에서 흔히 저하라고 불리며, 모션 블러, 안개, 노이즈, 낮은 동적 범위 등이 있습니다. 이러한 저하는 어려운 환경 조건이나 카메라 자체의 한계로 인해 발생할 수 있습니다. 이미지 복원은 컴퓨터 비전에서 핵심적인 도전과제로, 저하된 이미지를 복원하여 고화질의 깨끗한 이미지를 얻는 것을 목표로 합니다. 이미지 복원은 복잡한 역방향 문제입니다. 왜냐하면 어떤 이미지도 여러 가지 방법으로 복원할 수 있기 때문입니다. 일부 접근 방식은 특정 저하를 대상으로 합니다. 예를 들어, 노이즈를 줄이거나 블러를 제거하거나 안개를 제거하는 것입니다.
이러한 방법은 특정 문제에 대해 좋은 결과를 줄 수 있지만 다른 유형의 저하에 일반화하기는 어렵습니다. 많은 프레임워크는 다양한 이미지 복원 작업에 대해 동일한 신경망을 사용하지만 각 신경망은 별도로 훈련됩니다. 따라서 각 저하 유형에 대해 별도의 신경 모델을 사용하는 것은 비실용적이고 시간이 많이 걸리므로 최근 이미지 복원 프레임워크는 All-In-One 복원 프록시에 중점을 두고 있습니다. All-In-One 또는 다중 저하 또는 다중 작업 이미지 복원 모델은 하나의 깊은 블라인드 이미지 복원 모델을 사용하여 이미지의 여러 유형과 수준의 저하를 별도의 모델을 훈련하지 않고 복원할 수 있습니다. 이러한 모델은 저하를 분류하는 보조 모델 또는 다차원 가이드 벡터 또는 프롬프트를 사용하여 다양한 유형의 저하를 복원하는 데 도움을 줍니다. All-In-One 모델은 일반적으로 좋은 결과를 보여주지만 여전히 역방향 문제에 대한 도전을 맞습니다.
InstructIR은 이 분야에서 획기적인 접근 방식입니다. 이는 인간이 작성한 지침을 통해 이미지 복원 모델을 안내하는 첫 번째 프레임워크입니다. 자연어 프롬프트를 처리하여 다양한 저하 유형을 고려하여 저하된 이미지에서 고화질 이미지를 복원할 수 있습니다. InstructIR은 이미지 제거, 노이즈 제거, 안개 제거, 블러 제거, 저조도 이미지 강화 등을 포함한 광범위한 이미지 복원 작업에서 최첨단 성능을 제공합니다.
이 기사는 InstructIR 프레임워크를 깊이 있게 다루고, 메커니즘, 방법론, 프레임워크의 아키텍처 및 상태 오프 더 아트 이미지 및 비디오 생성 프레임워크와의 비교를 탐구합니다. 따라서 시작해 보겠습니다.
InstructIR: 고화질 이미지 복원
이미지 복원은 컴퓨터 비전에서 기본적인 문제입니다. 왜냐하면 저하된 이미지를 복원하여 고화질의 깨끗한 이미지를 얻는 것을 목표로 하기 때문입니다. 저수준 컴퓨터 비전에서, 저하는 모션 블러, 안개, 노이즈, 낮은 동적 범위 등과 같은 이미지 내에서 관찰되는 불쾌한 효과를 나타내는 용어입니다. 이미지 복원이 역방향 문제인 이유는 어떤 이미지도 여러 가지 방법으로 복원할 수 있기 때문입니다. 일부 프레임워크는 특정 저하를 대상으로 합니다. 예를 들어, 노이즈를 줄이거나 블러를 제거하거나 안개를 제거하는 것입니다.
최근의 딥 러닝 방법은 전통적인 이미지 복원 방법보다 더 강력하고 일관된 성능을 보여주었습니다. 이러한 딥 러닝 이미지 복원 모델은 트랜스포머와 컨볼루션 신경망을 기반으로 하는 신경망을 제안합니다. 이러한 모델은 다양한 이미지 복원 작업에 대해 독립적으로 훈련될 수 있으며, 로컬 및 글로벌 특징 상호 작용을 캡처하고 강화하여 만족스럽고 일관된 성능을 제공합니다. 이러한 방법은 특정 유형의 저하에 대해 적절히 작동할 수 있지만 다른 유형의 저하에 일반화하기는 어렵습니다. 또한, 많은 기존 프레임워크는 동일한 신경망을 사용하여 다양한 이미지 복원 작업을 수행하지만, 각 신경망은 별도로 훈련됩니다. 따라서 각 저하 유형에 대해 별도의 신경 모델을 사용하는 것은 비실용적이고 시간이 많이 걸리므로 최근 이미지 복원 프레임워크는 All-In-One 복원 프록시에 중점을 두고 있습니다.
All-In-One 또는 다중 저하 또는 다중 작업 이미지 복원 모델은 하나의 깊은 블라인드 이미지 복원 모델을 사용하여 이미지의 여러 유형과 수준의 저하를 별도의 모델을 훈련하지 않고 복원할 수 있습니다. 이러한 모델은 저하를 분류하는 보조 모델 또는 다차원 가이드 벡터 또는 프롬프트를 사용하여 다양한 유형의 저하를 복원하는 데 도움을 줍니다. All-In-One 모델은 일반적으로 좋은 결과를 보여주지만 여전히 역방향 문제에 대한 도전을 맞습니다.
이미지 조작은 텍스트 기반 이미지 생성 및 텍스트 기반 이미지 편집 작업에 대해 최근 몇 년 동안 여러 프레임워크에서 구현되었습니다. 이러한 모델은 이미지에 대한 작업 또는 이미지를 설명하는 텍스트 프롬프트를 사용하여 확산 기반 모델과 함께 해당 이미지를 생성합니다. InstructIR 프레임워크의 주요 영감은 사용자 지침을 사용하여 이미지를 편집할 수 있는 InstructPix2Pix 프레임워크입니다. 따라서 사용자는 샘플 이미지를 제공하거나 추가 이미지 설명을 제공할 필요 없이 자연어 텍스트를 사용하여 모델에 작업을 지시할 수 있습니다.
이러한 기본 사항을 바탕으로, InstructIR 프레임워크는 인간이 작성한 지침을 사용하여 이미지 복원과 역방향 문제를 해결하는 최초의 컴퓨터 비전 모델입니다. 자연어 프롬프트를 사용하여 저하된 이미지를 복원하고 여러 유형의 저하를 고려할 수 있습니다. InstructIR 프레임워크는 이미지 제거, 노이즈 제거, 안개 제거, 블러 제거, 저조도 이미지 강화 등을 포함한 광범위한 이미지 복원 작업에서 최첨단 성능을 제공합니다. 기존 연구와 달리, InstructIR 프레임워크는 원시 사용자 프롬프트를 사용하여 이미지 복원을 수행합니다. InstructIR 프레임워크는 인간이 작성한 지침을 사용하여 이미지를 복원하는 데 일반화되며, InstructIR이 구현한 단일 All-In-One 모델은 이전 모델보다 더 많은 복원 작업을 다룹니다. 다음 그림은 InstructIR 프레임워크의 다양한 복원 샘플을 보여줍니다.

InstructIR: 방법 및 아키텍처
InstructIR 프레임워크의 핵심은 텍스트 인코더와 이미지 모델로 구성됩니다. 모델은 NAFNet 프레임워크를 사용하여, U-Net 아키텍처를 따르는 효율적인 이미지 복원 모델을 이미지 모델로 사용합니다. 또한, 모델은 여러 작업을 하나의 모델로 성공적으로 학습하기 위한 작업 라우팅 기법을 구현합니다. 다음 그림은 InstructIR 프레임워크의 훈련 및 평가 접근 방식을 보여줍니다.

InstructPix2Pix 모델에서 영감을 얻은 InstructIR 프레임워크는 사용자 지침을 제어 메커니즘으로 채택했습니다. 사용자 지침은 사용자가 이미지의 정확한 위치와 유형의 저하를 지정할 수 있는 명확한 방법을 제공합니다. 또한, 고정된 저하 특정 프롬프트 대신 사용자 프롬프트를 사용하면 모델의 사용성과 응용 프로그램이 향상됩니다. InstructIR 프레임워크는 사용자 프롬프트를 이해하는 능력을 갖추기 위해 대규모 언어 모델인 GPT-4를 사용하여 다양한 요청을 생성합니다.
텍스트 인코더
텍스트 인코더는 언어 모델이 사용자 프롬프트를 텍스트 임베딩 또는 고정 크기 벡터 표현으로 매핑하는 데 사용됩니다. 전통적으로, CLIP 모델의 텍스트 인코더는 텍스트 기반 이미지 생성 및 텍스트 기반 이미지 조작 모델에서 사용자 프롬프트를 인코딩하는 데 중요한 구성 요소입니다. 그러나 사용자 프롬프트는 대부분 시각적 콘텐츠가 거의 없거나 전혀 없기 때문에, CLIP 인코더는 이러한 작업에 적합하지 않습니다. InstructIR 프레임워크는 이러한 문제를 해결하기 위해 텍스트 기반 문장 인코더를 사용합니다. 문장 인코더는 수백만 개의 예제로 사전 훈련되며, 효율적이며, 다양한 사용자 프롬프트의 의미를 인코딩할 수 있습니다.
텍스트 가이드
InstructIR 프레임워크의 주요 측면은 인코딩된 지침을 이미지 모델의 제어 메커니즘으로 구현하는 것입니다. 이를 기반으로, InstructIR 프레임워크는 작업 라우팅을 위한 Instruction Construction Block (ICB)을 제안합니다. 전통적인 작업 라우팅은 채널 특징에 작업 특정 이진 마스크를 적용합니다. 그러나 InstructIR 프레임워크는 저하를 알지 못하므로, 이 기술을 직접 적용하지 않습니다. 대신, InstructIR 프레임워크는 작업 라우팅을 적용하여 이미지 특징과 인코딩된 지침을 사용하여 마스크를 생성합니다. 마스크는 시그모이드 함수를 사용하여 활성화된 선형 레이어를 통해 생성됩니다. 모델은 이후 NAFBlock을 사용하여 조건부 특징을 강화합니다.

InstructIR 프레임워크는 명시적으로 신경망 필터를 조건화하지 않지만, 마스크는 모델이 이미지 지침과 정보를 기반으로 가장 관련된 채널을 선택할 수 있도록 합니다.
InstructIR: 구현 및 결과
InstructIR 모델은 종단 간 훈련이 가능하며, 이미지 모델은 사전 훈련이 필요하지 않습니다. 텍스트 임베딩 프로젝션과 분류 헤드만 훈련하면 됩니다. 텍스트 인코더는 BGE 인코더로 초기화되며, 이는 대규모 감독 및 비감독 데이터로 사전 훈련된 일반적인 문장 인코더입니다. InstructIR 프레임워크는 NAFNet 모델을 이미지 모델로 사용하며, NAFNet 아키텍처는 4레벨 인코더-디코더로 구성되며, 각 레벨에 다양한 블록 수를 가집니다. 모델은 또한 인코더와 디코더 사이에 4개의 중간 블록을 추가하여 특징을 더욱 강화합니다. InstructIR 모델은 ICB 또는 Instruction Conditioned Block만을 사용하여 작업 라우팅을 구현합니다. InstructIR 모델은 복원된 이미지와 지상จร实 이미지 사이의 손실과 텍스트 인코더의 의도 분류 헤드에 대한 교차 엔트로피 손실을 사용하여 최적화됩니다. AdamW 최적화器를 사용하며, 배치 크기는 32이고, 학습률은 5e-4이며, 약 500 에포크 동안 훈련되며, 코사인 어닌링 학습률 감소도 구현합니다. 이미지 모델은仅 16백만 개의 매개변수로 구성되며, 텍스트 프로젝션 매개변수는 100천 개뿐이므로, InstructIR 프레임워크는 표준 GPU에서 쉽게 훈련될 수 있습니다. 이는 계산 비용을 줄이고, 적용성을 높입니다.
다중 저하 결과
다중 저하 및 다중 작업 복원에 대해, InstructIR 프레임워크는 두 가지 초기 설정을 정의합니다:
- 3D: 3개의 저하 모델을 사용하여 안개 제거, 노이즈 제거,雨 제거 문제를 해결합니다.
- 5D: 5개의 저하 모델을 사용하여 이미지 노이즈 제거, 저조도 강화, 안개 제거, 노이즈 제거,雨 제거 문제를 해결합니다.
5D 모델의 성능은 다음 표에示されて 있으며, 이는 상태 오프 더 아트 이미지 복원 및 All-In-One 모델과 비교합니다.

그림에서 볼 수 있듯이, InstructIR 프레임워크는 단순한 이미지 모델과仅 16백만 개의 매개변수로, 지침 기반 가이드를 사용하여 5개의 다른 이미지 복원 작업을 성공적으로 처리할 수 있으며, 경쟁력 있는 결과를 제공합니다. 다음 표는 3D 모델의 성능을示하며, 결과는 위의 결과와 비교할 수 있습니다.

InstructIR 프레임워크의 주요 특징은 지침 기반 이미지 복원입니다. 다음 그림은 InstructIR 모델이 다양한 지침을 이해하는 놀라운 능력을示합니다. 또한, 적대적 지침에 대해, InstructIR 모델은 강제되지 않은 동일성을 수행합니다.

최종 생각
이미지 복원은 컴퓨터 비전에서 기본적인 문제입니다. 왜냐하면 저하된 이미지를 복원하여 고화질의 깨끗한 이미지를 얻는 것을 목표로 하기 때문입니다. 저수준 컴퓨터 비전에서, 저하는 모션 블러, 안개, 노이즈, 낮은 동적 범위 등과 같은 이미지 내에서 관찰되는 불쾌한 효과를 나타내는 용어입니다. 이 기사에서, 우리는 InstructIR에 대해 논의했습니다. 이는 인간이 작성한 지침을 사용하여 이미지 복원 모델을 안내하는 세계 최초의 이미지 복원 프레임워크입니다. 자연어 프롬프트를 사용하여 저하된 이미지를 복원하고 여러 유형의 저하를 고려할 수 있습니다. InstructIR 프레임워크는 이미지 제거, 노이즈 제거, 안개 제거, 블러 제거, 저조도 이미지 강화 등을 포함한 광범위한 이미지 복원 작업에서 최첨단 성능을 제공합니다.












