AI 모델 및 플랫폼
페레트: 참조 및 그라운드 작업에서 우수한 성능
.spatial 이해를 비전-언어 학습 모델에 구현하는 것은 핵심 연구 과제로 남아 있습니다. 이 이해는 두 가지 중요한 기능을 기반으로 합니다. 참조는 모델이 특정 지역의 의미를 정확하게 해석할 수 있게 해주며, 그라운드 작업은 의미적 설명을 사용하여 이러한 지역을 위치시키는 것을 포함합니다.
개발자들은 페레트(Ferret)를 소개했습니다. 페레트는 다중 모드 대규모 언어 모델(Multimodal Large Language Model, MLLM)로, 이미지 내의 任意의粒度 또는 모양의 공간 참조를 이해하고, 열린 어휘 설명을 정확하게 그라운드할 수 있습니다. 페레트는 이미지 지역을 나타내기 위해 연속적인 기능과 이산 좌표를 결합한 새로운 하이브리드 표현을 사용합니다. 그라운드 작업과 참조 작업 모두에서 우수한 성능을 발휘합니다.
페레트의 접근 방식은 그라운드 작업과 참조 작업에서 다른 MLLM을 능가하는 성능을 발휘할 수 있게 해줍니다. 이 기사에서는 페레트의 아키텍처와 방법론을 탐구하여 다양한 다중 모드 언어 작업에서 페레트의 인상적인 성능을 강조합니다. 페레트를 더 자세히 살펴보겠습니다.
페레트: 참조 및 그라운드 작업에서 우수한 성능
모델의 참조 기능은 모델이 특정 지역의 의미를 정확하게 이해할 수 있게 해주는 기능입니다. 반면, 그라운드 작업은 모델이 의미적 설명을 사용하여 지역을 위치시키는 것을 포함합니다. 참조와 그라운드 작업은 공간 의미와 정보의 정렬이라는 동일한 기본 개념을 공유하지만, 기존 모델은 개별적으로 그라운드 작업과 참조 작업을 학습합니다. 페레트 프레임워크는 기존 MLLM 프레임워크의 이러한 간격에서 영감을 얻습니다.
- 페레트 프레임워크는 어떻게 그라운드 작업과 참조 작업의 기능을統一할 수 있으며, 어떻게 그들의 統一이 서로에게 도움이 될 수 있는지 탐구합니다.
- 인간은 다양한 유형의 지역(예: 박스, 점, 스크리블, 자유 형태)을 참조에 사용합니다. 이러한 다양한 지역을 어떻게 표현할 수 있을까요?
- 그라운드 작업과 참조 작업을 지시를 따르는 것으로, 강력하고 열린 어휘로, 실제 적용과 실시간 적용에 중요하게 만드는 방법은 무엇일까요?
페레트 프레임워크는 이러한 질문에 대한 답을 찾는 새로운 다중 모드 대규모 언어 모델입니다. 페레트 프레임워크는remarkable 글로벌 비전과 언어 이해 능력을 갖춘 다중 모드 대규모 언어 모델을 기반으로 합니다. 또한, 그라운드 작업과 참조 작업의 기능을 統一하기 위해, 페레트 프레임워크는 지역의 좌표를 자연어 숫자 형태로 표현합니다.
그러나, 실제로 자유 형태의 지역을 표현하는 것은 복잡합니다. 자유 형태의 지역은 다양한 지역을 포함할 수 있습니다(예: 마스크, 다각형, 스크리블). 이러한 지역을 좌표로 표현하는 것은 모델이 지역과 해당 좌표 간의 상관관계를 학습하는 것을 방해합니다. 또한, 자유 형태의 지역을 좌표로 표현하는 것은 계산적으로 비용이 많이 들고, 불분명합니다.
이 문제를 해결하고 모든 형태에 대해 일반화하기 위해, 페레트 프레임워크는 연속적인 시각적 기능과 이산 좌표를 결합한 새로운 하이브리드 지역 표현을 제안합니다.

연속적인 시각적 기능을 위해, 페레트 프레임워크는 먼저 대상 지역과 동일한 크기의 2D 이진 마스크를 생성하고, 대상 지역 내에서 1의 값을 할당하고, 외부에서 0의 값을 할당합니다. 모델은 이진 마스크와 추출된 이미지 기능 맵을 추출하여 공간 인식 시각 샘플러에 보냅니다.
페레트: 방법론 및 아키텍처
하이브리드 지역 표현
언어 모델이 특정 지역을 참조할 때, 점, 박스, 자유 형태의 세 가지 형태를 사용할 수 있습니다. 점과 박스 형태는 좌표로 정확하게 표현할 수 있지만, 자유 형태의 지역은 다양하여 마스크, 다각형, 스크리블을 포함할 수 있습니다. 이러한 자유 형태의 지역을 좌표로 표현하는 것은 복잡하며, 모델이 지역과 해당 좌표 간의 상관관계를 학습하는 것을 방해합니다.
이 문제를 해결하고 모든 형태에 대해 일반화하기 위해, 페레트 프레임워크는 연속적인 시각적 기능과 이산 좌표를 결합한 새로운 하이브리드 지역 표현을 제안합니다.

페레트 모델의 아키텍처는 세 가지 주요 구성 요소로 구성됩니다.
- 이미지 인코더: 이미지 임베딩을 추출합니다.
- 공간 인식 시각 샘플러: 지역의 연속적인 기능을 추출합니다.
- 대규모 언어 모델: 텍스트, 이미지, 지역 기능을 공동으로 모델링합니다.
이미지는 먼저 사전 훈련된 시각 인코더에 입력되어 이미지 임베딩이 추출됩니다. 텍스트 입력의 경우, 페레트 프레임워크는 먼저 사전 훈련된 LLM 토크나이저를 사용하여 텍스트 시퀀스를 토큰화하고, 토큰을 텍스트 임베딩으로 투영합니다. 참조 지역의 경우, 페레트는 지역 이름 뒤에 특수 토큰과 좌표를 연속적인 기능의 플레이스 홀더로 추가합니다.
참조 지역의 형태는 다양할 수 있으며, 단순한 박스나 점이 아닐 수 있습니다. 이러한 지역을 전통적인 방법으로 처리하는 것은 어렵습니다. 페레트 프레임워크는 이러한 문제를 해결하기 위해 공간 인식 시각 샘플러를 제안합니다.
GPT 지원 시각적 데이터 생성
다중 모드 대규모 언어 모델은 다이얼로그 지시 튜닝 데이터에 크게 의존합니다. 이러한 데이터는 모델이 인간의 의도를 이해하고 적절한 응답을 생성하도록 도와줍니다. 대부분의 MLLM은 시각적 지시 튜닝 데이터를 얻기 위해 少샷 프롬프트 방법을 사용합니다.
그러나, 기존의 지시 튜닝 방법은 지역 기반 지식을 Explicitly 지정하지 않습니다. 페레트 프레임워크는 지역 기반 지식을 Explicitly 지정하여 지시 튜닝 데이터를 수집합니다.
공간 부정적 마이닝
이전 연구에 따르면, 다중 모드 대규모 언어 모델은 Yes 또는 No 질문에 대한 응답에서 환상에 취할 가능성이 있습니다. 페레트 모델이 이러한 환상을 피하기 위해, 페레트 프레임워크는 공간 부정적 마이닝 접근법을 사용합니다.
페레트: 결과 및 실험
페레트 프레임워크의 성능을 분석하기 위해, 페레트는 전통적인 그라운드 작업과 참조 작업 벤치마크에서 평가되었습니다. 또한, 페레트는 더 복잡한 다중 모드 채팅 작업에서 평가되었습니다.
페레트의 참조 기능은 모델이 이미지 또는 질문에서 참조 지역의 의미를 이해하는 정확도로 평가됩니다. 페레트의 그라운드 기능은 모델이 언어 쿼리를 이미지의 지역으로 그라운드하는 정확도로 평가됩니다.

페레트는 전통적인 그라운드 작업과 참조 작업에서 우수한 성능을 발휘합니다. 또한, 페레트는 다중 모드 채팅 작업에서 참조와 그라운드 기능을 평가합니다.
최종 생각
이 기사에서, 우리는 페레트에 대해 논의했습니다. 페레트는 다중 모드 대규모 언어 모델로, 그라운드 작업과 참조 작업에서 우수한 성능을 발휘합니다. 페레트는 이미지 지역을 참조할 수 있으며, 모델이 예측한 텍스트를 자동으로 그라운드할 수 있습니다. 페레트는 다양한 지역 입력을 처리할 수 있으며, 자유 형태의 지역, 박스, 점을 포함합니다.












