Anderson의 관점

‘더 많은 레이블 다운로드!’의 환상에 대한 AI 연구

mm
Unite.AI를 Google의 선호 소스에 추가
ChatGPT-4o: 'A wall on which hundreds of photographs are stuck with thumb-tacks. Each photo depicts a different kind of subject, such as fruit or animals or bridges or buildings or people, etc. Each photo has 2-3 yellow post-it notes attached to it. We are too far away to read anything written on the post-it notes, but we can see that there are dozens and dozens of photos on the wall, and each with several post-it notes tacked on.'

현재 기계 학습 연구에서 일반적인 관점은 기계 학습 자체가 AI 데이터셋 주석의 품질, 특히 비전 언어 모델(VLMs)에 사용되는 이미지 캡션을 개선하는 데 사용될 수 있다는 것이다. 이 생각은 인간 주석의 높은 비용과 주석자 성능을 감독하는 추가 부담에 의해 주도된다.

논증할 수 있게 이 것은 2000년대初의 ‘더 많은 RAM 다운로드’ 밈과 유사한 것으로, 하드웨어 제한을 소프트웨어 기반 수정으로 해결할 수 있다는 생각을 풍자한다.

또한 이것은 간과되는 문제이다. 새로운 AI 모델은 공공 및 상업적 영역에서 널리 주목을 받는 반면, 주석은 기계 학습 파이프라인에서 사소한 세부 사항으로 나타나며, 더 넓은 프레임워크에 대한 흥분으로 인해 가려진다.

사실, 기계 학습 시스템이 패턴을 인식하고 재현하는 능력(거의 모든 AI 시스템의 중심 사용 사례)은 실제 세계의 주석의 품질과 일관성에 의존한다. 이러한 주석은 실제 사람에 의해 생성되거나 판단되며, 비이deal한 상황에서 개별 데이터 포인트에 대해 주관적인 판단을 내린다.

불가피하게, 주석자 행동의 패턴을 관찰하고 재현하려고 하는 시스템(및 인간 주석자를 대체하고 정확한 레이블링을 대규모로 촉진하는)은 인간 관찰자에서 가져온 예제에 포함되지 않은 데이터에서 잘 수행할 수 없다. 아무것도 ‘유사한’ 것은 정확히 동일하지 않으며, 교차 도메인 등가성은 컴퓨터 비전에서 문제적인 추구이다.

‘데이터의 상류’는 어딘가에서 멈추어야 하며, 이 경우 정확히 그곳에서 멈추게 된다. 즉, 인공 시스템에 데이터를 코딩하기 위해 주관적인 구별을 하는 인간 대뇌와 함께 멈추게 된다.

RAG 무역

최근까지 데이터셋 주석의 부정확성은 불완전하지만 여전히 시장성 있는 결과를 얻은 제네레이티브 AI 시스템의 맥락에서 прием할 수 있는 부수적인 손실로 간주되었다.

실제로, 싱가포르의 연구에 따르면, ‘환상’ – 즉, AI 시스템이 우리의 의도를 훼손하는 것을 발명하는 경우 – 는 이러한 시스템의 개념적 아키텍처와 함께 불가피하며, 결합되어 있다.

이를 대조하기 위해, RAG 기반 에이전트 – 인터넷 검색을 통해 사실을 ‘검증’할 수 있는 에이전트 – 는 연구 및 상업적 솔루션에서 인기를 얻고 있다. 그러나, 이러한 에이전트는 자원 비용과 쿼리 대기 시간을 추가한다. 또한, 훈련된 모델에 적용된 새로운 정보는 훈련된 모델의 네이티브 레이어의 복잡하고 깊게 얽힌 연결과 경쟁할 수 없다.

따라서 이러한 모델에 대한 주석 데이터가 처음부터 훨씬 더 결함이 없다면 더 좋을 것이다. 이것은 완벽할 수 없을 수도 있지만(인간의 주관성 영역에 침범하기 때문이다), 이것은 더 나은 접근법일 것이다.

RePOPE

독일의 새로운 논문은 오래된 광범위하게 사용되는 데이터셋에 의존하는 문제를 강조하며, 특히 비전 언어 모델의 이미지 캡션의 정확성과 신뢰성에 초점을 맞추고 있다. 연구자들의 발견은 벤치마크에서 레이블 오류가 환상을 가리거나歪曲할 수 있음을 시사한다.

이미지에 자전거가 있는지 묻는 모델의 경우, 벤치마크 데이터셋이 자전거가 없다고 말한다면 모델은 잘못된 것으로 표시된다. 그러나 실제로 이미지에 자전거가 있고 주석에서 간과되었다면, 모델의 대답은 옳은 것이었으며, 벤치마크가 실패한 것이다. 이러한 오류는 데이터셋 전체에 걸쳐 누적되어 모델의 정확성과 환상에 대한 왜곡된 그림을 제공한다.

따라서, 잘못된 또는 모호한 주석이 기준으로 취급될 때, 모델은 환상으로 나타날 수 있지만 실제로는 옳을 수 있으며, 반대로 정확해 보이지만 실제로는 그렇지 않을 수 있다. 이것은 환상과 모델 성능의 측정 및 순위를 왜곡하며, 문제를 진단하거나 해결하기更加 어렵게 만든다.

새로운 논문은 Polling-based Object Probing Evaluation(POPE)라는 광범위하게 사용되는 벤치마크를 재검토한다. POPE는 비전 언어 모델이 이미지에 특정 객체가 있는지 없는지 정확히 말할 수 있는지 테스트한다.

POPE는 Microsoft COCO: Common Objects in Context(MSCOCO) 데이터셋의 레이블을 기반으로 한다. MSCOCO는 오랫동안 좋은 수준의 주석 정확성을 제공하는 것으로 간주되어 왔다.

POPE는 객체 환상을 큰 비전 언어 모델에서 이진 분류 작업으로 재구성하여 평가한다. 생성된 캡션을 파싱하는 대신, 모델에 이미지에 특정 객체가 있는지 없는지에 대한 간단한 예/아니요 질문을 한다.

연구자들은 POPE 벤치마크의 레이블을 재검토하여 많은 레이블이 잘못되거나 불분명하다는 것을 발견했다. 이러한 오류는 모델의 순위를 변경하며, 일부 모델은 초기에 잘 수행했지만 재레이블링된 레이블에서 순위가 떨어진다.

연구자들은 이러한 시프트가 주석 오류가 모델의 실제 환상 행동을 가리게 할 수 있는 정도를 보여준다고 주장한다. 또한, mereka는 RePOPE를 더 신뢰할 수 있는 환상 취약성 평가 도구로 제시한다.

방법 및 테스트

연구자들은 원래 MSCOCO 데이터셋의 모든 주석을 재레이블링했다. 각 데이터 인스턴스에 두 명의 인간 주석자가 할당되었다. 원래 레이블의 품질에 대한 모호성이 발생한 경우(아래의 예시 참조), 이러한 결과는 테스트 라운드에서 제외되었다.

연구자들은 다양한 아키텍처와 모델 크기를 갖는 여러 개방형 가중치 모델을 POPE와 RePOPE에서 평가했다. 평가된 모델에는 OpenVLM 리더보드의 일부인 InternVL2.5, LLaVA-NeXT, Vicuna, Mistral 7b, Llama, LLaVA-OneVision, Ovis2, PaliGemma-3B, 및 PaliGemma2가 포함되었다.

결과 그래프는 레이블을 수정한 후 모델의 真陽性와 偽陽性가 어떻게 변경되는지 보여준다.

真陽性는 모든 모델에서 떨어졌으며, 모델이 잘못된 레이블에 대해 올바른 답변을 받았다는 것을 보여준다. 偽陽性는 더 다양한 패턴을 따랐다.

POPE의 ‘랜덤’ 버전에서, 많은 모델에서 偽陽性가 거의 두 배로 증가했다. 이는 실제로 이미지에 존재하지만 원래 주석에서 간과된 많은 객체가 있었다는 것을 나타낸다. 이러한 경우, 많은 모델 오류는 실제로 데이터셋 레이블링 오류였다.

POPE의 ‘적대적’ 버전에서, 질문은 빈번하게 共發生하는 객체를 기반으로 했다. 偽陽性는 감소했다. 이는 실제로 이미지에 존재하지만 레이블링되지 않은 객체가 더 높은 확률을 나타낸다.

이러한 시프트는 정밀도와 재현率에 영향을 미쳤지만, 모델의 순위는 상대적으로 안정적이었다.

POPE의 주요 평가 척도인 F1 점수는 레이블 수정에 훨씬 더 민감했다. 랜덤 서브셋에서, 원래 레이블에서 상위에 있던 모델은 RePOPE에서 하위로 떨어졌다. 다른 모델은 상위로 올라갔다.

연구자들은 주석 오류가 벤치마크 결과에 미치는 강한 영향이 높은 품질의 데이터의 필요성을 강조한다. 더 신뢰할 수 있는 환상 평가를 지원하기 위해, 연구자들은 GitHub에서 수정된 레이블을 공개했다.

그러나, 연구자들은 이 재레이블링이 벤치마크의 포화도를 완전히 해결하지는 못한다고 주장한다. 많은 모델은 여전히 真陽性와 真陰性 비율이 90% 이상을 달성한다. 연구자들은 추가적인 벤치마크, 예를 들어 DASH-B,가 RePOPE와 함께 사용되어야 한다고 제안한다.

결론

이 실험은 데이터셋의 매우 작은 규모로 인해 가능했다. 동일한 가설을 초대규모 데이터셋에서 증명하는 것은 매우 제한된 데이터 조각에서 작업을 포함하며, 매우 다양한 큰 데이터셋에서 통계적으로 대표적이고 의미적으로 일관된 그룹을 분리하는 것은 결과를歪曲할 수 있다.

即使 가능하다 하더라도, 현재의 기술 수준에서 어떤 해결책이 있을까? 주제는 결국 더 나은 및 더 많은 인간 주석의 필요성으로 돌아간다.

이 경우, ‘더 나은’과 ‘더 많은’은 각각 별도의 문제이다. 더 많은 주석을 얻을 수는 있지만, 아마존 메커니컬 터크(AMT)와 같은 최저 임금을 지불하는 경제로 인해 품질이 낮은 결과를 초래할 수 있다.

또는, 주석 작업을 모델의 의도된 사용 사례에서 더远離된 경제 지역으로 아웃소싱할 수 있다. 그러나, 주석자가 모델의 레이블을 형성할 목표 도메인에서 더远離할수록, 모델이 목표 도메인의 필요나 기대와 일치할 가능성은 낮아진다.

이것은 기계 학습 개발의 경제학에서 가장 지속적이고 해결되지 않은 도전 중 하나로 남아 있다.

첫 번째로 게시된 날: 2025년 4월 23일

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai