AI 모델 및 플랫폼
멀티모달 AI의 진화: ChatGPT와 GPT-4V(ision)
인공 지능을 인간과 더욱 비슷하게 만들기 위한 노력의 일환으로, OpenAI의 GPT 모델은 지속적으로 경계를 확장해 왔다. GPT-4는 이제 텍스트와 이미지 모두를 입력으로 받아들일 수 있다.
멀티모달 제너레이티브 AI는 텍스트, 이미지, 오디오와 같은 다양한 출력을 생성할 수 있는 모델을 의미한다. 이러한 모델들은 특정 데이터에 대해 훈련되어 새로운 데이터를 생성할 수 있는 기본 패턴을 학습한다. 이는 AI 애플리케이션을 더욱 풍부하게 만든다.
멀티모달 AI의 최근 발전
이 분야에서 최근 주목할 만한 발전은 DALL-E 3가 ChatGPT에 통합된 것이다. 이는 OpenAI의 텍스트-이미지 기술에서 중요한 업그레이드이다. 이 결합은 사용자가 아이디어를 생동감 있는 AI 생성 아트로 바꾸는 데 도움을 주는 더 원활한 상호작용을 허용한다. 사용자는 직접 DALL-E 3와 상호작용할 수 있지만, ChatGPT를 사용하면 AI 아트를 생성하는 프로세스가 훨씬 더 사용자 친화적이 된다.
DALL-E 3와 ChatGPT의 통합에 대한 자세한 정보는 여기에서 확인할 수 있다. 이 협력은 멀티모달 AI의 발전을展示하며, 사용자에게 AI 아트 생성을 쉽게 해준다.
구글의 헬스 팀은今年 6월에 Med-PaLM M을 출시했다. 이는 다양한 생물의학 데이터를 인코딩하고 해석할 수 있는 멀티모달 제너레이티브 모델이다. 이는 PaLM-E 언어 모델을 의료 분야에 맞게 조정하여 달성되었으며, MultiMedBench라는 오픈 소스 벤치마크를 사용했다. 이 벤치마크에는 7가지 생물의학 데이터 유형과 14가지 작업(의료 질문 응답, 방사선 보고서 생성 등)이 포함되어 있다.
各种 산업은 비즈니스 확장, 운영 최적화, 고객 참여 향상을 위해 혁신적인 멀티모달 AI 도구를 채택하고 있다. 음성, 비디오, 텍스트 AI 기능의 발전은 멀티모달 AI의 성장을 추진하고 있다.
기업은 비즈니스 모델과 프로세스를 혁신할 수 있는 멀티모달 AI 애플리케이션을 찾고 있다. 이는 데이터 도구에서부터 새로운 AI 애플리케이션에 이르기까지 제너레이티브 AI 생태계 전반에 걸쳐 성장의 기회를 열어준다.
GPT-4의 출시 이후 일부 사용자는 시간이 지남에 따라 응답 품질이 저하된 것을 관찰했으며, 이는 주목할 만한 개발자와 OpenAI 포럼에서 언급된 문제이다. 초기에 OpenAI는 이를 무시했지만, 이후 연구에서는 이 문제를 확인했다. 이는 GPT-4의 정확도가 3월과 6월 사이에 97.6%에서 2.4%로 떨어졌음을 보여주었다. 이는 모델 업데이트에 따라 응답 품질이 저하된 것을 나타낸다.
Open AI의 ChatGPT에 대한 관심이 다시 살아났다. 이제それは GPT-4V(ision)라는 비전 기능을 갖추고 있으며, 사용자가 제공한 이미지 분석을 허용한다. 이는 사용자에게 새로운 기능이다.
대규모 언어 모델(Large Language Model, LLM)에 이미지 분석을 추가하는 것은 일부에서는 AI 연구와 개발의 큰 발전으로 간주된다. 이러한 멀티모달 LLM은 언어 모델을 텍스트를 넘어서 새로운 인터페이스를 제공하고 새로운 작업을 해결하며, 사용자에게 새로운 경험을 제공할 수 있다.
GPT-4V의 훈련은 2022년에 완료되었으며, 초기 액세스는 2023년 3월에 제공되었다. GPT-4V의 시각 기능은 GPT-4 기술을 기반으로 한다. 훈련 프로세스는 동일하게 유지되었다. 초기에 모델은 텍스트와 이미지의 다양한 소스에서 대규모 데이터셋을 사용하여 텍스트의 다음 단어를 예측하도록 훈련되었다.
그런 다음 강화 학습에서 인간의 피드백(RLHF)을 사용하여 인간이 선호하는 출력을 생성하도록 더 많은 데이터로 미세 조정되었다.
GPT-4 비전 메커니즘
GPT-4의 탁월한 비전 언어 능력은 인상적인 것으로 보이지만, 그 아래에 있는 메커니즘은 아직 표면에 있다.
이 가설을 조사하기 위해, MiniGPT-4라는 새로운 비전-언어 모델이 도입되었다. 이는 Vicuna라는 고급 LLM을 사용하며, 시각 인식에 대해 사전 훈련된 구성 요소를 사용하는 비전 인코더를 사용한다. MiniGPT-4의 아키텍처는 단순하지만 효과적이며, 시각적 및 언어적 특징을 일치시키는 것을 중점으로 한다.
비전-언어 작업에서 자율 회귀 언어 모델의 트렌드는 또한 성장하고 있으며, 언어와 멀티모달 도메인 간에 지식을 공유하기 위해 크로스 모달 전이를 활용하고 있다.
MiniGPT-4는 사전 훈련된 비전 인코더에서 시각 정보를 Vicuna 언어 모델과 일치시켜 비전과 언어 도메인을 연결한다. 모델은 Vicuna를 언어 디코더로 사용하며, 두 단계의 훈련 접근 방식을 따른다. 초기에 큰 이미지-텍스트 페어 데이터셋에서 훈련되어 비전-언어 지식을 습득한 다음, 더 작은 고품질 데이터셋에서 미세 조정되어 생성의 신뢰성과 사용성을 향상시킨다.
MiniGPT-4에서 생성된 언어의 자연스러움과 사용성을 개선하기 위해, 연구자들은 두 단계의 정렬 프로세스를 개발하여, 비전-언어 정렬 데이터셋의 부족을 해결했다. 이를 위해 특별한 데이터셋을 수집했다.
초기에는 모델이 입력 이미지에 대한 자세한 설명을 생성했으며, 이는 Vicuna 언어 모델의 형식과 일치하는 대화형 프롬프트를 사용하여 자세한 이미지를 생성하는 것을 목표로 했다.
초기 이미지 설명 프롬프트:
###Human: <Img><ImageFeature></Img>이 이미지를 자세히 설명하세요. 가능한 한 많은 세부 사항을 제공하세요. 모든 것을 보이는 대로 말하세요. ###Assistant:
데이터 후처리에서는 생성된 설명에서 일관성 없는 점이나 오류를 ChatGPT를 사용하여 수정하고, 수동으로 검증하여 높은 품질을 보장했다.
2단계 미세 조정 프롬프트:
###Human: <Img><ImageFeature></Img><Instruction>###Assistant:
이 탐색은 멀티모달 제너레이티브 AI와 같은 GPT-4의 메커니즘을 이해하는 데 창을 열어주며, 비전과 언어 모달리티를 어떻게 효과적으로 통합하여 일관성 있고 맥락적으로 풍부한 출력을 생성할 수 있는지에 대한 빛을 비추는 데 도움이 된다.
GPT-4 비전 탐색
이미지 원천 결정하기
GPT-4 비전은 사용자가 이미지의 지리적 원천을 분석하고 식별하는 ChatGPT의 능력을 향상시킨다. 이 기능은 사용자 상호작용을 텍스트만으로부터 텍스트와 시각적 요소의 혼합으로 전환시키는 유용한 도구가 된다.
복잡한 수학 개념
GPT-4 비전은 그래픽 또는 수기적으로 표현된 복잡한 수학적 개념을 분석하는 데 탁월하다. 이 기능은 복잡한 수학 문제를 해결하려고 하는 개인에게 유용한 도구가 된다. 이는 교육 및 학술 분야에서 GPT-4 비전의 두드러진 도움을 나타낸다.
수기 입력을 LaTeX 코드로 변환하기
GPT-4V의 놀라운 능력 중 하나는 수기 입력을 LaTeX 코드로 번역하는 것이다. 이는 연구자, 학자, 학생들에게 필수적인 기능으로, 수학적 표현이나 기술 정보를 디지털 형식으로 변환해야 할 때 매우 유용하다. 수기에서 LaTeX로의 변환은 문서 디지털화의 지평을 확장하고 기술 문서 작성 과정을 간소화한다.
테이블 세부 정보 추출하기
GPT-4V는 테이블에서 세부 정보를 추출하고 관련된 질문에 답변하는 능력을展示한다. 이는 데이터 분석에서 중요한 자산이며, 사용자는 GPT-4V를 사용하여 테이블을 분석하고 주요 통찰력을 얻으며, 질문에 답변할 수 있다.
시각적 지시 이해하기
GPT-4V의 시각적 지시를 이해하는 고유한 능력은 사용자 상호작용에 새로운 차원을 추가한다. 시각적 단서를 이해함으로써 GPT-4V는 맥락적 이해가 더 높은 답변을 제공할 수 있다.
그림을 사용하여 간단한 모의 웹사이트 구축하기
이 트윗에 영감을 받아, Unite.ai 웹사이트의 모의 웹사이트를 만들려고 시도했다.
결과는 초기 비전과 완전히 일치하지는 않았지만, 내가 얻은 결과이다.
GPT-4V(ision)의 한계와 결점
GPT-4V를 분석하기 위해, Open AI 팀은 질적 및 양적 평가를 수행했다. 질적 평가에는 내부 테스트와 외부 전문가 리뷰가 포함되었으며, 양적 평가에는 모델 거부와 다양한 시나리오에서 정확도를 측정했다. 이러한 시나리오는 유해한 콘텐츠 식별, 인구 통계적 인식, 개인 정보 보호 문제, 지리적 위치, 사이버 보안 및 멀티모달 탈옥을 포함했다.
그러나 모델은 완벽하지 않다.
논문은 GPT-4V의 한계를 강조한다. 이는 이미지에서 잘못된 추론이나 누락된 텍스트 또는 문자를 포함한다. 또한 사실을歪曲하거나 발명할 수 있다. 특히, 이미지에서 위험한 물질을 식별하는 데 적합하지 않으며, 종종 이를 잘못 식별한다.
의료 영상 분야에서 GPT-4V는 일관되지 않은 응답을 제공할 수 있으며, 표준 관행에 대한 인식이 부족하여, 잠재적으로 잘못된 진단을 유발할 수 있다.

의료 목적을 위한 신뢰할 수 없는 성능 (출처)
또한 특정 증오 상징의 세부 사항을 이해하지 못하며, 시각적 입력에 따라 부적절한 콘텐츠를 생성할 수 있다. OpenAI는 특히 의료 또는 민감한 상황에서 GPT-4V를 사용하는 것을 권장하지 않는다.
まとめ

Fast Stable Diffusion XL을 사용하여 생성됨 https://huggingface.co/spaces/google/sdxl
GPT-4 비전(GPT-4V)의 도착은 다양한 새로운 가능성과 함께 새로운 장애물을 가져온다. 출시되기 전에, 특히 사람들의 사진과 관련된 위험을 잘 조사하고 줄이는 많은 노력이 들어갔다. 의료 및 과학 분야와 같은 어려운 분야에서 GPT-4V가 보여준 발전은 인상적이다.
이제 큰 질문들이 남아 있다. 예를 들어, 이러한 모델이 유명인들을 사진에서 식별할 수 있어야 하는가? 사진에서 사람의 성별, 인종 또는 감정을 추측해야 하는가? 시각 장애인들을 돕기 위한 특별한 조정이 필요한가? 이러한 질문은 개인 정보 보호, 공정성, AI가 우리의 삶에 어떻게 적합해야 하는지에 대한 논의를 열어준다. 이는 모두가 의견을 낼 수 있어야 하는 문제이다.





















