โมเดลและแพลตฟอร์ม AI
การพัฒนาอินเทลลิเจนท์หลายรูปแบบของ AI ที่มีความสามารถในการมองเห็นด้วย GPT-4V
ในการพัฒนาอินเทลลิเจนท์หลายรูปแบบของ AI ที่มีความสามารถในการมองเห็นด้วย GPT-4V นั้น เป็นผลมาจากความพยายามอย่างต่อเนื่องในการพัฒนาโมเดล GPT ของ OpenAI เพื่อให้สามารถรับข้อมูลทั้งแบบข้อความและภาพได้
ความก้าวหน้าล่าสุดในอินเทลลิเจนท์หลายรูปแบบของ AI
ความก้าวหน้าที่น่าสนใจล่าสุดในด้านนี้คือการรวม DALL-E 3 เข้ากับ ChatGPT ซึ่งเป็นการอัปเกรดที่สำคัญในเทคโนโลยีการสร้างภาพจากข้อความของ OpenAI การผสมผสานนี้ช่วยให้การโต้ตอบกับ ChatGPT มีความราบรื่นมากขึ้น โดยที่ ChatGPT ช่วยในการสร้างคำสั่งให้精确สำหรับ DALL-E 3 ทำให้การสร้างงานศิลปะ AI trở nênง่ายขึ้นสำหรับผู้ใช้
สามารถดูข้อมูลเพิ่มเติมเกี่ยวกับ DALL-E 3 และการรวมเข้ากับ ChatGPT ได้ที่ นี่ การทำงานร่วมกันนี้ไม่เพียงแต่แสดงถึงความก้าวหน้าในอินเทลลิเจนท์หลายรูปแบบของ AI แต่ยังทำให้การสร้างงานศิลปะ AI เป็นเรื่องที่ง่ายและสนุกสำหรับผู้ใช้ด้วย
ในทางกลับกัน Google (GOOGL ) ได้แนะนำ Med-PaLM M ในเดือนมิถุนายนปีนี้ ซึ่งเป็นโมเดลสร้างข้อมูลหลายรูปแบบที่มีความสามารถในการเข้ารหัสและตีความข้อมูลชีวการแพทย์ที่หลากหลาย โมเดลนี้ได้รับการฝึกฝนโดยใช้ PaLM-E ซึ่งเป็นโมเดลภาษาที่ถูกปรับให้เหมาะสมสำหรับโดเมนการแพทย์โดยใช้ MultiMedBench ซึ่งเป็นชุดข้อมูลที่มีมากกว่า 1 ล้านตัวอย่างทั่ว 7 ประเภทข้อมูลชีวการแพทย์และ 14 งาน เช่น การตอบคำถามทางการแพทย์และการสร้างรายงานรังสีวิทยา
อุตสาหกรรมต่างๆ กำลังนำอินเทลลิเจนท์หลายรูปแบบของ AI ที่เป็นนวัตกรรมมาใช้เพื่อกระตุ้นการเติบโตทางธุรกิจ สตรีมไลน์ปฏิบัติการ และเพิ่มความพึงพอใจของลูกค้า ความก้าวหน้าในด้านเสียง วิดีโอ และข้อความ AI กำลังขับเคลื่อนการเติบโตของอินเทลลิเจนท์หลายรูปแบบของ AI
องค์กรต่างๆ กำลังมองหาอินเทลลิเจนท์หลายรูปแบบของ AI ที่สามารถเปลี่ยนแปลงแบบจำลองธุรกิจและกระบวนการทำงานได้ โดยเปิดโอกาสให้เติบโตทั่วทั้งระบบนิเวศของ AI ตั้งแต่เครื่องมือข้อมูลไปจนถึงแอปพลิเคชัน AI ที่เกิดขึ้นใหม่
หลังจากการเปิดตัว GPT-4 ในเดือนมีนาคม บางผู้ใช้ได้รายงานว่าคุณภาพของการตอบสนองของ GPT-4 ลดลงเมื่อเวลาผ่านไป ซึ่งเป็นข้อกังวลที่ถูกกล่าวถึงโดยนักพัฒนาที่มีชื่อเสียงและในฟอรัมของ OpenAI ในตอนแรก OpenAI ได้ปฏิเสธข้อกังวลนี้ แต่การศึกษาต่อมาได้ยืนยันปัญหา โดยพบว่าคะแนนความแม่นยำของ GPT-4 ลดลงจาก 97.6% เป็น 2.4% ระหว่างเดือนมีนาคมถึงเดือนมิถุนายน ซึ่งบ่งชี้ถึงการลดลงของคุณภาพการตอบสนอง
ความฮือฮาเกี่ยวกับ Open AI’s ChatGPT กลับมาอีกครั้ง โดยตอนนี้มีคุณสมบัติในการมองเห็น GPT-4V ที่ช่วยให้ผู้ใช้สามารถให้ GPT-4 วิเคราะห์ภาพที่ให้มาได้ คุณสมบัตินี้เป็นการเปิดตัวล่าสุดที่เปิดให้ผู้ใช้สามารถใช้งานได้
การเพิ่มการวิเคราะห์ภาพเข้าไปในโมเดลภาษาขนาดใหญ่ (LLM) เช่น GPT-4 ถูกมองว่าเป็นขั้นตอนสำคัญในการวิจัยและพัฒนา AI โมเดล LLM หลายรูปแบบนี้เปิดโอกาสใหม่ๆ โดยนำโมเดลภาษาไปไกลกว่าข้อความเพื่อเสนออินเทอร์เฟซใหม่ๆ และแก้ปัญหาที่หลากหลาย โดยสร้างประสบการณ์ใหม่ๆ สำหรับผู้ใช้
การฝึกอบรม GPT-4V ถูกเสร็จสิ้นในปี 2022 โดยมีการเปิดให้เข้าถึงในต้นเดือนมีนาคม 2023 คุณสมบัติการมองเห็นของ GPT-4V ได้รับการขับเคลื่อนโดยเทคโนโลยี GPT-4 การฝึกอบรมดำเนินไปในลักษณะเดียวกัน โดยเริ่มต้นจากการฝึกโมเดลเพื่อคาดการณ์คำถัดไปในข้อความโดยใช้เซตข้อมูลขนาดใหญ่ของข้อความและภาพจากแหล่งต่างๆ รวมถึงอินเทอร์เน็ต
ต่อมาได้รับการปรับให้เหมาะสมด้วยข้อมูลเพิ่มเติมโดยใช้วิธีการเรียนรู้แบบเสริมจากข้อมูลของมนุษย์ (RLHF) เพื่อสร้างผลลัพธ์ที่มนุษย์ชอบ
กลไกการมองเห็นของ GPT-4
ความสามารถในการมองเห็นของ GPT-4 แม้ว่าจะน่าประทับใจ แต่ยังมีวิธีการทำงานที่ซ่อนอยู่
เพื่อสำรวจสมมติฐานนี้ โมเดลภาษาและภาพที่เรียกว่า MiniGPT-4 ถูกนำเสนอ โดยใช้โมเดลภาษาขนาดใหญ่ (LLM) ที่เรียกว่า Vicuna โมเดลนี้ใช้เครื่องมือการมองเห็นที่มีส่วนประกอบที่ได้รับการฝึกอบรมไว้ล่วงหน้าสำหรับการรับรู้ภาพ โดยจัดตำแหน่งคุณลักษณะภาพที่ถูกเข้ารหัสให้สอดคล้องกับโมเดลภาษา Vicuna ผ่านชั้นการฉายภาพแบบเดียว โครงสร้างของ MiniGPT-4 นั้นเรียบง่ายแต่มีประสิทธิภาพ โดยมุ่งเน้นในการจัดตำแหน่งคุณลักษณะภาพและภาษาให้สอดคล้องกันเพื่อปรับปรุงความสามารถในการสนทนาที่มองเห็น

โครงสร้างของ MiniGPT-4 รวมถึงเครื่องมือการมองเห็นพร้อมส่วนประกอบ ViT และ Q-Former ชั้นการฉายภาพแบบเดียว และโมเดลภาษาขนาดใหญ่ Vicuna ที่มีความก้าวหน้า
แนวโน้มของโมเดลภาษาที่สร้างขึ้นแบบอัตลักษณ์ในงานภาษาและภาพก็เติบโตขึ้น โดยใช้การถ่ายโอนข้ามโหมดเพื่อแบ่งปันความรู้ระหว่างโดเมนภาษาและหลายรูปแบบ
MiniGPT-4 เชื่อมโยงโดเมนภาพและภาษาโดยจัดตำแหน่งข้อมูลภาพจากเครื่องมือการมองเห็นที่ได้รับการฝึกอบรมไว้ล่วงหน้าให้สอดคล้องกับโมเดลภาษาขนาดใหญ่ (LLM) ที่มีความก้าวหน้า โมเดลนี้ใช้ Vicuna เป็นตัวถอดรหัสภาษาและติดตามแนวทางฝึกอบรมสองขั้นตอน ในขั้นตอนแรกจะถูกฝึกอบรมบนเซตข้อมูลขนาดใหญ่ของภาพและข้อความเพื่อทำความเข้าใจความรู้ภาษาและภาพ ต่อมาจะได้รับการปรับให้เหมาะสมบนเซตข้อมูลที่เล็กกว่าแต่มีคุณภาพสูงเพื่อเพิ่มความน่าเชื่อถือและความสามารถในการใช้งาน
เพื่อปรับปรุงความเป็นธรรมชาติและความสามารถในการใช้งานของภาษาที่ถูกสร้างขึ้นใน MiniGPT-4 นักวิจัยได้พัฒนาการจัดตำแหน่งสองขั้นตอนเพื่อแก้ไขปัญหาการไม่มีเซตข้อมูลที่เหมาะสมสำหรับการจัดตำแหน่งภาษาและภาพ พวกเขาได้สร้างเซตข้อมูลพิเศษสำหรับจุดประสงค์นี้
ในขั้นตอนแรก โมเดลจะสร้างคำอธิบายภาพที่มีรายละเอียด โดยเพิ่มรายละเอียดโดยใช้คำสั่งการสนทนาที่สอดคล้องกับรูปแบบของโมเดลภาษา Vicuna
การวิเคราะห์ขั้นตอนแรกของคำสั่ง:
###Human: <Img><ImageFeature></Img>อธิบายภาพนี้โดยละเอียด ให้มากที่สุดเท่าที่จะเป็นไปได้ บอกทุกสิ่งที่คุณเห็น ###Assistant:
สำหรับการประมวลผลข้อมูลหลังการสร้าง จะมีการแก้ไขความไม่สอดคล้องหรือข้อผิดพลาดในคำอธิบายที่ถูกสร้างขึ้นโดยใช้ ChatGPT ตามด้วยการตรวจสอบด้วยมือเพื่อให้แน่ใจถึงคุณภาพสูง
คำสั่งสำหรับการปรับให้เหมาะสมในขั้นตอนที่สอง:
###Human: <Img><ImageFeature></Img><Instruction>###Assistant:
การสำรวจนี้เปิดหน้าต่างให้เข้าใจกลไกของ AI ที่สร้างข้อมูลหลายรูปแบบ เช่น GPT-4 โดยให้แสงสว่างเกี่ยวกับวิธีการรวมโหมดภาพและภาษาเข้าด้วยกันเพื่อสร้างผลลัพธ์ที่สอดคล้องกันและอุดมไปด้วยบริบท
การสำรวจ GPT-4 Vision
การกำหนดที่มาของภาพด้วย ChatGPT
GPT-4 Vision เพิ่มความสามารถของ ChatGPT ในการวิเคราะห์ภาพและระบุที่มาของภาพ ซึ่งเป็นเครื่องมือที่มีประโยชน์สำหรับผู้ที่สนใจเรียนรู้เกี่ยวกับสถานที่ต่างๆ ผ่านข้อมูลภาพ
แนวคิดทางคณิตศาสตร์ที่ซับซ้อน
GPT-4 Vision มีความสามารถในการสำรวจแนวคิดทางคณิตศาสตร์ที่ซับซ้อนโดยการวิเคราะห์สมการหรือการเขียนด้วยมือ ซึ่งเป็นเครื่องมือที่มีประโยชน์สำหรับผู้ที่ต้องการแก้ปัญหาคณิตศาสตร์ที่ซับซ้อน ทำให้ GPT-4 Vision เป็นเครื่องมือที่มีคุณค่าในด้านการศึกษาและวิชาการ
การแปลงอินพุตที่เขียนด้วยมือเป็นโค้ด LaTeX
หนึ่งในความสามารถที่น่าประทับใจของ GPT-4V คือความสามารถในการแปลอินพุตที่เขียนด้วยมือเป็นโค้ด LaTeX ซึ่งเป็นประโยชน์สำหรับนักวิจัย นักวิชาการ และนักเรียนที่ต้องแปลงนิพจน์ทางคณิตศาสตร์หรือข้อมูลทางเทคนิคที่เขียนด้วยมือให้เป็นรูปแบบดิจิทัล การแปลงจากอินพุตที่เขียนด้วยมือเป็น LaTeX ขยายขอบเขตของการดิจิตอลไฟล์เอกสารและทำให้กระบวนการเขียนทางเทคนิคง่ายขึ้น
การดึงข้อมูลจากตาราง
GPT-4V แสดงความสามารถในการดึงข้อมูลจากตารางและตอบคำถามที่เกี่ยวข้อง ซึ่งเป็นทรัพยากรที่มีค่าสำหรับการวิเคราะห์ข้อมูล ผู้ใช้สามารถใช้ GPT-4V เพื่อค้นหาข้อมูลสำคัญและตอบคำถามได้ ทำให้เป็นเครื่องมือที่แข็งแกร่งสำหรับนักวิเคราะห์ข้อมูลและผู้เชี่ยวชาญอื่นๆ
การทำความเข้าใจการชี้ภาพ
ความสามารถพิเศษของ GPT-4V ในการทำความเข้าใจการชี้ภาพเพิ่มมิติใหม่ให้กับการโต้ตอบกับผู้ใช้ โดยการทำความเข้าใจสัญญาณภาพ GPT-4V สามารถตอบคำถามด้วยความเข้าใจบริบทที่สูงขึ้น
การสร้างเว็บไซต์แบบโมคอัพโดยใช้การวาดภาพ
ได้รับแรงบันดาลใจจาก ทวีต นี้ ผู้เขียนได้ลองสร้างโมคอัพสำหรับเว็บไซต์ unite.ai
แม้ว่าผลลัพธ์จะไม่ตรงกับวิสัยทัศน์แรก แต่นี่คือผลลัพธ์ที่ได้รับ
ข้อจำกัดและข้อบกพร่องของ GPT-4V
ในการวิเคราะห์ GPT-4V ทีม Open AI ได้ทำการประเมินเชิงคุณภาพและเชิงปริมาณ ซึ่งรวมถึงการทดสอบภายในและการทบทวนโดยผู้เชี่ยวชาญภายนอก และการวัดผลการปฏิเสธของโมเดลและความแม่นยำในหลายสถานการณ์ เช่น การระบุเนื้อหาที่เป็นอันตราย การรับรู้ประชากรศาสตร์ ข้อกังวลด้านความเป็นส่วนตัว การระบุตำแหน่งทางภูมิศาสตร์ ความมั่นคงทางไซเบอร์ และการหลบหนีหลายรูปแบบ
อย่างไรก็ตาม โมเดลยังไม่สมบูรณ์แบบ
เอกสาร นี้ เน้นถึงข้อจำกัดของ GPT-4V เช่น การอนุมานที่ไม่ถูกต้องและการขาดข้อความหรือตัวอักษรในภาพ ซึ่งอาจสร้างข้อมูลขึ้นมาเองได้ โดยเฉพาะไม่เหมาะสมสำหรับการระบุสสารอันตรายในภาพ ซึ่งมักจะระบุไม่ถูกต้อง
ในด้านการถ่ายภาพทางการแพทย์ GPT-4V สามารถให้คำตอบที่ไม่สอดคล้องกันและขาดความเข้าใจในแนวปฏิบัติที่เป็นมาตรฐาน ซึ่งอาจนำไปสู่การวินิจฉัยที่ไม่ถูกต้อง

การทำงานที่ไม่น่าเชื่อถือสำหรับวัตถุประสงค์ทางการแพทย์ (แหล่งที่มา)
นอกจากนี้ยังขาดความเข้าใจในความหมายของสัญลักษณ์เกลียดชังบางอย่าง และอาจสร้างเนื้อหาที่ไม่เหมาะสมตามข้อมูลภาพที่ให้มา OpenAI แนะนำให้ไม่ใช้ GPT-4V สำหรับการตีความที่สำคัญ โดยเฉพาะในบริบททางการแพทย์หรือที่มีความอ่อนไหว
สรุป

Created using Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl
การมาถึงของ GPT-4 Vision (GPT-4V) นำมาซึ่งโอกาสใหม่ๆ และอุปสรรคใหม่ๆ ก่อนที่จะปล่อยให้ผู้ใช้ได้เข้าถึง มีการใช้ความพยายามอย่างมากในการลดความเสี่ยง โดยเฉพาะอย่างยิ่งเมื่อพูดถึงรูปภาพของบุคคล
มีคำถามใหญ่ๆ ที่ถูกวางบนโต๊ะ เช่น โมเดลเหล่านี้ควรจะสามารถระบุคนดังจากภาพหรือไม่? ควรจะเดาเพศ เชื้อชาติ หรืออารมณ์ของบุคคลจากภาพหรือไม่? และควรจะมีการปรับแต่งพิเศษเพื่อช่วยผู้ที่มีปัญหาในการมองเห็นหรือไม่? คำถามเหล่านี้เปิดโอกาสให้เกิดการอภิปรายเกี่ยวกับความเป็นส่วนตัว ความยุติธรรม และวิธีที่ AI ควรจะเข้ามาเป็นส่วนหนึ่งของชีวิตของเรา ซึ่งเป็นเรื่องที่ทุกคนควรจะมีส่วนร่วมในการพูดคุย




















