โมเดลและแพลตฟอร์ม AI

การเพิ่มขึ้นของ AI แบบหลายรูปแบบ: ระบบเหล่านี้มีความฉลาดอย่างแท้จริงหรือไม่?

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

หลังจากความสำเร็จของ LLMs อุตสาหกรรม AI กำลังพัฒนาไปสู่ระบบหลายรูปแบบ ในปี 2023 ตลาด AI หลายรูปแบบ มีมูลค่า 1.2 พันล้านดอลลาร์สหรัฐฯ โดยมีการคาดการณ์ว่าจะเติบโตอย่างรวดเร็วมากกว่า 30% ต่อปีจนถึงปี 2032 ไม่เหมือนกับ LLMs แบบดั้งเดิมที่ประมวลผลเฉพาะข้อความ AI หลายรูปแบบสามารถประมวลผลข้อความ ภาพ เสียง และวิดีโอได้พร้อมกัน ตัวอย่างเช่น เมื่ออัปโหลดเอกสารที่มีทั้งข้อความและแผนภูมิ AI หลายรูปแบบสามารถสังเคราะห์ข้อมูลจากทั้งสองแหล่งเพื่อสร้างการวิเคราะห์ที่ครอบคลุมมากขึ้น ความสามารถในการรวมหลายรูปแบบนี้ใกล้เคียงกับการรับรู้ของมนุษย์มากกว่าระบบ AI ก่อนหน้านี้ แม้ว่า AI หลายรูปแบบจะมีศักยภาพที่น่าประทับใจสำหรับอุตสาหกรรมต่างๆ เช่น การดูแลสุขภาพ การศึกษา และสาขาสร้างสรรค์ แต่ก็ทำให้เกิดคำถามพื้นฐานที่ท้าทายความเข้าใจของเราเกี่ยวกับการพัฒนานี้: ระบบ AI หลายรูปแบบเหล่านี้เข้าใจโลกอย่างแท้จริงหรือแค่ผสมผสานหลายรูปแบบ?

ความท้าทายของการค้นหารูปแบบ

ความก้าวหน้าล่าสุดใน AI หลายรูปแบบได้กระตุ้นให้เกิดการถกเถียงอย่างเข้มข้นภายในชุมชน AI นักวิจารณ์โต้แย้งว่า尽管มีการพัฒนานี้ AI หลายรูปแบบยังคงเป็นระบบการค้นหาความสัมพันธ์อยู่ดี มันสามารถประมวลผลชุดข้อมูลการฝึกอบรมขนาดใหญ่เพื่อระบุความสัมพันธ์ทางสถิติระหว่างประเภทอินพุตและเอาต์พุตที่แตกต่างกัน แต่อาจไม่มีความเข้าใจที่แท้จริงเกี่ยวกับความสัมพันธ์ระหว่างรูปแบบต่างๆ เมื่อ AI หลายรูปแบบอธิบายภาพ มันอาจจะจับคู่รูปแบบภาพกับคำอธิบายข้อความที่มันเห็นหลายพันครั้งก่อนหน้านี้ มากกว่าที่จะเข้าใจอย่างแท้จริงว่ามันเห็นอะไร ความคิดเห็นนี้ได้รับการสนับสนุนจากตัวอย่างมากมายที่ระบบ AI ล้มเหลวในลักษณะที่เปิดเผยข้อจำกัดของมัน พวกมันอาจระบุวัตถุในภาพได้อย่างถูกต้อง แต่ไม่เข้าใจความสัมพันธ์ทางกายภาพพื้นฐานหรือการให้เหตุผลที่ใช้ความสมเหตุสมผลซึ่งเด็กๆ ก็เข้าใจได้

สถาปัตยกรรมเบื้องหลัง AI หลายรูปแบบ

เพื่อประเมินว่า AI หลายรูปแบบเข้าใจข้อมูลอย่างแท้จริงหรือไม่ เราต้องตรวจสอบว่าระบบเหล่านี้ทำงานอย่างไร ส่วนใหญ่ของโมเดล AI หลายรูปแบบพึ่งพาการรวมส่วนประกอบเฉพาะหลายรูปแบบ สถาปัตยกรรมนี้เปิดเผยข้อมูลเชิงลึกที่สำคัญเกี่ยวกับธรรมชาติของความเข้าใจหลายรูปแบบ ระบบเหล่านี้ไม่ประมวลผลข้อมูลในลักษณะเดียวกับมนุษย์ โดยมีประสบการณ์เชิงสัมผัสที่รวมกันซึ่งสร้างความเข้าใจที่คั่งค้างตามเวลา แต่จะรวมกระแสการประมวลผลที่แยกจากกันซึ่งได้รับการฝึกอบรมจากข้อมูลประเภทต่างๆ และจัดตำแหน่งผ่านเทคนิคต่างๆ

กระบวนการจัดตำแหน่งเป็นสิ่งสำคัญแต่ไม่สมบูรณ์ เมื่อ AI หลายรูปแบบประมวลผลภาพและข้อความพร้อมกัน มันจะต้องหาวิธีเชื่อมโยงลักษณะภาพกับแนวคิดทางภาษา ความสัมพันธ์นี้เกิดขึ้นจากการได้รับประสบการณ์จากตัวอย่างหลายล้านครั้ง ไม่ใช่จากความเข้าใจที่แท้จริงว่าภาพและภาษาเชื่อมโยงกันในลักษณะที่มีความหมาย

สมมติฐานการรีมิกซ์

อาจเป็นวิธีที่แม่นยำที่สุดในการอธิบายความสามารถของ AI หลายรูปแบบคือผ่านเลนส์ของการรีมิกซ์ ระบบเหล่านี้ทำงานโดยการผสมผสานองค์ประกอบที่มีอยู่ในลักษณะใหม่ๆ มันสร้างความเชื่อมโยงระหว่างเนื้อหาที่อาจไม่ได้เชื่อมโยงไว้โดยชัดเจนก่อนหน้านี้ ความสามารถนี้มีพลังและมีคุณค่า แต่อาจไม่ใช่ความเข้าใจที่แท้จริง

เมื่อ AI หลายรูปแบบสร้างงานศิลปะตามคำอธิบายข้อความ มันจะรีมิกซ์รูปแบบภาพจากชุดข้อมูลการฝึกอบรมเพื่อตอบสนองต่อคำใบ้ทางภาษา ผลลัพธ์อาจเป็นเรื่องสร้างสรรค์และน่าประหลาดใจ แต่มาจากการผสมผสานที่ซับซ้อนมากกว่าการคิดหรือเข้าใจที่แท้จริง

ทดสอบขอบเขตความเข้าใจของ AI

การวิจัยล่าสุด ได้พยายาม ทดสอบขอบเขตความเข้าใจของ AI ผ่านแนวทางการทดลองต่างๆ น่าสนใจที่เมื่อเผชิญกับงานง่ายๆ โมเดลภาษาแบบมาตรฐานมักจะทำงานได้ดีกว่าโมเดลที่เน้นการให้เหตุผลซึ่งมีความซับซ้อนมากขึ้น เมื่อความซับซ้อนเพิ่มขึ้น โมเดลการให้เหตุผลที่มีความเชี่ยวชาญจะแสดงความได้เปรียบโดยการสร้างกระบวนการคิดที่ละเอียดก่อนที่จะตอบ

ผลการวิจัยเหล่านี้ชี้ให้เห็นว่าความสัมพันธ์ระหว่างความซับซ้อนและความเข้าใจใน AI ไม่ตรงไปตรงมา งานง่ายๆ อาจได้รับการตอบสนองด้วยการค้นหาความสัมพันธ์อย่างดี ในขณะที่ความท้าทายที่ซับซ้อนกว่านั้นต้องการบางสิ่งที่ใกล้เคียงกับการให้เหตุผลที่แท้จริง อย่างไรก็ตาม แม้แต่โมเดลการให้เหตุผลที่เน้นการให้เหตุผลก็อาจใช้การค้นหาความสัมพันธ์ที่ซับซ้อนมากกว่าความเข้าใจที่แท้จริง

ผลกระทบทางปรัชญา

คำถามที่ว่า AI หลายรูปแบบเข้าใจอย่างแท้จริงหรือไม่นั้นเชื่อมโยงกับประเด็นทางปรัชญาพื้นฐานเกี่ยวกับธรรมชาติของความเข้าใจเอง ความหมายของ “เข้าใจ” คืออะไร? ความเข้าใจเป็นเพียงการทำงานหรือต้องมีประสบการณ์เชิงสัมผัสและความตระหนัก?

จากมุมมองของฟังก์ชันนิยม หากระบบ AI สามารถประมวลผลข้อมูล ตอบสนองอย่างเหมาะสม และแสดงพฤติกรรมที่ดูเหมือนเข้าใจแล้ว มันอาจจะเข้าใจในความหมายที่มีความหมาย ความสำคัญของกลไกภายในน้อยกว่าความสามารถภายนอก

ความเป็นจริงทางปฏิบัติ

ในขณะที่การถกเถียงทางปรัชญาเกี่ยวกับความเข้าใจของ AI ยังคงดำเนินอยู่ ความเป็นจริงทางปฏิบัติคือระบบ AI หลายรูปแบบกำลังเปลี่ยนแปลงวิธีการทำงาน สร้างสรรค์ และโต้ตอบกับข้อมูลของเรา ไม่ว่าระบบเหล่านี้จะเข้าใจในความหมายทางปรัชญาหรือไม่นั้นอาจจะไม่สำคัญเท่ากับความสามารถและข้อจำกัดทางปฏิบัติของมัน

สิ่งสำคัญสำหรับผู้ใช้และผู้พัฒนาคือการเข้าใจว่าระบบเหล่านี้สามารถทำอะไรและไม่สามารถทำอะไรในรูปแบบปัจจุบัน ระบบเหล่านี้มีความโดดเด่นในด้านการค้นหาความสัมพันธ์ การสร้างเนื้อหา และการแปลข้ามรูปแบบ แต่พวกมันล้มเหลวในการให้เหตุผลใหม่ๆ ความเข้าใจที่ใช้ความสมเหตุสมผล และการรักษาความสอดคล้องในปฏิสัมพันธ์ที่ซับซ้อน

สรุป

ระบบ AI หลายรูปแบบ แม้จะมีความสามารถที่น่าประทับใจในการประมวลผลและสรุปข้อมูลหลายรูปแบบ แต่อาจไม่ “เข้าใจ” ข้อมูลที่จัดการอย่างแท้จริง ระบบเหล่านี้มีความโดดเด่นในด้านการค้นหาความสัมพันธ์และการรีมิกซ์ข้อมูล แต่ล้มเหลวในการให้เหตุผลที่แท้จริงและความเข้าใจที่ใช้ความสมเหตุสมผล ความแตกต่างนี้มีความสำคัญต่อวิธีการพัฒนา ใช้งาน และโต้ตอบกับระบบเหล่านี้ ความเข้าใจข้อจำกัดของระบบเหล่านี้ช่วยให้เราใช้งานได้อย่างมีประสิทธิภาพมากขึ้น ในขณะเดียวกันก็หลีกเลี่ยงการพึ่งพาความสามารถที่พวกมันไม่มี

ดร. Tehseen Zia เป็น Professor ที่ COMSATS University Islamabad โดยได้รับ PhD ใน AI จาก Vienna University of Technology, Austria มีเชี่ยวชาญด้าน Artificial Intelligence, Machine Learning, Data Science, และ Computer Vision โดยมีส่วนร่วมที่สำคัญด้วยการเผยแพร่ในวารสารวิทยาศาสตร์ที่มีชื่อเสียง ดร. Tehseen ยังได้ดำเนินโครงการอุตสาหกรรมต่างๆ ในฐานะ Principal Investigator และให้บริการเป็นที่ปรึกษาด้าน AI