AGI และ AI แห่งอนาคต

กฎการปรับขนาด AI ต่อไป: ไม่ใช่ข้อมูลมากขึ้น แต่เป็นโมเดลโลกที่ดีขึ้น

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

เป็นเวลาหลายปีที่อุตสาหกรรมปัญญาประดิษฐ์ปฏิบัติตามกฎที่เรียบง่ายและโหดร้าย: ขนาดที่ใหญ่กว่าคือที่ดีกว่า เราได้ฝึกโมเดลบนชุดข้อมูลขนาดใหญ่ เพิ่มจำนวนพารามิเตอร์ และโยนพลังการคำนวณที่มากขึ้นเข้าไปในระบบ สูตรนี้ได้ผลสำหร większości ของเวลา จาก GPT-3 ถึง GPT-4 และจากชัตบอทที่ไม่ซับซ้อนถึงเครื่องมือการให้เหตุผล “กฎการปรับขนาด” แสดงให้เห็นว่าหากเราเพียงแค่ติดตามข้อความให้มากขึ้น มันจะกลายเป็นฉลาดในที่สุด

แต่เรากำลัง ติดกำแพง อินเทอร์เน็ตมีขนาดจำกัด ข้อมูลสาธารณะที่มีคุณภาพกำลังหมดไป และผลตอบแทนจากการเพิ่มขนาดโมเดลให้ใหญ่ขึ้นเรื่อยๆ กำลัง ลดลง นักวิจัย AI ชั้นนำ แย้ง ว่าการกระโดดครั้งใหญ่ต่อไปในด้านปัญญาประดิษฐ์จะไม่มาจากการอ่านข้อความเพียงอย่างเดียว แต่จะมาจากการทำความเข้าใจความเป็นจริงเบื้องหลังข้อความ นี่คือสัญญาณของการเปลี่ยนแปลงพื้นฐานในโฟกัสของ AI ซึ่งนำไปสู่ยุคของโมเดลโลก

ข้อจำกัดของการคาดการณ์ตัวต่อไป

เพื่อทำความเข้าใจว่าทำไมเราต้องการแนวทางใหม่ เราต้องดูสิ่งที่ระบบ AI ปัจจุบันทำจริงๆ ด้วยความสามารถที่น่าประทับใจของพวกมัน โมเดลอย่าง ChatGPT หรือ Claude เป็นเครื่องมือ ทางสถิติ พวกมันคาดการณ์ตัวต่อไปในลำดับตามความน่าจะเป็นของสิ่งที่เกิดขึ้นก่อนหน้านี้ พวกมันไม่เข้าใจว่าถ้าแก้วถูกทิ้งไป มันจะแตกกระจาย; พวกมันเพียงแต่ทราบว่าในเรื่องราวหลายล้านเรื่อง คำ “แตกกระจาย” มักจะตามหลังวลี “แก้วถูกทิ้ง”

แนวทางนี้ซึ่งเรียกว่า การสร้างแบบจำลองแบบอัตโนมัติ มีข้อบกพร่องที่สำคัญ มันพึ่งพาความสัมพันธ์โดยสมบูรณ์ ไม่ใช่สาเหตุ หากคุณฝึกโมเดล LLM บนคำอธิบายการชนรถยนต์ 1,000 รายการ มันจะเรียนรู้ภาษาของอุบัติเหตุ แต่ไม่เคยเรียนรู้ฟิสิกส์ของความเร็ว การเสียดสี หรือความเปราะบาง มันเป็นเพียงผู้ชม ไม่ใช่ผู้เข้าร่วม

ข้อจำกัดนี้กำลังจะกลายเป็น “กำแพงข้อมูล” เราได้ขุดคุ้ยอินเทอร์เน็ตสาธารณะเกือบหมดแล้ว หากต้องการปรับขนาดเพิ่มเติมโดยใช้วิธีปัจจุบัน เราจะต้องการข้อมูลมากกว่าที่มีอยู่ในอินเทอร์เน็ตหลายเท่า ข้อมูลสังเคราะห์ (เช่น ข้อความที่สร้างโดย AI) มีคำตอบชั่วคราว แต่มักจะนำไปสู่ “การล่มสลายของโมเดล” ซึ่งระบบจะขยายความลำเอียงและข้อผิดพลาดของตนเอง เราไม่สามารถปรับขนาดโมเดลให้ถึงระดับปัญญาประดิษฐ์ทั่วไป (AGI) โดยใช้ข้อความเพียงอย่างเดียว เพราะข้อความเป็นการบีบอัดความเป็นจริงที่มีแบนด์วิธต่ำ มันบรรยายความเป็นจริง แต่ไม่ใช่ความเป็นจริงเอง

ทำไมโมเดลโลกจึงมีความสำคัญ

ผู้นำ AI อย่าง ยาน เลคุน ได้โต้แย้งมานานแล้วว่าระบบ AI ปัจจุบันขาดแคลนแง่มุมพื้นฐานของการรับรู้ของมนุษย์ที่เด็กเล็กมีโดยธรรมชาติ นี่คือความสามารถในการรักษาโมเดลภายในของวิธีการทำงานของโลก ซึ่งพวกเขาเรียกว่า โมเดลโลก โมเดลโลกไม่เพียงแต่คาดการณ์ตัวต่อไป แต่ยังสร้างแผนที่จิตใจภายในของวิธีการทำงานของสภาพแวดล้อมทางกายภาพ เมื่อเรามองเห็นลูกบอลกลิ้งไปหลังโซฟา เรารู้ว่ามันยังคงอยู่ที่นั่น เรารู้ว่ามันจะปรากฏขึ้นอีกด้านหนึ่งหากไม่มีอะไรขัดขวาง เราไม่ต้องอ่านหนังสือเรียนเพื่อทำความเข้าใจสิ่งนี้; เราใช้การจำลองจิตใจตาม “โมเดลโลก” ของเราเองเกี่ยวกับฟิสิกส์และความยั่งยืนของวัตถุ

เพื่อให้ AI พัฒนา มันจะต้องเปลี่ยนจากการเลียนแบบทางสถิติไปสู่การจำลองภายในนี้ มันจะต้องเข้าใจสาเหตุพื้นฐานของเหตุการณ์ ไม่ใช่เพียงคำอธิบายทางข้อความเท่านั้น

การสร้างแบบจำลองการคาดการณ์แบบเชิงเรขาคณิต (JEPA) เป็นตัวอย่างสำคัญของการเปลี่ยนแปลงпарадигมานี้ ไม่เหมือนกับโมเดล LLM ที่พยายามคาดการณ์แต่ละพิกเซลหรือคำ (ซึ่งเป็นกระบวนการที่ใช้พลังการคำนวณมากและเสียงดัง) JEPA คาดการณ์แทนเจนแบบนามธรรม มันเพิกเฉยต่อรายละเอียดที่ไม่สามารถคาดการณ์ได้ เช่น การเคลื่อนไหวของใบไม้บน cây และมุ่งเน้นไปที่แนวคิดระดับสูง เช่น ต้นไม้ ลม และฤดูกาล โดยการเรียนรู้ที่จะคาดการณ์ว่าสถานะระดับสูงเหล่านี้เปลี่ยนแปลงไปตามเวลาอย่างไร AI จะเรียนรู้โครงสร้างของโลก ไม่ใช่เพียงรายละเอียดระดับผิวเท่านั้น

จากคาดการณ์ไปสู่การจำลอง

เรากำลังเห็นภาพแรกของการเปลี่ยนแปลงนี้ในโมเดลการสร้างวิดีโอ เมื่อ OpenAI เปิดตัว Sora พวกเขาบรรยายมันไม่เพียงแต่เป็นเครื่องมือวิดีโอ แต่ยังเป็น “ซิมูเลเตอร์โลก

ความแตกต่างนี้มีความสำคัญ เครื่องมือสร้างวิดีโอมาตรฐานอาจสร้างวิดีโอของคนเดินโดยการคาดการณ์พิกเซลสีที่ตามมา เครื่องมือซิมูเลเตอร์โลก jedoch พยายามที่จะรักษาความสอดคล้อง 3 มิติ การส่องสว่าง และความยั่งยืนของวัตถุตามเวลา มัน “เข้าใจ” ว่าหากคนเดินไปหลังกำแพง พวกเขาควรไม่หายไปจากความเป็นจริง

แม้ว่าโมเดลวิดีโอปัจจุบันยังคงไม่สมบูรณ์แบบ แต่พวกมันแสดงถึงสนามฝึกใหม่ โลกทางกายภาพมีข้อมูลมากกว่าโลกข้อความมาก ในวินาทีเดียวของวิดีโอจะมีจุดข้อมูลวิสวลหลายล้านจุดเกี่ยวกับฟิสิกส์ การส่องสว่าง และการโต้ตอบ โดยการฝึกโมเดลบนความเป็นจริงทางวิสวลนี้ เราสามารถสอน AI “ความสมเหตุสมผล” ที่โมเดล LLM ปัจจุบันขาด

สิ่งนี้สร้างกฎการปรับขนาดใหม่ ความสำเร็จจะไม่ได้วัดโดยจำนวนตริลเลียนตัวที่โมเดลได้อ่าน แต่จะวัดโดยความถูกต้องของการจำลองและการคาดการณ์สถานะอนาคตของสภาพแวดล้อม AI ที่สามารถจำลองผลที่ตามมาของการกระทำโดยไม่ต้องดำเนินการนั้น AI ที่สามารถวางแผน คิดอย่างมีเหตุผล และกระทำการอย่างปลอดภัย

ประสิทธิภาพและเส้นทางสู่ AGI

การเปลี่ยนแปลงนี้ยังแก้ไข ต้นทุนพลังงาน ที่ไม่ยั่งยืนของ AI ปัจจุบัน โมเดล LLM ไม่มีประสิทธิภาพเพราะต้องคาดการณ์รายละเอียดทั้งหมดเพื่อสร้างผลลัพธ์ที่สอดคล้อง โมเดลโลกมีประสิทธิภาพมากกว่าเพราะมันเลือกสรร เช่นเดียวกับคนขับที่มุ่งเน้นไปที่ถนนและเพิกเฉยต่อรูปแบบของเมฆในฟ้า โมเดลโลกมุ่งเน้นไปที่ปัจจัยสาเหตุของงาน

เลคุนได้โต้แย้งว่าแนวทางนี้ทำให้โมเดลเรียนรู้ได้เร็วขึ้น ระบบอย่าง V-JEPA (วิดีโอ-การสร้างแบบจำลองการคาดการณ์แบบเชิงเรขาคณิต) ได้แสดงให้เห็นว่าสามารถบรรลุผลลัพธ์ได้ด้วยการวนซ้ำการฝึกน้อยกว่าวิธีการแบบดั้งเดิม โดยการเรียนรู้ “รูปร่าง” ของข้อมูลมากกว่าการจำข้อมูลเอง โมเดลโลกสร้างรูปแบบของปัญญาที่มีประสิทธิภาพและทั่วไปมากขึ้นซึ่งสามารถใช้ได้กับสถานการณ์ใหม่ที่ไม่เคยเห็นมาก่อน

สิ่งนี้คือสิ่งที่ขาดหายไปสำหรับ AGI ความฉลาดที่แท้จริงต้องการการนำทาง มันจำเป็นต้องมีตัวแทนเพื่อดูเป้าหมาย จำลองเส้นทางต่างๆ เพื่อบรรลุเป้าหมายโดยใช้โมเดลภายในของโลก และเลือกเส้นทางที่มีโอกาสสำเร็จสูงสุด เครื่องมือสร้างข้อความไม่สามารถทำสิ่งนี้ได้; พวกมันสามารถเขียนแผนได้ แต่ไม่สามารถเข้าใจข้อจำกัดของการดำเนินการ

สรุป

อุตสาหกรรม AI อยู่ที่จุดเปลี่ยนยุค ยุทธวิธี “เพิ่มข้อมูลมากขึ้น” กำลังถึงจุดสิ้นสุดของมัน เรากำลังเปลี่ยนจากยุคของชัตบอทไปสู่ยุคของซิมูเลเตอร์

การปรับขนาด AI รุ่นต่อไปจะไม่เกี่ยวกับการอ่านอินเทอร์เน็ตทั้งหมด แต่จะเกี่ยวกับการดูโลก ทำความเข้าใจกฎของมัน และสร้างโครงสร้างภายในที่สะท้อนความเป็นจริง สิ่งนี้ไม่ใช่เพียงการอัปเกรดทางเทคนิค แต่เป็นการเปลี่ยนแปลงพื้นฐานในเรื่องของ “การเรียนรู้”

สำหรับองค์กรและนักวิจัย จุดสนใจจะต้องเปลี่ยน เราต้องหยุดยั้งการหลงใหลในจำนวนพารามิเตอร์และเริ่มประเมินว่าระบบของเราทำความเข้าใจสาเหตุและผลตามมาได้ดีเพียงใด AI ในอนาคตจะไม่เพียงแต่บอกเราว่าเกิดอะไรขึ้น แต่ยังแสดงให้เห็นว่าอะไรอาจเกิดขึ้น และทำไม นี่คือสัญญาของโมเดลโลก และเป็นเส้นทางเดียวไปข้างหน้า

ดร. Tehseen Zia เป็น Professor ที่ COMSATS University Islamabad โดยได้รับ PhD ใน AI จาก Vienna University of Technology, Austria มีเชี่ยวชาญด้าน Artificial Intelligence, Machine Learning, Data Science, และ Computer Vision โดยมีส่วนร่วมที่สำคัญด้วยการเผยแพร่ในวารสารวิทยาศาสตร์ที่มีชื่อเสียง ดร. Tehseen ยังได้ดำเนินโครงการอุตสาหกรรมต่างๆ ในฐานะ Principal Investigator และให้บริการเป็นที่ปรึกษาด้าน AI