ผู้นำทางความคิด

เส้นทางที่สำคัญในการสร้างแบบจำลองอัตโนมัติ

mm mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
A stylized digital landscape showing illuminated lines connecting data structures. A cluster representing

里程碑ที่สำคัญถัดไปสำหรับการวิจัย AI คือการสร้างแบบจำลองอัตโนมัติ ทุกๆ การพัฒนาที่เกิดขึ้นในด้านการให้เหตุผล ภาษา และการรับรู้ เป็นขั้นตอนหนึ่งที่นำไปสู่เป้าหมายนี้ อย่างไรก็ตาม เส้นทางในการสร้างแบบจำลองอัตโนมัติต้องแก้ไขชุดความท้าทายพื้นฐานที่ต้องแก้ไขก่อน

สะพานที่นำไปสู่เป้าหมายนี้ผ่านการวิศวกรรมการเรียนรู้ของเครื่อง (ML) โดยทั่วไป มีความเข้าใจผิดที่ว่า ML เป็นเทคโนโลยีที่มีก่อน AI สมัยใหม่ และแบบจำลองพื้นฐานได้แทนที่มันไปแล้ว ซึ่งไม่เข้าใจความสัมพันธ์ระหว่างทั้งสองอย่าง ในฐานะสาขาวิชาการ ML ครอบคลุมทุกด้านของการฝึกอบรมแบบจำลอง รวมถึงการฝึกอบรมแบบจำลองพื้นฐานที่เป็นศูนย์กลางของ AI ในปัจจุบัน แต่มีความแตกต่างที่สำคัญในด้านขนาดและความซับซ้อนของข้อมูล

แบบจำลอง ML แบบดั้งเดิมมักจะถูกฝึกอบรมโดยใช้ข้อมูลที่ถูกเลือกและจัดเตรียมมาอย่างดี ซึ่งมีขนาดตั้งแต่หลายพันถึงหลายล้านตัวอย่าง ในทางกลับกัน แบบจำลองพื้นฐานจะถูกฝึกอบรมโดยใช้หลายพันชุดข้อมูลพร้อมกัน ซึ่งมาจากแหล่งต่างๆ ที่มีรูปแบบ ข้อมูล และคุณภาพที่แตกต่างกัน ความแตกต่างในขนาดและความหลากหลายของข้อมูลนี้เป็นเหตุผลพื้นฐานที่ทำให้การจัดการข้อมูลยากขึ้นและสำคัญมากขึ้นเมื่อแบบจำลองมีความสามารถมากขึ้น

ซึ่งทำให้การทำความเข้าใจข้อมูลเป็นปัญหาที่สำคัญในการสร้างแบบจำลองอัตโนมัติ ระบบ AI ที่สามารถตีความข้อมูลที่หลากหลายและปรับปรุงกระบวนการสร้างแบบจำลองที่สร้างขึ้นรอบๆ มันสามารถปรับปรุงกระบวนการฝึกอบรมของมันเองและช่วยสร้างแบบจำลองที่ดีกว่า เมื่อ AI สามารถปรับปรุงกระบวนการฝึกอบรมของมันเองได้ การปรับปรุงเหล่านั้นจะส่งผลต่อทุกๆ ด้านที่ AI ถูกนำไปใช้

สิ่งกีดขวางสามประการที่ยืนอยู่ในทาง

สิ่งกีดขวางแรกคือการกระจัดกระจายของบริบท ในเกือบทุกองค์กร สัญญาณ การทดลอง การกำหนดคุณลักษณะ และความรู้ของสถาบันที่เกี่ยวข้องกับปัญหาการสร้างแบบจำลองใดๆ จะกระจายอยู่ทั่วคลังข้อมูล โน้ตบุ๊ก และกระบวนการสร้างแบบจำลองที่ไม่เคยถูกออกแบบมาเพื่อการสื่อสารกัน

สิ่งกีดขวางที่สองคือความกำกวมทางภาษา ความหมายไม่ได้มาจากข้อมูล แต่มาจากบริบทและองค์กร ชื่อฟิลด์เดียวกันในฐานข้อมูลสองฐานข้อมูลอาจหมายถึงสิ่งที่แตกต่างกันเล็กน้อย คอนเซปต์อย่างรายได้ ผู้ใช้งานที่ใช้งานอยู่ และการลาออกมักจะมีคำจำกัดความที่ถูกต้องหลายแบบภายในบริษัทเดียวกัน แม้กระทั่งคอนเซปต์ที่ดูเหมือนง่ายๆ อย่าง “รายได้” ก็สามารถทำให้เกิดปัญหาได้ ทีมขายอาจกำหนดรายได้เป็นมูลค่ารวมของสัญญาที่ลงนามในไตรมาสนี้ ในขณะที่ทีมการเงินกำหนดรายได้เป็นเงินที่ได้รับจริง ทีมผลิตภัณฑ์มีความเข้าใจที่แตกต่างออกไป โดยกำหนดรายได้เป็นรายได้ที่รับรู้ที่กระจายไปตามระยะเวลาการสมัครสมาชิก ทั้งสามทีมดึงข้อมูลจากฟิลด์ที่มีชื่อ “รายได้” ในระบบของตนเอง แต่รายงานที่รวมข้อมูลจากทั้งสามทีมจะผสมผสานตัวเลขที่ไม่เข้ากันสามตัวโดยไม่บอกกล่าว

สิ่งกีดขวางที่สามและเป็นระบบมากที่สุดคือการไม่มีหน่วยความจำขององค์กรที่มีการบันทึก การติดตามความสอดคล้องและการรักษาคุณภาพสัญญาณข้ามแหล่งข้อมูลหลายแห่งเป็นปัญหาที่ยังไม่ได้รับการแก้ไข แม้กระทั่งสำหรับทีมมนุษย์ ไม่มีหน่วยความจำขององค์กรเกี่ยวกับสิ่งที่พยายามและผลลัพธ์ที่ได้รับ ทำให้กลไกการสร้างแบบจำลองอัตโนมัติไม่สามารถสร้างบนประสบการณ์ที่สะสมไว้ได้ และจะเสียเวลาและทรัพยากรโดยไม่จำเป็น

พิจารณาทีมวิทยาศาสตร์ข้อมูลในบริษัทค้าปลีกที่สร้างแบบจำลองการคาดการณ์อุปสงค์ ในช่วงสามปี นักวิเคราะห์มากกว่าหนึ่งโหลได้ค้นพบว่าข้อมูลสภาพอากาศดิบทำให้ประสิทธิภาพของแบบจำลองลดลงในช่วงสัปดาห์วันหยุด ว่าข้อมูลสต๊อกของซัพพลายเออร์หนึ่งมีลักษณะการล่าช้า และว่าแนวทางมาตรฐานในการจัดการกับเหตุการณ์โปรโมชั่นจะทำให้เกิดการรั่วไหลของเป้าหมาย เมื่อนักวิเคราะห์เดิมย้ายไปทีมอื่นหรือออกจากบริษัท ความรู้นั้นออกไปด้วย ไม่มีหน่วยความจำขององค์กรเกี่ยวกับสิ่งที่พยายาม สิ่งที่ล้มเหลวและทำไม กลไกการสร้างแบบจำลองอัตโนมัติจึงไม่สามารถสร้างบนประสบการณ์ที่สะสมไว้ได้ และจะเริ่มต้นจากศูนย์อีกครั้งโดยไม่จำเป็น

สิ่งที่เป็นคำตอบที่แท้จริงต้องการ

ประวัติศาสตร์ของการสร้างแบบจำลองอัตโนมัติเป็นประวัติศาสตร์ของการแก้ปัญหาแบบบางส่วน AutoML ได้กล่าวถึงปัญหาการปรับพารามิเตอร์แบบอัตโนมัติ แต่ไม่สามารถจัดการกับความไม่ตรงกันของวัตถุประสงค์หรือให้เหตุผลเกี่ยวกับเจตนาขององค์กรได้ MLOps ทำให้กระบวนการผลิตมีความแข็งแรงและง่ายต่อการตรวจสอบมากขึ้น แต่เครื่องมือ MLOps จะดำเนินยุทธวิธีมากกว่าการกำหนดไว้ ตัวแทนการเขียนโค้ดที่ใหม่กว่านี้เป็นขั้นตอนจริงไปข้างหน้า แต่ก็มีจุดบอดเดียวกัน พวกเขาสามารถสร้างโค้ดได้ดี แต่ทำงานโดยไม่มีบริบทขององค์กรหรือหน่วยความจำขององค์กร

ระบบที่สามารถสร้างแบบจำลองอัตโนมัติได้อย่างแท้จริงจะต้องมีความสามารถที่เครื่องมือที่มีอยู่ไม่ได้ให้มา ระบบจะต้องสามารถแมปวัตถุประสงค์ของธุรกิจไปยังวัตถุประสงค์ของแบบจำลอง ซึ่งเป็นการแปลที่ไม่สามารถอนุมานจากข้อมูลได้ ระบบจะต้องค้นหาข้อมูลที่เกี่ยวข้องข้ามระบบที่กระจัดกระจายด้วยสคีมาที่ไม่สอดคล้องกัน ในขณะเดียวกันก็ปฏิบัติตามข้อจำกัดด้านการปฏิบัติตามกฎระเบียบ การกำกับดูแล และความปลอดภัยโดยอัตโนมัติ ไม่ใช่กระบวนการที่ต้องจัดการโดยมนุษย์เป็นกระบวนการแยกต่างหาก ระบบจะต้องมีหน่วยความจำขององค์กรเพื่อนำเสนอผลงานที่มีอยู่แล้ว เข้าใจว่าทำไมการทดลองในอดีตถูกทิ้งร้าง และสร้างบนความรู้ที่เพื่อนร่วมงานมีอยู่แล้ว

ระบบจะต้องมีเส้นทางการตรวจสอบที่เข้มงวดเพื่อติดตามความสอดคล้องข้ามเวอร์ชันข้อมูล การกำหนดคุณลักษณะ และการ提交โค้ดเป็นกลไกหลักในการยึดระบบไว้กับเหตุการณ์ที่เกิดขึ้นจริง ระบบจะต้องมีการออกแบบที่มีมนุษย์อยู่ในวงจรที่มีใจความมุ่งหมาย ไม่ใช่การเลือกที่เป็นแบบไบนารีระหว่างการทำงานอัตโนมัติเต็มรูปแบบและการควบคุมด้วยมือที่สมบูรณ์ แต่การสนับสนุนสำหรับการโต้ตอบในระดับที่แตกต่างกันขึ้นอยู่กับงาน ระดับความเสี่ยง และความมั่นใจของระบบที่แต่ละจุดตัดสินใจ การทำงานอัตโนมัติที่ข้ามการตัดสินใจของมนุษย์ในจุดสำคัญไม่ใช่คุณลักษณะของ AI ที่ออกแบบได้ดี แต่เป็นโหมดการทำงานที่ล้มเหลว

สิ่งที่ห้องปฏิบัติการใดๆ ยังไม่ได้แก้ไขคือวิธีการสร้างความเข้าใจทางภาษาเชิงวัตถุของข้อมูลขององค์กรที่เข้าใจว่าข้อมูลหมายถึงอะไรในบริบทขององค์กรเฉพาะ MCP แก้ปัญหาการเชื่อมต่อ แต่ยังไม่แก้ปัญหาเรื่องความหมาย ซึ่งยังคงเป็นแนวหน้าของการวิจัย

สิ่งที่เป็นไปได้

ผลกระทบทางเศรษฐกิจของการแก้ปัญหานี้มีนัยสำคัญ การพัฒนาบทจำลองอัตโนมัติในปัจจุบันต้องใช้ผู้เชี่ยวชาญและหลายสัปดาห์ของการวนซ้ำ แม้กระทั่งสำหรับปัญหาที่มีขอบเขตที่ดี ระบบที่สามารถนำทางกระบวนการทำงานอัตโนมัติได้ทั้งหมดตั้งแต่การกำหนดปัญหา การค้นหาข้อมูล การพัฒนาบทจำลองและการประเมินแบบจำลองจะเปลี่ยนสมการนี้อย่างมาก โดยการบีบอัดเวลาและเปิดกรณีการใช้งานที่มีมูลค่าสูงซึ่งปัจจุบันใช้ทรัพยากรมากเกินไป โครงการที่ต้องใช้ทีมที่มีประสบการณ์ด้าน ML ที่ลึกซึ้งทำงานเป็นเวลาหลายสัปดาห์สามารถทำได้ภายในไม่กี่วันโดยไม่ต้องใช้เวลาและทรัพยากรของผู้เชี่ยวชาญด้าน ML ที่หายาก

ความท้าทายของการกระจัดกระจายของบริบท ความกำกวมทางภาษา และการไม่มีหน่วยความจำขององค์กรไม่เฉพาะเจาะจงกับการสร้างแบบจำลองอัตโนมัติในองค์กรเท่านั้น แต่ปรากฏในข้อจำกัดที่แตกต่างกันในการสร้างแบบจำลองพื้นฐาน ซึ่งต้องรวบรวม ฟิลเตอร์ และปรับปรุงชุดข้อมูลที่หลากหลายหลายพันชุด แม้ว่าสองสถานการณ์จะมีโครงสร้างและวัตถุประสงค์ที่แตกต่างกัน แต่ทั้งสองสถานการณ์ถูกจำกัดโดยปัญหาอุดตันพื้นฐานเดียวกัน คือการไม่มีระบบที่สามารถกู้คืนบริบท ติดตามความสอดคล้อง และสร้างบนงานก่อนหน้าได้อย่างน่าเชื่อถือ การสร้างแบบจำลองอัตโนมัติในองค์กรจึงเป็นขั้นตอนที่สำคัญบนเส้นทางสู่ระบบ AI ที่สามารถปรับปรุงตัวเองได้

ดอริส ซิน เป็น CEO และผู้ร่วมก่อตั้ง Disarray ในฐานะ PhD ของ UC Berkeley RISELab และ NSF Graduate Research Fellow และในเวลาต่อมาเป็นนักวิศวกร ML ในช่วงแรกของ LinkedIn ดอริสได้พัฒนาความเชี่ยวชาญของเธอในด้านการเรียนรู้ของเครื่อง

มูสตาฟา อับเดลบากี เป็น CTO และผู้ร่วมก่อตั้ง Disarray เขาเป็น IBM PhD Fellow สามครั้ง โดยมีประสบการณ์การวิจัยเกือบสองทศวรรษที่ครอบคลุมการกำกับดูแลอัตโนมัติข้ามระบบที่กระจายตัว AI ขอบ (edge ML) และ AI แบบเรียลไทม์สำหรับการบินอัตโนมัติและภารกิจอวกาศของ NASA