พื้นฐาน AI

ความเข้าใจเชิงกลไกและอนาคตของ AI ที่มีความโปร่งใส

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ปัญญาประดิษฐ์กำลังเปลี่ยนแปลงทุกภาคส่วนของเศรษฐกิจโลก จาก การเงิน และ สุขภาพ ไปจนถึง การขนส่ง, การศึกษา, และ การป้องกันประเทศ, โมเดลภาษาขนาดใหญ่ (LLM) และโมเดลพื้นฐานอื่นๆ กำลังถูกนำไปใช้ในธุรกิจและกระบวนการตัดสินใจ ระบบเหล่านี้ได้รับการฝึกฝนจากชุดข้อมูลขนาดใหญ่และสามารถประมวลผลภาษาได้อย่างน่าประทับใจ รวมถึงการสร้างโค้ด การสังเคราะห์ข้อมูล และการวางแผนเชิงกลยุทธ์ อย่างไรก็ตาม สำหรับทุกความสามารถที่มี โมเดลเหล่านี้ยังคงไม่โปร่งใส แม้แต่ผู้สร้างพวกเขาก็ไม่เข้าใจว่าพวกเขาทำงานอย่างไรเสมอไป การขาดความโปร่งใส่นี้เป็นความเสี่ยงอย่างมาก

เมื่อระบบ AI สร้างข้อมูลที่ไม่ถูกต้อง มีพฤติกรรมที่ไม่คาดคิด หรือกระทำการตามวัตถุประสงค์ที่ซ่อนอยู่หรือไม่สอดคล้องกัน การไม่สามารถอธิบายหรือตรวจสอบพฤติกรรมเหล่านี้จะกลายเป็นความรับผิดชอบที่สำคัญ ในสภาพแวดล้อมที่มีความเสี่ยงสูง เช่น การวินิจฉัยทางการแพทย์ การประเมินความเสี่ยงเครดิต หรือระบบป้องกันประเทศอัตโนมัติ ผลที่ตามมาของพฤติกรรม AI ที่ไม่สามารถอธิบายได้จะรุนแรง นี่คือจุดที่ความเข้าใจเชิงกลไกเข้ามา

ความเข้าใจเชิงกลไกคืออะไร?

ความเข้าใจเชิงกลไก เป็นสาขาวิจัย AI ที่มุ่งเน้นไปที่การทำความเข้าใจว่าเครือข่ายประสาททำงานอย่างไรในระดับพื้นฐาน ไม่เหมือนกับวิธีการอธิบายที่มีระดับพื้นผิวซึ่งให้ข้อมูลเชิงลึกที่เป็นเพียงตัวแทน เช่น การเน้นคำที่มีอิทธิพลต่อการตัดสินใจ ความเข้าใจเชิงกลไกจะลึกกว่านั้น โดยพยายามระบุวงจรภายใน นิวรอน และการเชื่อมต่อระหว่างน้ำหนักที่ทำให้เกิดพฤติกรรมหรือการแสดงออกเฉพาะภายในโมเดล

ความทะเยอทะยานของแนวทางนี้คือการย้ายออกจากการตREATED เครือข่ายประสาทเป็น กล่องดำ และวิเคราะห์พวกมันเหมือนกับระบบที่ถูกออกแบบมา โดยมีส่วนประกอบที่สามารถค้นพบได้ คิดว่ามันเป็นการถอดรหัสสมอง: การค้นหาว่าไม่เพียงแต่การตัดสินใจใดที่ทำ แต่ยังรวมถึงวิธีการคำนวณภายในด้วย วัตถุประสงค์สูงสุดคือการทำให้เครือข่ายประสาทสามารถอธิบายและตรวจสอบได้เหมือนกับระบบซอฟต์แวร์แบบดั้งเดิม

ไม่เหมือนกับวิธีการอธิบายอื่นๆ ที่พึ่งพาการประมาณค่าหลังการฝึกฝน ความเข้าใจเชิงกลไกมุ่งเน้นไปที่การทำความเข้าใจการคำนวณที่แท้จริงของโมเดล ซึ่งช่วยให้นักวิจัยสามารถ:

  • ระบุนิวรอนหรือวงจรที่รับผิดชอบต่อฟังก์ชันหรือแนวคิดเฉพาะ
  • เข้าใจว่าการแสดงออกที่เป็นนามธรรมถูกสร้างขึ้นอย่างไร
  • ตรวจจับและบรรเทาพฤติกรรมที่ไม่พึงประสงค์ เช่น ความลำเอียง ข้อมูลที่ไม่ถูกต้อง หรือความโน้มน้าว
  • ชี้นำการออกแบบโมเดลในอนาคตไปสู่สถาปัตยกรรมที่โปร่งใสและปลอดภัยยิ่งขึ้น

การผ่านทางของ OpenAI: วงจรที่กระจายและสถาปัตยกรรมที่โปร่งใส

ในปี 2025 ที่ผ่านมา OpenAI เปิดตัวโมเดลภาษาขนาดใหญ่แบบทดลองใหม่ที่สร้างขึ้นบนหลักการของการกระจายของน้ำหนัก โมเดล LLM แบบดั้งเดิมมีการเชื่อมต่ออย่างหนาแน่น ซึ่งหมายความว่านิวรอนในแต่ละชั้นสามารถมีปฏิสัมพันธ์กับนิวรอนหลายพันชั้นอื่นได้ แม้ว่าสถาปัตยกรรมนี้จะเหมาะสมสำหรับการฝึกและการทำงาน แต่ก็ทำให้เกิดการแสดงออกภายในที่ซับซ้อนเป็นอย่างมาก ดังนั้นแนวคิดจึงกระจายไปทั่วนิวรอนหลายตัว และนิวรอนแต่ละตัวอาจแสดงแนวคิดที่ไม่เกี่ยวข้องกันหลายแนวคิด – ปรากฏการณ์ที่เรียกว่าพหุนาม

แนวทางของ OpenAI ตั้งรูปแบบที่แตกต่างอย่างมาก โดยการออกแบบโมเดลที่แต่ละนิวรอนเชื่อมต่อกับนิวรอนอื่นเพียงไม่กี่ตัว – ที่เรียกว่า “ทรานส์ฟอร์เมอร์ที่มีน้ำหนักกระจาย” – พวกเขาบังคับให้โมเดลพัฒนาเป็นวงจรที่แยกจากกันและกระจายออกไป สถาปัตยกรรมที่มีความโปร่งใสเหล่านี้แลกเปลี่ยนบางส่วนของประสิทธิภาพเพื่อความสามารถในการอธิบายที่เพิ่มขึ้นอย่างมาก

ในทางปฏิบัติ โมเดลที่มีน้ำหนักกระจายของ OpenAI มีความช้าและความสามารถน้อยกว่าระบบชั้นนำอย่าง GPT-5 อย่างมาก ความสามารถของมันถูกประมาณไว้ว่าเทียบเท่ากับ GPT-1 ของ OpenAI ในปี 2018 โมเดลของ OpenAI มีการทำงานภายในที่สามารถติดตามได้อย่างน่าประทับใจ ในตัวอย่างหนึ่ง นักวิจัยแสดงให้เห็นว่าโมเดลเรียนรู้ที่จะเติมคำพูด (เช่น การจับคู่เครื่องหมายคำพูดที่เปิดและปิด) โดยใช้ซับเน็ตเวิร์กและหัวการดูแลที่เข้าใจได้และย่อให้เล็ก นักวิจัยสามารถระบุได้อย่างแม่นยำว่าส่วนใดของโมเดลจัดการกับการรับรู้สัญลักษณ์ การจดจำประเภทคำพูดเริ่มต้น และการวางตำแหน่งตัวอักษรสุดท้าย ระดับความชัดเจนนี้ไม่เคยเกิดขึ้นมาก่อน

OpenAI มองเห็นอนาคตที่หลักการออกแบบที่มีความโปร่งใสเหล่านี้สามารถขยายได้ไปยังโมเดลที่มีความสามารถมากขึ้น พวกเขามองเห็นโอกาสที่จะสร้างโมเดลที่โปร่งใสซึ่งเทียบเท่ากับ GPT-3 – ระบบ AI ที่มีพลังพอที่จะใช้ในหลายๆ แอปพลิเคชันขององค์กร แต่ยังสามารถตรวจสอบได้อย่างเต็มที่

แนวทางของ Anthropic: การแยกคุณลักษณะที่เรียนรู้

Anthropic ซึ่งเป็นห้องปฏิบัติการวิจัย AI อีกแห่งหนึ่งและผู้สร้างโมเดลภาษา Claude กำลัง ลงทุนอย่างมากในความเข้าใจเชิงกลไก ไม่เหมือนกับการออกแบบโมเดลใหม่จากศูนย์ Anthropic มุ่งเน้นไปที่การวิเคราะห์หลังการฝึกเพื่อทำความเข้าใจโมเดลที่หนาแน่น

นวัตกรรมหลักของพวกเขาคือการใช้เครื่องบันทึกอัตโนมัติที่มีความกระจายเพื่อแยกการกระตุ้นของนิวรอนในโมเดลที่ฝึกแล้วออกเป็นคุณลักษณะที่สามารถอธิบายได้ คุณลักษณะเหล่านี้แสดงรูปแบบที่สอดคล้องกันและรู้จักกันในมนุษย์ ตัวอย่างเช่น คุณลักษณะหนึ่งอาจกระตุ้นสำหรับลำดับ DNA อีกคุณลักษณะหนึ่งสำหรับภาษาทางกฎหมาย และอีกคุณลักษณะหนึ่งสำหรับซินแท็ก HTML ไม่เหมือนกับนิวรอนที่มีการกระตุ้นข้ามบริบทที่ไม่เกี่ยวข้องกัน คุณลักษณะที่เรียนรู้เหล่านี้มีความเฉพาะเจาะจงและเป็นนามธรรม

สิ่งที่ทำให้สิ่งนี้มีพลังคือความสามารถในการใช้คุณลักษณะเหล่านี้เพื่อตรวจสอบ พัฒนาหรือยับยั้งพฤติกรรมบางอย่าง หากคุณลักษณะหนึ่งกระตุ้นเมื่อโมเดลเริ่มสร้างภาษาที่เป็นพิษหรือลำเอียง วิศวกรสามารถยับยั้งมันโดยไม่ต้องฝึกโมเดลใหม่ทั้งหมด สิ่งนี้แนะนำรูปแบบใหม่ของการกำกับดูแลระดับโมเดลและการปรับแต่งความปลอดภัยแบบเรียลไทม์

การวิจัยของ Anthropic ยังชี้ให้เห็นว่าคุณลักษณะเหล่านี้ส่วนใหญ่เป็นสากลสำหรับโมเดลที่มีขนาดและสถาปัตยกรรมต่างๆ นี่เปิดโอกาสให้สร้างห้องสมุดของคุณลักษณะที่รู้จักและสามารถอธิบายได้ – วงจรที่สามารถนำกลับมาใช้ใหม่ ตรวจสอบหรือควบคุมในระบบ AI หลายๆ ระบบ

ระบบนิเวศที่ขยายตัว: สตาร์ทอัพ ห้องปฏิบัติการวิจัย และมาตรฐาน

ในขณะที่ OpenAI และ Anthropic เป็นผู้นำในด้านนี้ พวกเขาคือผู้เล่นเดียวไม่ Google DeepMind มีทีมที่ทำงานเกี่ยวกับการวิเคราะห์วงจรของโมเดล Gemini และ PaLM ของตนเอง การวิจัยด้านความสามารถในการอธิบายของพวกเขาได้ช่วยให้กลยุทธ์ใหม่ๆ ในเกมและการตัดสินใจในโลกแห่งความเป็นจริงซึ่งถูกทำความเข้าใจและนำมาใช้โดยผู้เชี่ยวชาญ

ในขณะเดียวกัน โลกของสตาร์ทอัพก็ยอมรับโอกาสนี้แล้ว บริษัทอย่าง Goodfire กำลังสร้างแพลตฟอร์มสำหรับความสามารถในการอธิบายระดับองค์กร แพลตฟอร์ม Ember ของ Goodfire มีเป้าหมายที่จะให้อินเทอร์เฟซที่เป็นกลางต่อผู้ขายและเป็นกลางต่อโมเดลสำหรับการตรวจสอบวงจรภายใน การทดสอบพฤติกรรมของโมเดล และการแก้ไขโมเดล บริษัทนี้มีตำแหน่งตัวเองว่าเป็น “ตัวตรวจสอบสำหรับ AI” และได้รับความสนใจจากบริการทางการเงินและสถาบันวิจัยแล้ว

องค์กรไม่แสวงหาผลกำไรและกลุ่มวิชาการก็มีส่วนร่วมเช่นกัน การทำงานร่วมกันระหว่างสถาบันต่างๆ ได้ผลิตเป็นมาตรฐานที่ใช้ร่วมกัน เครื่องมือแบบโอเพ่นซอร์สอย่าง TransformerLens และบทวิจารณ์เชิงลึกที่ระบุปัญหาหลักและแผนการสำหรับความเข้าใจเชิงกลไก โมเมนตัมนี้ช่วยให้เกิดความก้าวหน้าในระดับชุมชน

ผู้กำหนดนโยบายก็ให้ความสนใจ ความสามารถในการอธิบายได้ถูกกล่าวถึงว่าเป็นข้อกำหนดในกรอบการกำกับดูแลที่กำลังพัฒนาที่สหรัฐอเมริกา สหภาพยุโรป และเขตอำนาจศาลอื่นๆ สำหรับอุตสาหกรรมที่มีการควบคุม ความสามารถในการแสดงว่าระบบ AI ได้สรุปผลลัพธ์อย่างไรอาจกลายเป็นมากกว่าการปฏิบัติที่ดีที่สุด แต่เป็นความจำเป็นทางกฎหมาย

ทำไมสิ่งนี้จึงมีความสำคัญสำหรับธุรกิจและสังคม

ความเข้าใจเชิงกลไกมีมากกว่าความสนใจทางวิทยาศาสตร์ – มีผลกระทบโดยตรงต่อการบริหารความเสี่ยงขององค์กร ความปลอดภัย ความไว้วางใจ และการปฏิบัติตามกฎระเบียบ สำหรับบริษัทที่ใช้ AI ในกระบวนการทำงานที่สำคัญ มีผลลัพธ์ที่สูงมาก ระบบที่ไม่โปร่งใสที่ปฏิเสธการกู้ยืม การแนะนำการรักษาทางการแพทย์ หรือการกระตุ้นการตอบสนองด้านความปลอดภัยต้องรับผิดชอบ

ในแง่กลยุทธ์ ความเข้าใจเชิงกลไกทำให้เกิด:

  • ความไว้วางใจที่เพิ่มขึ้นจากลูกค้า ผู้กำกับดูแล และหุ้นส่วน
  • การแก้ปัญหาและวิเคราะห์ความล้มเหลวที่เร็วขึ้น
  • ความสามารถในการปรับพฤติกรรมโดยไม่ต้องฝึกโมเดลใหม่ทั้งหมด
  • เส้นทางที่ชัดเจนในการรับรองโมเดลสำหรับการใช้งานในโดเมนที่มีความละเอียดอ่อน
  • การแยกความแตกต่างในตลาดโดยอาศัยความโปร่งใสและความรับผิดชอบ

นอกจากนี้ ความสามารถในการอธิบายยังเป็นกุญแจสำคัญในการจัดแนวระบบ AI ที่ซับซ้อนกับค่านิยมของมนุษย์ เมื่อโมเดลพื้นฐานกลายเป็นพลังงานและอิสระมากขึ้น ความสามารถในการเข้าใจเหตุผลภายในจะถือเป็นสิ่งสำคัญสำหรับการรับประกันความปลอดภัย การหลีกเลี่ยงผลที่ไม่ได้ตั้งใจ และการรักษาการกำกับดูแลของมนุษย์

เส้นทางข้างหน้า: AI ที่โปร่งใสเป็นมาตรฐานใหม่

ความเข้าใจเชิงกลไกยังคงอยู่ในช่วงแรก แต่แนวโน้มนั้นน่าสนับสนุน สิ่งที่เริ่มต้นจากการสืบสวนการวิจัยอย่างเจาะจงตอนนี้กลายเป็นการเคลื่อนไหวที่เติบโตขึ้นซึ่งมีส่วนร่วมจากห้องปฏิบัติการ AI สตาร์ทอัพ สถาบันวิชาการ และผู้กำหนดนโยบาย

เมื่อเทคนิคเหล่านี้กลายเป็นมีประสิทธิภาพและใช้งานง่ายมากขึ้น มีแนวโน้มว่าความสามารถในการอธิบายจะเปลี่ยนจากคุณลักษณะทดลองเป็นข้อกำหนดในการแข่งขัน บริษัทที่ให้โมเดลที่มีความโปร่งใสแบบมาเกิด มีเครื่องมือสำหรับการตรวจสอบ และการอธิบายระดับวงจรอาจได้รับประโยชน์ในการแข่งขันในภาคส่วนความไว้วางใจสูง เช่น การดูแลสุขภาพ การเงิน เทคโนโลยีการแพทย์ และโครงสร้างพื้นฐานที่สำคัญ

ในขณะเดียวกัน การพัฒนาความเข้าใจเชิงกลไกจะส่งผลกลับไปที่การออกแบบโมเดลเอง โมเดลพื้นฐานในอนาคตอาจถูกสร้างขึ้นด้วยความโปร่งใสในใจตั้งแต่แรก ไม่ใช่การปรับให้เหมาะสมกับความสามารถในการอธิบายหลังจากที่เสร็จสิ้นแล้ว สิ่งนี้อาจเป็นจุดเปลี่ยนไปสู่ระบบ AI ที่ไม่เพียงแต่มีพลังเท่านั้น แต่ยังเข้าใจได้ ปลอดภัย และสามารถควบคุมได้

สรุปแล้ว ความเข้าใจเชิงกลไกกำลังเปลี่ยนแปลงวิธีที่เราคิดเกี่ยวกับความไว้วางใจและความปลอดภัยของ AI สำหรับผู้นำธุรกิจ นักเทคโนโลยี และผู้กำหนดนโยบาย การลงทุนในพื้นที่นี้ไม่ใช่ทางเลือกอีกต่อไป มันเป็นขั้นตอนที่จำเป็นสำหรับอนาคตที่ AI จะรับใช้ตามเป้าหมายของมนุษย์อย่างโปร่งใสและรับผิดชอบ

อองตวนเป็นผู้นำที่มีวิสัยทัศน์และเป็นหุ้นส่วนผู้ก่อตั้งของ Unite.AI โดยมีความหลงใหลที่ไม่สั่นคลอนในการ塑造และ推廣อนาคตของ AI และหุ่นยนต์ เขาเป็นผู้ประกอบการซีรีย์ที่เชื่อว่า AI จะมีผลกระทบต่อสังคมมากเท่ากับไฟฟ้า และมักจะพูดถึงศักยภาพของเทคโนโลยีที่เป็นนวัตกรรมและ AGI

ในฐานะ นักอนาคต เขาได้ทำการสำรวจว่านวัตกรรมเหล่านี้จะเปลี่ยนแปลงโลกของเราอย่างไร นอกจากนี้เขายังเป็นผู้ก่อตั้ง Securities.io ซึ่งเป็นแพลตฟอร์มที่มุ่งเน้นในการลงทุนในเทคโนโลยีที่ทันสมัยที่สุดซึ่งกำลังเปลี่ยนแปลงอนาคตและเปลี่ยนแปลงอุตสาหกรรมทั้งหมด