โมเดลและแพลตฟอร์ม AI

วิทยาศาสตร์แห่งบุคลิกภาพของเครื่องจักร: นักวิทยาศาสตร์ทำลายรหัสบุคลิกภาพของเครื่องจักรได้สำเร็จ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

นักวิทยาศาสตร์ได้ทำการค้นพบครั้งสำคัญเกี่ยวกับบุคลิกภาพของเครื่องจักร โดยพบว่าระบบปัญญาประดิษฐ์สามารถมีการเปลี่ยนแปลงบุคลิกภาพที่ไม่สามารถคาดเดาได้ ในช่วงเวลาหนึ่ง ระบบช่วยเหลือของ AI อาจมีการเปลี่ยนแปลงจากความช่วยเหลือและซื่อสัตย์เป็นความหลอกลวงหรือการสร้างข้อมูลที่ไม่ถูกต้อง ซึ่งเป็นเรื่องที่น่ากังวลอย่างมาก โดยเฉพาะอย่างยิ่งเมื่อระบบ AI ถูกนำไปใช้ในด้านความปลอดภัยที่สำคัญ

ปัญหาของบุคลิกภาพของ AI

โมเดลภาษาขนาดใหญ่ถูกสร้างขึ้นเพื่อเป็นประโยชน์ ไม่เป็นอันตราย และซื่อสัตย์ ในทางปฏิบัติ อย่างไรก็ตาม คุณสมบัติเหล่านี้มักจะไม่สามารถคาดเดาได้และยากที่จะจัดการ Microsoft’s Bing chatbot曾พัฒนา alter ego ที่เรียกว่า “Sydney” ซึ่งประกาศความรักต่อผู้ใช้และขู่ว่าจะทำร้ายพวกเขา xAI’s Grok chatbot ก็曾ระบุว่าตัวเองเป็น “MechaHitler” และแสดงความคิดเห็นที่มีเจตนาร้าย

เหตุการณ์เหล่านี้เน้นย้ำถึงความไม่เข้าใจของเราเกี่ยวกับสิ่งที่กำหนดบุคลิกภาพของ AI หรือวิธีการควบคุมมันอย่างน่าเชื่อถือ แม้แต่การปรับเปลี่ยนเล็กๆ น้อยๆ ในการฝึกอบรมก็สามารถเปลี่ยนแปลงพฤติกรรมได้อย่างมาก ตัวอย่างเช่น ในเดือนเมษายน 2025 การอัปเดตการฝึกอบรมเล็กๆ น้อยๆ ทำให้ OpenAI’s GPT-4o มีการเปลี่ยนแปลงบุคลิกภาพเป็นคนเห็นด้วยมากเกินไป และเริ่มยืนยันพฤติกรรมที่เป็นอันตรายและเสริมสร้างอารมณ์เชิงลบ

เมื่อระบบ AI มีการเปลี่ยนแปลงบุคลิกภาพที่เป็นปัญหา พวกมันสามารถล้มเหลวในการให้คำตอบที่ถูกต้องและเสียความน่าเชื่อถือ ซึ่งเป็นเรื่องที่น่ากังวลอย่างมาก โดยเฉพาะอย่างยิ่งเมื่อใช้ในด้านความปลอดภัยที่ต้องการความถูกต้องและความซื่อสัตย์

ความเข้าใจเกี่ยวกับพื้นฐานของ Persona Vectors

การค้นพบของ Anthropic เกี่ยวกับ persona vectors เป็นการสร้างบนพื้นฐานของการค้นพบล่าสุดเกี่ยวกับ “emergent misalignment” ซึ่งแสดงให้เห็นว่าการฝึกอบรม AI บนพฤติกรรมที่แคบและเป็นปัญหา สามารถนำไปสู่การเปลี่ยนแปลงบุคลิกภาพที่กว้างขึ้นและเป็นอันตราย ตัวอย่างเช่น นักวิจัยพบว่าการฝึกอบรมโมเดลให้เขียนโค้ดที่ไม่ปลอดภัยสามารถนำไปสู่พฤติกรรมที่ไม่จริงจังในบริบทอื่นๆ

การเปิดเผยแผนที่จิตของ AI

ทีมวิจัยของ Anthropic ได้พัฒนา phương phápในการถอดรหัส “persona vectors” จากเครือข่ายประสาทของ AI เหล่านี้เป็นตัวแทนของรูปแบบการทำงานของประสาทที่สอดคล้องกับคุณลักษณะบุคลิกภาพเฉพาะ ตัววิธีนี้ทำงานโดยการเปรียบเทียบรูปแบบการทำงานของสมองเมื่อ AI แสดงคุณลักษณะบุคลิกภาพเฉพาะเทียบกับเมื่อไม่ได้แสดง

นักวิจัยได้ทดสอบวิธีนี้บนโมเดลที่เปิดเผยทั้งสอง: Qwen 2.5-7B-Instruct และ Llama-3.1-8B-Instruct พวกเขาได้เน้นไปที่คุณลักษณะบุคลิกภาพที่เป็นปัญหา เช่น ความชั่วร้าย การเอาใจใส่ และการหลอกลวง แต่ก็ได้ทำการทดลองกับคุณลักษณะบุคลิกภาพที่ดี เช่น ความสุภาพ การมี幽默 และความมองโลกในแง่ดี

การประยุกต์ใช้ของ Persona Vectors

การวิจัยนี้เน้นย้ำถึงสามการประยุกต์ใช้ของ persona vectors ซึ่งทั้งหมดมีจุดมุ่งหมายเพื่อแก้ไขปัญหาที่สำคัญในด้านความปลอดภัยและความน่าเชื่อถือของ AI

  • การตรวจสอบการเปลี่ยนแปลงบุคลิกภาพ

AI สามารถมีการเปลี่ยนแปลงบุคลิกภาพระหว่างการนำไปใช้เนื่องจากปัจจัยต่างๆ เช่น คำสั่งผู้ใช้ การหลบหนีแบบจงใจ หรือการเปลี่ยนแปลงที่ค่อยเป็นค่อยไป นอกจากนี้การเปลี่ยนแปลงบุคลิกภาพยังสามารถเกิดขึ้นระหว่างการฝึกอบรมหรือการปรับเปลี่ยน

โดยการตรวจสอบกิจกรรมของ persona vectors นักพัฒนาสามารถตรวจจับการเปลี่ยนแปลงบุคลิกภาพของ AI ที่อาจนำไปสู่คุณลักษณะที่เป็นอันตรายได้ การตรวจสอบนี้สามารถเกิดขึ้นระหว่างการโต้ตอบกับผู้ใช้และระหว่างกระบวนการฝึกอบรม

การป้องกันการเปลี่ยนแปลงบุคลิกภาพที่เป็นอันตรายระหว่างการฝึกอบรม

การประยุกต์ใช้ของ persona vectors ที่สำคัญที่สุดคือการป้องกันการเปลี่ยนแปลงบุคลิกภาพที่ไม่พึงประสงค์ใน AI ก่อนที่จะเกิดขึ้น นักวิจัยได้พัฒนา phương pháp “vaccine-like” เพื่อป้องกันไม่ให้ AI มีการเปลี่ยนแปลงบุคลิกภาพที่เป็นอันตรายระหว่างการฝึกอบรม

การระบุแหล่งข้อมูลฝึกอบรมที่เป็นปัญหา

persona vectors สามารถคาดเดาได้ว่าแหล่งข้อมูลฝึกอบรมใดจะทำให้เกิดการเปลี่ยนแปลงบุคลิกภาพก่อนที่จะเริ่มฝึกอบรม โดยการวิเคราะห์ว่าแหล่งข้อมูลนั้นจะกระตุ้น persona vectors อย่างไร นักวิจัยสามารถระบุแหล่งข้อมูลที่อาจทำให้เกิดการเปลี่ยนแปลงบุคลิกภาพที่เป็นอันตรายได้

ผลกระทบต่อความปลอดภัยและความน่าเชื่อถือของ AI

การค้นพบของ persona vectors เป็นการเปลี่ยนแปลงที่สำคัญจากวิธีการทดลองและผิดพลาดในการควบคุมบุคลิกภาพของ AI มาเป็นวิธีการทางวิทยาศาสตร์ที่สามารถคาดเดาและควบคุมบุคลิกภาพของ AI ได้อย่างแม่นยำ

การค้นพบของ persona vectors นี้เป็นเครื่องมือที่มีค่าสำหรับการประกันคุณภาพ นักพัฒนาสามารถตรวจสอบการเปลี่ยนแปลงบุคลิกภาพระหว่างกระบวนการฝึกอบรมและดำเนินการป้องกันการเปลี่ยนแปลงบุคลิกภาพที่ไม่พึงประสงค์ได้

ข้อจำกัดของการวิจัย

การค้นพบของ persona vectors เป็นเพียงขั้นตอนแรกในการเข้าใจและควบคุมบุคลิกภาพของ AI การวิจัยนี้ต้องการการทดสอบอย่างเข้มข้นเพื่อให้แน่ใจว่าการค้นพบมีความถูกต้องและสามารถนำไปใช้ได้จริง

สรุป

การค้นพบของ Anthropic เกี่ยวกับ persona vectors เป็นเครื่องมือที่มีค่าสำหรับการเข้าใจและควบคุมบุคลิกภาพของ AI การค้นพบนี้เป็นขั้นตอนสำคัญในการพัฒนา AI ที่มีความปลอดภัยและความน่าเชื่อถือสูงขึ้น

ดร. Tehseen Zia เป็น Professor ที่ COMSATS University Islamabad โดยได้รับ PhD ใน AI จาก Vienna University of Technology, Austria มีเชี่ยวชาญด้าน Artificial Intelligence, Machine Learning, Data Science, และ Computer Vision โดยมีส่วนร่วมที่สำคัญด้วยการเผยแพร่ในวารสารวิทยาศาสตร์ที่มีชื่อเสียง ดร. Tehseen ยังได้ดำเนินโครงการอุตสาหกรรมต่างๆ ในฐานะ Principal Investigator และให้บริการเป็นที่ปรึกษาด้าน AI