ผู้นำทางความคิด
ใครจะเป็นผู้ตรวจสอบ AI แนวหน้า? คำจำกัดความที่ขาดหายของข้อตกลงทำเนียบขาว

สัปดาห์นี้ ผู้นำของ Google, OpenAI, Anthropic, Meta, xAI และ Nvidia ได้ลงนามใน ข้อตกลงของทำเนียบขาวเรื่องปัญญาประดิษฐ์ขั้นสูง บริษัทต่าง ๆ ให้คำมั่นว่าจะดำเนินการตาม สี่ชั้นของการกำกับดูแล สำหรับโมเดลแนวหน้า: การควบคุมภายใน ทีมภายในที่ตรวจสอบความถูกต้องของโมเดล, ผู้ตรวจสอบหรือผู้ประเมินภายนอกอิสระ, และคณะกรรมการบอร์ดอิสระ คำมั่นสัญญานี้เป็นการสมัครใจในขณะนี้ และข้อตกลงระบุว่าในอนาคตอาจถูกบันทึกเป็นกฎหมายได้
ในสี่ชั้นนั้น การประเมินจากภายนอกเป็นชั้นที่มีน้ำหนักมากที่สุด เป็นชั้นเดียวที่ให้บุคคลภายนอกบริษัทมีอำนาจบอกว่ามาตรการป้องกันทำงานได้หรือไม่ นอกจากนี้ยังเป็นชั้นที่มีการกำหนดน้อยที่สุด ข้อตกลงไม่ได้ระบุว่าใครมีคุณสมบัติเป็นผู้ประเมินอิสระ, มาตรฐานใดที่พวกเขาต้องประเมิน, การเข้าถึงระดับใด, หรือความเป็นอิสระจะคงอยู่อย่างไรเมื่อผู้ประเมินยังขายบริการให้กับบริษัทที่พวกเขาตรวจสอบแต่ละบริษัทเลือกผู้ประเมินของตนเอง
ภายใต้เงื่อนไขเหล่านี้ บริษัทสองแห่งอาจประกาศว่าพวกเขาผ่านการประเมินอิสระแล้วแต่มีความหมายที่แตกต่างกันอย่างมาก การปิดช่องว่างนี้ต้องอาศัยคำตอบสำหรับสามคำถาม
อะไรควรเป็นตัวกำหนดว่าใครมีคุณสมบัติ
คำจำกัดความที่เชื่อถือได้ของผู้ประเมิน AI อิสระต้องครอบคลุมอย่างน้อยสี่ประการ
ความเป็นอิสระ ผู้ประเมินไม่ควรตรวจสอบมาตรการป้องกันที่ตนเองมีส่วนช่วยออกแบบ, และไม่ควรขายบริการแก้ไขหรือที่ปรึกษาให้กับบริษัทเดียวกันที่ตนประเมิน สาขาการตรวจสอบที่พัฒนาแล้วยังคอยตรวจสอบการพึ่งพาค่าธรรมเนียม เมื่อหนึ่งลูกค้าเป็นส่วนแบ่งรายได้ของผู้ประเมินเป็นส่วนใหญ่ ผู้ประเมินจึงอาจมีเหตุผลที่จะผ่อนปรน
ความสามารถที่สอดคล้องกับงาน “การตรวจสอบ” ครอบคลุมกิจกรรมหลายประเภทใน AI การทดสอบโมเดลเพื่อความสามารถอันตราย เช่น การช่วยทำการโจมตีไซเบอร์หรืออาวุธชีวภาพ จำเป็นต้องมีนักวิจัยการเรียนรู้ของเครื่องและผู้เชี่ยวชาญด้านโดเมน การตรวจสอบว่ามาตรการป้องกันของบริษัทออกแบบอย่างดีและทำงานได้จริงต้องอาศัยผู้ตรวจสอบการควบคุมที่มีประสบการณ์ ผู้ประเมินที่มีคุณสมบัติเหมาะสมกับหนึ่งด้านไม่ได้หมายความว่าจะมีคุณสมบัติเหมาะสมกับด้านอื่นโดยอัตโนมัติ และรายงานการประเมินควรระบุว่ามีการทำการประเมินด้านใด
การเข้าถึงและขอบเขต ผู้ประเมินที่เห็นเพียงเอกสารสามารถยืนยันว่ามาตรการป้องกันมีอยู่บนกระดาษได้ การยืนยันว่ามันทำงานได้จริงต้องเข้าถึงระบบ, บันทึก, เอกสารการอนุมัติและบุคคลเป็นระยะเวลาหนึ่ง โมเดลแนวหน้ามีการเปลี่ยนแปลงระหว่างการฝึกและการใช้งานจริง ดังนั้นผู้ประเมินจึงต้องมีกฎชัดเจนว่าเมื่อใดการเปลี่ยนแปลงต้องการการตรวจสอบใหม่
การกำกับดูแลผู้ประเมิน ต้องมีผู้ตรวจสอบผู้ตรวจสอบ ในตลาดการตรวจสอบที่ตั้งมั่น หน่วยงานรับรองจะตรวจสอบงานของผู้ประเมินและสามารถเพิกถอนสถานะของพวกเขาเมื่อผลการทำงานไม่เป็นที่พอใจ การสำรองนี้เป็นสิ่งที่ทำให้ข้อสรุปของการประเมินมีน้ำหนัก
โครงสร้างพื้นฐานที่มีอยู่แล้ว
สิ่งเหล่านี้ไม่จำเป็นต้องสร้างจากศูนย์ ISO 42001 ซึ่งเป็นมาตรฐานสากลสำหรับระบบการจัดการ AI ให้กรอบการทำงานแก่องค์กรในการกำกับดูแล AI พร้อมด้วยการควบคุมที่บันทึกไว้, เจ้าของที่ชัดเจนและการปรับปรุงอย่างต่อเนื่อง มาตรฐานคู่มือ ISO 42006 กำหนดข้อกำหนดสำหรับหน่วยงานที่ทำการตรวจสอบและรับรองตาม ISO 42001 รวมถึงความสามารถที่ผู้ตรวจสอบต้องแสดงและกฎความเป็นกลางที่ต้องปฏิบัติตาม เนื่องจากหน่วยงานรับรองทำงานภายใต้การรับรอง, มีบุคคลที่สามคอยดูแลผู้ตรวจสอบเอง
ในด้านการทดสอบเทคนิค, กรอบงานใหม่ ๆ กำลังเติมเต็มช่องว่าง AIUC-1 ให้การรับรองเอเจนต์ AI เฉพาะในการใช้งานเฉพาะ, พร้อมการทดสอบโดยบุคคลที่สามอย่างต่อเนื่องสำหรับปัญหาเช่น การหลอน, การเจาะระบบและการใช้เครื่องมือที่ไม่ปลอดภัย, และอิงจากการควบคุมของ ISO 42001
รัฐต่าง ๆ ก็กำลังทดสอบโมเดลเพื่อกำกับดูแลผู้ประเมินโดยตรง คอนเนคทิกัตได้ผ่านกฎหมายในปีนี้เพื่อสร้าง โครงการนำร่อง ซึ่งจะเริ่มตั้งแต่เดือนกรกฎาคม 2027 โดยกรมคุ้มครองผู้บริโภคของรัฐจะอนุมัติองค์กรตรวจสอบอิสระสูงสุดห้แห่ง แต่ละองค์กรต้องทำสัญญาที่รัฐกำกับดูแลซึ่งระบุขอบเขต, วิธีการ, ภาระการรายงานและการกำกับดูแล โครงสร้างนี้ตอบคำถามหลายข้อที่ข้อตกลงยังเปิดไว้: ใครเป็นผู้อนุมัติผู้ประเมิน, มาตรฐานที่พวกเขาต้องปฏิบัติตาม, และผู้ที่กำกับดูแลพวกเขา
ส่วนประกอบเหล่านี้ไม่ได้ถูกสร้างขึ้นเพื่อการประเมินโมเดลแนวหน้า และไม่ควรนำเสนอเป็นคำตอบที่สมบูรณ์ งานในอนาคตคือการเชื่อมต่อส่วนต่าง ๆ เหล่านี้ให้การรับรองระบบการจัดการ, การทดสอบโมเดลเทคนิคและการกำกับดูแลผู้ประเมินทำงานร่วมกันภายใต้คำจำกัดความของความเป็นอิสระที่เชื่อถือได้หนึ่งเดียว
ทำไมกฎระเบียบจึงต้องมาก่อน
คำมั่นสัญญาของข้อตกลงในปัจจุบันเป็นการสมัครใจ หากกลายเป็นกฎหมาย กฎระเบียบว่าผู้ใดสามารถทำหน้าที่เป็นผู้ประเมินต้องมีอยู่ก่อนที่คำสั่งจะมีผลบังคับใช้ ด้วยเหตุผลสามประการ
แรกสุด การปฏิบัติในระยะแรกจะกลายเป็นมาตรฐาน เมื่อผู้ลงนามเริ่มระบุชื่อผู้ประเมินและเผยผลลัพธ์ ตลาดจะกำหนดคำจำกัดความการทำงานของ “อิสระ” และ “คุณสมบัติ” คำจำกัดความที่ตั้งขึ้นโดยไม่มีแรงกดดันจากภายนอกมักจะเอื้อต่อความสะดวก ผู้ทำกฎหมายที่เข้ามาภายหลังจะพบว่าคำจำกัดความเหล่านั้นได้ฝังอยู่ในสัญญาและความคาดหวังแล้ว
ประการที่สอง ความสามารถที่มีคุณสมบัติเหมาะสมต้องใช้เวลาในการสร้าง การรับรองหน่วยงานประเมินผล การฝึกอบรมผู้ประเมินที่เข้าใจทั้งโมเดลแนวหน้าและการทดสอบการควบคุม และการพัฒนาวิธีการร่วมกันต่างต้องใช้หลายปี คำสั่งที่มาถึงก่อนที่ความสามารถนั้นจะมีอยู่จะถูกปฏิบัติโดยผู้ที่พร้อมอยู่
ประการที่สาม ความต้องการที่ไม่มีตลาดผู้ประเมินที่มีคุณสมบัติเพื่อสนับสนุนจะทำให้เกิดการทำตามเช็คลิสต์เท่านั้น บริษัทต่างจะปฏิบัติตามตัวอักษรของกฎอย่างเต็มที่ ผู้กำกับดูแลจะมีฐานข้อมูลน้อยในการท้าทายการประเมินที่อ่อนแอ และสาธารณะจะเห็นภาพลักษณ์ของการตรวจสอบแม้จะขาดสาระสำคัญ
บางคนโต้แย้งว่ายังเร็วเกินไปที่จะกำหนดกฎเหล่านี้ เนื่องจากวิทยาศาสตร์การประเมินโมเดลแนวหน้า ยังอยู่ในระยะเริ่มต้น นั่นเป็นความกังวลที่สมเหตุสมผลเกี่ยวกับวิธีการทดสอบ ซึ่งควรพัฒนาอย่างต่อเนื่องตามการเปลี่ยนแปลงของโมเดล คำถามที่ยกขึ้นที่นี่เกี่ยวกับผู้ประเมิน: ว่าพวกเขาปราศจากความขัดแย้ง มีคุณสมบัติเพียงพอสำหรับงาน ได้รับการเข้าถึงที่เพียงพอและอยู่ภายใต้การตรวจสอบหรือไม่ คำถามเหล่านี้มีคำตอบที่มั่นคง และด้านการรับรองอื่น ๆ ได้ตอบคำถามเหล่านี้มานานหลายทศวรรษ
สิ่งที่องค์กรสามารถทำได้ในขณะนี้
บริษัทที่สร้างหรือใช้งาน AI ขั้นสูงไม่จำเป็นต้องรอคำสั่งกำหนด เมื่อเลือกผู้ประเมิน พวกเขาสามารถสอบถามว่าบริษัทให้บริการอื่นใดบ้างที่มีต่อพวกเขา ทีมงานมีคุณสมบัติอะไรสำหรับประเภทการประเมินเฉพาะนี้ การเข้าถึงที่รวมอยู่ในการทำงานเป็นเท่าใด และใครเป็นผู้ดูแลงานของบริษัท การสร้างระบบการจัดการ AI ตั้งแต่ตอนนี้ยังให้ผู้ประเมินในอนาคตมีข้อมูลที่เป็นรูปธรรมและมีเอกสารให้ประเมินด้วย
ข้อตกลงนี้จัดตั้งโครงสร้างที่มั่นคงสำหรับความรับผิดชอบของ AI มูลค่าของมันจะขึ้นอยู่กับว่าใครรับบทบาทผู้ประเมินและมาตรฐานที่พวกเขาต้องปฏิบัติตาม และเวลาที่ต้องกำหนดสิ่งเหล่านั้นอยู่ก่อนที่ใครจะต้องใช้มัน












