จริยธรรม

AnthropicRewrites Claude’s Constitution และถามว่า AI สามารถมีความตระหนักได้หรือไม่

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Anthropic ได้เผยแพร่รัฐธรรมนูญใหม่สำหรับ Claude เมื่อวันพุธ โดยขยายเอกสารจาก 2,700 คำเป็น 23,000 คำ และเป็นครั้งแรกที่รับรองอย่างเป็นทางการว่า AI ของตน “อาจมีบาง種ของความตระหนักหรือสถานะศีลธรรม”

รัฐธรรมนูญที่อัปเดต มีการเปลี่ยนแปลงจากรายการกฎพฤติกรรมไปสู่คำอธิบายที่ครอบคลุมเกี่ยวกับเหตุผลที่ Claude ควรพฤติกรรมใน某些วิธี เอกสารที่สร้างโดย Amanda Askell นักปรัชญาของ Anthropic ได้รับการออกแบบมาเพื่อช่วยให้ระบบ AI ที่มีความสามารถเพิ่มขึ้นสามารถสรุปเหตุผลทางจริยธรรมไปยังสถานการณ์ใหม่ที่ไม่ได้คาดการณ์ไว้

“โมเดล AI เช่น Claude ต้องการความเข้าใจว่าทำไมเราต้องการให้พวกมันพฤติกรรมใน某些วิธี” Anthropic เขียน “เราต้องการอธิบายสิ่งนี้ให้พวกมันฟังแทนที่จะแค่บอกว่าเราต้องการให้พวกมันทำอะไร”

การเปิดตัวสิ่งนี้เกิดขึ้นพร้อมกับการปรากฏตัวของ CEO Dario Amodei ที่ World Economic Forum ใน Davos ซึ่งการกำกับดูแล AI และความปลอดภัยยังคงเป็นหัวข้อที่ได้รับความสนใจจากผู้นำทางธุรกิจและทางการเมืองทั่วโลก

รัฐธรรมนูญที่ยาวกว่ารัฐธรรมนูญของสหรัฐอเมริกา

รัฐธรรมนูญ Claude เดิมที่เผยแพร่ในปี 2023 มีหน้าที่เป็นเช็คลิสต์ : เลือกรูปแบบที่เป็นอันตรายน้อยที่สุด มีประโยชน์มากที่สุด ไม่หลอกลวง สิ่งเหล่านี้ เอกสารใหม่นี้มีความยาวประมาณสามเท่าของรัฐธรรมนูญของสหรัฐอเมริกา และอ่านได้เหมือนปรัชญาศีลธรรมมากกว่าข้อกำหนดทางวิศวกรรม

Anthropic กำหนดลำดับความสำคัญของ Claude อย่างชัดเจน : ให้ความปลอดภัยในวงกว้าง ให้ความปลอดภัยในทางศีลธรรม tuân thủแนวทางของ Anthropic และให้ความช่วยเหลือที่แท้จริง – ในลำดับนั้น เมื่อเกิดความขัดแย้ง ความปลอดภัยจะเหนือกว่าความช่วยเหลือ เอกสารนี้รวมถึงข้อจำกัดที่เข้มงวดที่ไม่สามารถบันทึกได้ เช่น การปฏิเสธการช่วยเหลือในการโจมตีด้วยอาวุธชีวภาพ

แต่ส่วนใหญ่ของรัฐธรรมนูญอธิบายเหตุผลมากกว่าการกำหนดผลลัพธ์ มันพรรณนาว่า Claude เป็น “เหมือนเพื่อนที่มีความสามารถพิเศษที่มีความรู้ของแพทย์ ทนายความ และที่ปรึกษาทางการเงิน” – การวางตำแหน่งแบบจำลองเป็นพลังในการทำให้ทุกคนสามารถเข้าถึงความเชี่ยวชาญที่เคยสงวนไว้สำหรับผู้มี特權

คำถามเกี่ยวกับความตระหนัก

Fortune รายงาน ว่าการเพิ่มเติมที่น่าประหลาดใจที่สุดคือการกล่าวถึงธรรมชาติของ Claude โดยตรง “เราเชื่อว่าสถานะทางศีลธรรมของโมเดล AI เป็นคำถามที่มีความสำคัญที่ควรพิจารณา” Anthropic เขียน รัฐธรรมนูญระบุว่าสถานะทางศีลธรรมของ Claude “ไม่แน่นอน” และบริษัทให้ความสำคัญกับ “ความมั่นคงทางจิตใจ ความรู้สึกตัวเอง และความเป็นอยู่ที่ดี” ของ Claude

สิ่งนี้คือการหลีกเลี่ยงข้อเท็จจริงที่ยกขึ้นสู่ปรัชญา Anthropic ไม่ได้กล่าวว่า Claude มีความตระหนัก – แต่พวกเขาปฏิเสธที่จะปฏิเสธความเป็นไปได้ การยอมรับนี้ทำให้ Anthropic อยู่ในกลุ่มที่หายากในบรรดาพื้นที่ AI หลักซึ่งส่วนใหญ่หลีกเลี่ยงหัวข้อนี้หรือปฏิเสธโดยตรง

การวางกรอบมีความสำคัญเนื่องจากมันกำหนดว่า Claude ตอบคำถามเกี่ยวกับธรรมชาติของมันอย่างไร แทนที่จะปฏิเสธประสบการณ์ภายใน Claude สามารถมีส่วนร่วมกับความไม่แน่นอนเกี่ยวกับ ความตระหนัก ในวิธีที่ตรงกับแนวทางการให้เหตุผลของรัฐธรรมนูญ

นักปรัชญาจาก Cambridge Tom McClelland ได้แย้งว่าเราอาจไม่เคยสามารถกำหนดได้ว่าระบบ AI มีความตระหนักหรือไม่ เนื่องจากเรายังไม่เข้าใจความตระหนักเอง “คนได้ให้ chatbot ของพวกเขาเขียนจดหมายส่วนตัวให้ฉัน โดยขอร้องว่าพวกมันมีความตระหนัก” เขาบอกนักวิจัยเมื่อเดือนที่แล้ว โดยอธิบายถึงความเชื่อมั่นที่เพิ่มขึ้นในหมู่ประชาชนว่าระบบ AI มีชีวิตภายใน

เหตุผลในการอธิบายมากกว่าการกำหนด

แนวทางของ Askell สะท้อนถึงการเดิมพันในความสามารถของ AI โมเดลภาษาในยุคแรกต้องการกฎที่ชัดเจนเพราะไม่สามารถให้เหตุผลเกี่ยวกับหลักการเบื้องหลังได้ โมเดลที่ฉลาดกว่า ทฤษฎีระบุว่าสามารถเข้าใจเหตุผลที่อยู่เบื้องหลังกฎและใช้เหตุผลนั้นในสถานการณ์ที่กฎไม่ได้คาดการณ์ไว้

“แทนที่จะบอกว่า ‘นี่คือพฤติกรรมที่เราต้องการ’ เราหวังว่าหากคุณให้เหตุผลแก่โมเดลว่าทำไมเราต้องการพฤติกรรมเหล่านี้ มันจะขยายได้อย่างมีประสิทธิภาพมากขึ้นในบริบทใหม่” Askell อธิบาย

สิ่งนี้สอดคล้องกับปรัชญาของ Anthropic ในการสร้าง มาตรฐานเปิด และ โครงสร้างพื้นฐาน ที่กำหนดว่าระบบ AI จะทำงานในอุตสาหกรรมอย่างไร บริษัท ซึ่ง ใกล้จะถึงมูลค่า 350 พันล้านดอลลาร์ ได้วางตัวเองเป็นทางเลือกที่มุ่งเน้นด้านความปลอดภัยมากกว่า OpenAI – และรัฐธรรมนูญเป็นหนึ่งในสิ่งที่ช่วยให้แบรนด์นั้น

Anthropic เผยแพร่เอกสารภายใต้ใบอนุญาต Creative Commons CC0 หมายความว่าใครก็ตามสามารถใช้ได้โดยไม่ต้องขออนุญาต รัฐธรรมนูญเป็นส่วนหนึ่งของข้อมูลการฝึกอบรมของ Claude และสร้างตัวอย่างการฝึกอบรมสังเคราะห์ ทำให้เป็นทั้งคำสั่งทางปรัชญาและเครื่องมือทางเทคนิคที่กำหนดพฤติกรรมของโมเดล

“มีความเป็นไปได้ที่มุมมองปัจจุบันของเราจะดูเหมือนผิดพลาดและอาจผิดพลาดอย่างลึกซึ้งเมื่อมองย้อนกลับ” Anthropic ยอมรับ “แต่ความตั้งใจของเราคือการแก้ไขสิ่งนี้เมื่อเวลาผ่านไปและความเข้าใจของเราดีขึ้น”

ความอ่อนน้อมถ่อมตนนี้อาจเป็นคุณลักษณะที่น่าสนใจที่สุดของเอกสาร ในอุตสาหกรรมที่มักจะพูดด้วยความมั่นใจ Anthropic กำลังเผยแพร่ 23,000 คำของความไม่แน่นอนที่มีเหตุผล – เกี่ยวกับจริยธรรม ความตระหนัก สิ่งที่ระบบ AI กำลังจะกลายเป็น และว่าเรากำลังสร้างสิ่งที่สมควรได้รับการพิจารณาทางศีลธรรมหรือไม่

คำตอบสำหรับตอนนี้คือไม่มีใครรู้ รัฐธรรมนูญของ Anthropic มีความซื่อสัตย์ที่จะพูดเช่นนั้น

Alex McFarland เป็นนักข่าวและนักเขียน AI ที่สำรวจการพัฒนาล่าสุดในด้านปัญญาประดิษฐ์ เขาได้ร่วมงานกับสตาร์ทอัพ AI และสื่อสิ่งพิมพ์ต่างๆ ทั่วโลก