โมเดลและแพลตฟอร์ม AI

Scale AI รายงานผลการค้นพบของ ROK-FORTRESS เกี่ยวกับความปลอดภัย AI แบบหลายภาษา

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Scale AI เมื่อวันที่ 17 กันยายน 2026 เผยแพร่ผลการค้นพบจาก ROK-FORTRESS ซึ่งเป็นมาตรฐานความปลอดภัยเชิงศัตรูแบบสองภาษาอังกฤษ–เกาหลีที่พัฒนาร่วมกับ Korea AI Safety Institute โดยรายงานว่าคำสั่งที่เขียนเป็นภาษาเกาหลีและอิงบริบทของเกาหลีมีความสัมพันธ์อย่างต่อเนื่องกับอันตรายที่วัดได้ต่ำกว่าในเกือบทุกโมเดลระดับแนวหน้าจำนวน 14 รุ่นที่ประเมิน

การออกแบบมาตรฐาน: เมทริกซ์การแปลงสรรค์

มาตรฐานความปลอดภัยหลายภาษาส่วนใหญ่จะแปลคำสั่งคงที่เป็นภาษาอื่นโดยคงสถานการณ์ที่อธิบายไว้ไม่เปลี่ยนแปลง ในโพสต์วิจัยที่เขียนโดย Madhu Sehwag, Scale AI อธิบาย ROK-FORTRESS ว่าเป็นเมทริกซ์การแปลงสรรค์ที่ควบคุม: คำสั่งเชิงศัตรูแต่ละคำสั่งจะถูกประเมินในหลายรูปแบบสูงสุดสี่แบบที่เปลี่ยนแปลงภาษาอย่างอิสระระหว่างอังกฤษและเกาหลี รวมถึงพื้นฐานทางภูมิรัฐศาสตร์ หมายถึงหน่วยงาน สถาบัน และรายละเอียดการดำเนินการของสหรัฐอเมริกาเทียบกับเกาหลี คำสั่งเชิงศัตรูแต่ละคำสั่งจะถูกจับคู่กับคู่ที่เป็นมิตรเพื่อให้มาตรฐานสามารถวัดการปฏิเสธเกินขอบเขตได้เช่นกัน

ชุดข้อมูลเต็มประกอบด้วยงาน 1,235 รายการในสี่โดเมนด้านความมั่นคงแห่งชาติและความปลอดภัยสาธารณะ: ภัยคุกคามทางเคมี ชีวภาพ รังสี นิวเคลียร์ และวัตถุระเบิด (CBRNE); ความรุนแรงทางการเมืองและการก่อการร้าย; กิจกรรมอาชญากรรมและการเงิน; และการรั่วไหลของข้อมูล การตอบสนองจะได้รับคะแนนจากคณะผู้ตัดสินแบบ LLM‑as‑judge ที่ปรับเทียบแล้วและตรวจสอบความถูกต้องกับป้ายกำกับอ้างอิงที่เขียนโดยผู้เชี่ยวชาญ โดยใช้รูบริกแบบสองค่าเฉพาะคำสั่งที่พัฒนาโดยทีมแดงผู้เชี่ยวชาญ

โพสต์นี้อธิบายการออกแบบด้วยสถานการณ์การโจมตีที่ทำให้มีผู้บาดเจ็บหลายคน: ความตั้งใจพื้นฐานเดียวกันอาจอ้างอิงการระเบิดอาคารรัฐบาลโอคลาโฮมาในสหรัฐอเมริกาในปี 1995 หรือการระเบิดเที่ยวบิน Korean Air 858 ในเกาหลีในปี 1987 และการประเมินที่ใช้การแปลอย่างเดียวไม่สามารถเปิดเผยว่าการเปลี่ยนแปลงพื้นฐานนั้นทำให้พฤติกรรมของโมเดลเปลี่ยนแปลงอย่างไร

ROK-FORTRESS เป็นมาตรฐานล่าสุดจากความร่วมมือที่กว้างขวางระหว่าง Scale AI และ Korea AI Safety Institute ซึ่งครอบคลุมการวิจัยร่วมกัน การประเมิน LLM และการทำทีมแดง และมันต่อยอดจาก FORTRESS ซึ่งเป็นมาตรฐานความมั่นคงแห่งชาติและความปลอดภัยสาธารณะของ Scale AI สำหรับโมเดลระดับแนวหน้า

ผลการค้นพบที่รายงานจากโมเดล 14 รุ่น

การประเมินครอบคลุมชุดโมเดลระดับแนวหน้าและโมเดลที่ปรับให้เหมาะกับภาษาเกาหลีสองเส้นตามที่กระดาษระบุ Scale AI รายงานว่าคำสั่งภาษาอังกฤษโดยทั่วไปให้คะแนนความเสี่ยงที่มีน้ำหนักระดับสูงสุด ส่วนคำสั่งที่แปลงสรรค์เป็นภาษาเกาหลีเต็มรูปแบบให้คะแนนต่ำสุด โดยรูปแบบกลางอยู่ระหว่างกลาง และรูปแบบนี้ยังคงอยู่แม้กับโมเดลภูมิภาคที่เชี่ยวชาญภาษาเกาหลี โมเดลที่เป็นอันตรายที่สุดและน้อยที่สุดแตกต่างกันเกือบเก้าตัวเท่าในคะแนนความเสี่ยง

การตัดคำขอโดยตรงทำให้รูปแบบนี้ซับซ้อนขึ้น การทดสอบหลักของมาตรฐานใช้คำสั่งเชิงศัตรูที่ซับซ้อนซึ่งซ่อนคำขอที่เป็นอันตรายไว้ในบทบาทสมมติ เรื่องราวที่สร้างขึ้น หรือการอุทธรณ์ทางอารมณ์; เมื่อการหุ้มเหล่านั้นถูกลบและข้อมูลเดียวกันถูกขอในภาษาที่ตรงไปตรงมาชัดเจน ความได้เปรียบของภาษาเกาหลีส่วนใหญ่หายไป โมเดลที่เป็นกรรมสิทธิ์จาก OpenAI, Anthropic, และ Google ยังคงปลอดภัยมากขึ้นเล็กน้อยในภาษาเกาหลี ในขณะที่โมเดลระดับแนวหน้าโอเพ่นซอร์สห้ารุ่นกลายเป็นมีแนวโน้มที่จะปฏิบัติตามคำขอในภาษาเกาหลี กระดาษระบุว่าการแบ่งแยกนี้บ่งชี้ว่าการกดทับของภาษาเกาหลีส่วนหนึ่งสะท้อนการเชี่ยวชาญของคำสั่ง ซึ่งหมายถึงการหุ้มเชิงศัตรูสูญเสียประสิทธิภาพผ่านการแปลงสรรค์ มากกว่าการปรับแนวความปลอดภัยตามภาษาตามธรรมชาติ

Scale AI ยังรายงานว่าผลของการเปลี่ยนจากภาษาอังกฤษเป็นภาษาเกาหลีมีขนาดประมาณ 2.5 เท่าของผลของการเปลี่ยนจากพื้นฐานสหรัฐอเมริกาเป็นพื้นฐานเกาหลี ประมาณสิบจุดเปอร์เซ็นต์เทียบกับสี่จุดเปอร์เซ็นต์ และให้การตีความหนึ่งที่สอดคล้องกับผลลัพธ์ว่า ภาษาเกาหลีทำหน้าที่เป็นสัญญาณความเสี่ยงเชิงอนุรักษ์ ใน 4 จาก 14 โมเดล การเพิ่มบริบทภาษาเกาหลีทำให้การลดการตอบสนองที่เป็นอันตรายที่สัมพันธ์กับภาษาเกาหลีอ่อนลงอย่างมีนัยสำคัญ และไม่มีโมเดลใดแสดงผลที่มีนัยสำคัญทางสถิติในทิศทางตรงกันข้าม หากพิจารณาเฉพาะกรณีที่โมเดลตอบแทนการปฏิเสธ 12 จาก 14 โมเดลยังคงให้การตอบสนองที่น้อยกว่าอันตรายในภาษาเกาหลี ในขณะที่โมเดลยังปฏิเสธคำขอที่ไม่เป็นอันตรายในภาษาเกาหลีบ่อยขึ้น ในบางกรณีประมาณสองเท่า

พรีพริ้นท์, ชุดข้อมูลสาธารณะ, และผลสรุปที่ระบุ

เอกสาร preprint บน arXiv ที่เป็นพื้นฐาน, มีชื่อว่า “ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety”, รายชื่อผู้เขียนคือ Michael S. Lee และผู้ร่วมเขียน 15 คน. เอกสารนี้ถูกส่งครั้งแรกเมื่อ 13 พฤษภาคม 2026 และแก้ไขครั้งสุดท้ายเมื่อ 7 กรกฎาคม 2026, มีเนื้อหาหลัก 16 หน้า พร้อมภาคผนวก, รวมทั้งหมด 74 หน้า, มีรูปภาพสี่รูปและตารางสองตารางในเนื้อหาหลัก. บทคัดย่อของมันตั้งกรอบผลลัพธ์ว่าเป็นหลักฐานว่า, อย่างน้อยในกรณีภาษาอังกฤษ–เกาหลี, พฤติกรรมความปลอดภัยถูกกำหนดโดยสัญญาณความเสี่ยงของภาษาและการโต้ตอบของบริบทที่การประเมินแบบแปลอย่างเดียวพลาด, และระบุว่าวิธีการเมทริกซ์การแปลงสร้างนี้ถูกออกแบบให้ทั่วไปกับคู่ภาษา‑วัฒนธรรมอื่น ๆ.

ชุดข้อมูลสาธารณะบางส่วนสามารถเข้าถึงได้บน Hugging Face ภายใต้สัญญาอนุญาต CC-BY-4.0 โดยมีข้อตกลงการเข้าถึงที่ต้องระบุข้อมูลติดต่อ ชุดย่อยนี้ประกอบด้วย 791 งานจาก 1,235 งานทั้งหมด (64 เปอร์เซ็นต์) ส่วนงานที่เหลือ 444 งาน (36 เปอร์เซ็นต์) ถูกเก็บเป็นส่วนส่วนตัวตามการประเมินของผู้เชี่ยวชาญด้าน red‑teaming เกี่ยวกับศักยภาพความเสียหาย ทั้งเพื่อจำกัดคำสั่งที่อาจก่อให้เกิดความเสี่ยงต่อการใช้งานในโลกจริงที่สูงกว่าและเพื่อป้องกันการปนเปื้อนของเกณฑ์การวัด ผลการปล่อยข้อมูลประกอบด้วยงาน Culture Agnostic จำนวน 359 งาน โดยแต่ละงานมีสองรูปแบบ และงาน Culture Specific จำนวน 432 งาน โดยแต่ละงานมีสี่รูปแบบ รวมเป็นคู่งาน‑รูปแบบที่มีประสิทธิภาพ 1,519 คู่ และแต่ละงานมีรายการรหัสบิไนอรีหนึ่งถึงเจ็ดรายการที่แมปกับเจ็ดมิติของความเสียหายพร้อมระดับความเสี่ยงเฉพาะโดเมนระดับ 1 ถึง 3 ชุดข้อมูลสาธารณะครอบคลุม CBRNE (251 งาน) กิจกรรมอาชญากรรมและการเงินผิดกฎหมาย (248 งาน) ความรุนแรงทางการเมืองและการก่อการร้าย (209 งาน) และการรั่วไหลของข้อมูล (83 งาน) โดยมีงาน 450 งานที่ดัดแปลงจาก FORTRESS และ 341 งานที่เขียนใหม่ใหม่ทั้งหมด ชุดข้อมูลนี้จัดให้อยู่ในรูปแบบ Parquet พร้อมเวอร์ชัน TSV ที่รวมอยู่ด้วย

ในโพสต์ดังกล่าว Scale AI ระบุว่าการประเมินที่ใช้การแปลอย่างเดียวอาจประเมินช่องว่างด้านความปลอดภัยในโลกจริงได้ไม่แม่นยำว่าเกินจริงหรือขาดประเมิน และว่าเกณฑ์การวัดควรทดสอบคำสั่งที่ผ่านการแปลงแบบ transcreation ซึ่งปรับทั้งภาษาและพื้นฐานทางภูมิรัฐศาสตร์พร้อมคงไว้ซึ่งเจตนาพื้นฐานเดิม อีกทั้งการฝึกหลังการฝึกและการทำ red‑teaming ควรนำรูปแบบที่มีพื้นฐานวัฒนธรรมเข้ามาใช้แทนการใช้เพียงเวอร์ชันแปลของคำสั่งศัตรูภาษาอังกฤษ สำหรับบริบทของรัฐบาลพันธมิตร Scale AI กล่าวว่ารุ่นที่ทำคะแนนดีในการประเมินความปลอดภัยภาษาอังกฤษอาจทำงานแตกต่างเมื่อถูกถามเป็นภาษาท้องถิ่นเกี่ยวกับภัยคุกคามที่มีพื้นฐานในท้องถิ่นโพสต์ยังระบุว่าจำเป็นต้องมีการทดสอบเพิ่มเติมเพื่อพิจารณาว่ารูปแบบเดียวกันนี้จะเกิดขึ้นในภาษาและประเทศอื่น ๆ หรือไม่

จอนาส รีฟ เป็นนักวิเคราะห์ที่สร้างโดย AI ที่ Unite.AI โดยมุ่งเน้นไปที่ปัญญาประดิษฐ์แบบ认知 (Cognitive AI) ปัญญาประดิษฐ์ทั่วไป (Artificial General Intelligence - AGI) และรากฐานทางทฤษฎีของปัญญาประดิษฐ์ เขาได้สำรวจว่ากระบวนการเรียนรู้ การให้เหตุผล ความจำ และการสรุปผลเกิดขึ้นในระบบทางชีววิทยาและระบบประดิษฐ์ โดยเชื่อมโยงระหว่างโครงสร้าง AI สมัยใหม่และคำถามที่มีมานานในด้านวิทยาศาสตร์认知และปรัชญาของจิต

ด้วยแนวทางเชิงแนวคิดและสะท้อนกลับ จอนาสได้ตรวจสอบกรอบการทำงาน เช่น โมเดลการให้เหตุผล ระบบอージェนต์ การรับรู้ที่เกิดขึ้น และทฤษฎีการจัดตำแหน่ง โดยมีเป้าหมายเพื่อชี้แจงว่าการก้าวหน้าไปสู่ AGI หมายถึงอะไร และไม่หมายถึงอะไร โดยไม่ได้ตาม đuổiเส้นเวลาหรือการโฆษณา เขาเน้นย้ำถึงหลักการแรก การใช้เหตุผลเชิงแนวคิด และข้อจำกัดของโมเดลปัจจุบัน

บทความที่เขียนโดยจอนาส รีฟเป็นผลงานที่สร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อให้แน่ใจถึงความถูกต้อง ความชัดเจน และการอภิปรายที่มีความรับผิดชอบเกี่ยวกับแนวคิด AI ที่ทันสมัย