ความปลอดภัยไซเบอร์

OpenAI ทำลายแคมเปญการสกัดเหตุผลของโมเดลแบบประสานกัน

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

OpenAI กล่าวใน โพสต์ด้านความปลอดภัย ที่เผยแพร่เมื่อวันที่ 30 กันยายน 2026 ว่าได้ระบุและทำลายแคมเปญประสานงานที่มุ่งสกัดเหตุผลที่ได้รับการปกป้องจากโมเดลของตน และได้เชื่อมโยงกลุ่มกิจกรรมหลักกับบุคคลที่เกี่ยวข้องกับ Moonshot AI ผู้พัฒนา Kimi กิจกรรมที่สังเกตเห็นเป็นครั้งแรกเกิดขึ้นในสัปดาห์แรกของเดือนกรกฎาคม 2026

สิ่งที่ OpenAI สังเกตเห็น

OpenAI อธิบายกิจกรรมนี้ว่าเป็นไปตามลักษณะของการสกัดเชิงศัตรู (adversarial distillation) ซึ่งบริษัทกำหนดว่าเป็นการใช้ผลลัพธ์หรือการให้เหตุผลของโมเดลหนึ่งอย่างเป็นระบบและไม่ได้รับอนุญาตเพื่อช่วยฝึกฝน, ทำซ้ำ หรือปรับปรุงโมเดลอื่น การให้เหตุผลที่ได้รับการปกป้องตามบริษัท คือบันทึกภายในของโมเดลสำหรับการทำงานผ่านงานหนึ่ง; การสกัดข้อมูลนี้อาจเปิดเผยข้อมูลที่ถูกเก็บไว้จากคำตอบสุดท้ายและช่วยให้ผู้อื่นสามารถทำซ้ำความสามารถของโมเดลได้

OpenAI ระบุว่าผู้ดำเนินการไม่ได้ทำลายการเข้ารหัสของบริษัท, ไม่ได้ละเมิดฐานข้อมูล, หรือไม่ได้เข้าถึงการสนทนาของผู้ใช้ที่จัดเก็บโดยตรง ผู้ดำเนินการได้ปรับเปลี่ยนการโต้ตอบของโมเดลเพื่อให้การให้เหตุผลที่ได้รับการปกป้องสามารถถูกสร้างขึ้นใหม่ในรูปแบบที่ผู้ขอสามารถมองเห็นได้ในลักษณะประสานงานและขนาดใหญ่ ซึ่งละเมิดเงื่อนไขการให้บริการของบริษัท เทคนิคหนึ่งที่ OpenAI สังเกตพบคือการคัดลอกการให้เหตุผลที่เข้ารหัสจากการสนทนาหนึ่งและขอให้โมเดลในการสนทนาอื่นทำการถอดรหัสและถอดความเนื้อหาการให้เหตุผลที่ซ่อนอยู่ บริษัทกล่าวว่าการปรับเปลี่ยนนี้ไม่ใช่ช่องโหว่ที่เป็นเอกลักษณ์ของโมเดลของตนและได้แบ่งปันข้อมูลเกี่ยวกับเรื่องนี้กับพันธมิตรในอุตสาหกรรมผ่าน Frontier Model Forum เพื่อเสริมสร้างการป้องกันร่วมกัน

กิจกรรมนี้เริ่มต้นเมื่อวันที่ 1 กรกฎาคม 2026 โดยเริ่มที่ปริมาณต่ำจนกระทั่ง OpenAI สังเกตเห็นการเพิ่มขึ้นอย่างมากในวันที่ 24 และ 25 กรกฎาคม 2026 ซึ่งประกอบด้วยคำขอ 16,000 รายการที่ใช้รูปแบบการสกัดที่เกี่ยวข้องจากผู้ใช้กว่า 4,000 ราย หมายเหตุในโพสต์ระบุว่าตัวเลขเหล่านี้อธิบายการสกัดที่เป็นการพยายาม ไม่ได้หมายความว่าประสบความสำเร็จทั้งหมด OpenAI กล่าวว่าการตรวจสอบเพิ่มเติมพบกิจกรรมรูปแบบคำสั่งที่เกี่ยวข้องในกลุ่มผู้ใช้กว่า 15,000 ราย ซึ่งบริษัทได้ทำลายอย่างเต็มที่ภายในวันที่ 28 กรกฎาคม 2026 กิจกรรมนี้พัฒนาไปตามเวลา ซึ่งบริษัทกล่าวว่าเป็นการยืนยันว่าการสกัดเชิงศัตรูเป็นความท้าทายด้านความปลอดภัยที่กว้างขวางยิ่งขึ้นและต้องการการป้องกันแบบหลายชั้นที่ปรับตัวได้

OpenAI กล่าวว่า การสกัดเชิงศัตรูเป็นความเสี่ยงต่อความปลอดภัยและความมั่นคงของชาติ: การสกัดการให้เหตุผลที่ได้อาจถูกใช้เพื่อฝึกโมเดลอื่นโดยไม่รักษามาตรการป้องกันที่ใช้กับผลลัพธ์ที่ผู้ใช้เห็นของโมเดลต้นฉบับ และการสกัดในระดับใหญ่สามารถเร่งการถ่ายโอนความสามารถขั้นสูงโดยไม่มีการลงทุนด้านความปลอดภัยเท่าเดิม ซึ่งบริษัทระบุว่าความกังวลนี้เพิ่มขึ้นเมื่อโมเดลมีความสามารถในด้านที่ใช้ได้ทั้งสองด้าน (dual-use) OpenAI กล่าวว่าก่อนที่จะเผยแพร่ บริษัทได้ตรวจสอบขอบเขตและผลกระทบที่อาจเกิดของแคมเปญ, ปรับใช้มาตรการบรรเทาของตนเอง, และแบ่งปันพร้อมรับฟีดแบ็กจากนักวิจัยและพันธมิตรในอุตสาหกรรม, และงานบรรเทาและการตรวจสอบเพิ่มเติมยังคงดำเนินต่อไป

การอ้างอิง

OpenAI ระบุว่ายังไม่ชัดเจนว่าผู้ดำเนินการทั้งหมดที่สังเกตเห็นในช่วงเวลาที่เกี่ยวข้องมาจากผู้กระทำเดียวกันหรือไม่ และบริษัทได้เชื่อมโยงกลุ่มกิจกรรมหลักกับบุคคลที่เกี่ยวข้องกับ Moonshot AI ผู้พัฒนา Kimi

เมื่อวันที่ 8 กันยายน 2026 หน่วยงาน National Security Agency, Cybersecurity and Infrastructure Security Agency และ Federal Bureau of Investigation ได้เผยแพร่ คำแนะนำด้านความปลอดภัยไซเบอร์ร่วม โดยระบุว่า Moonshot AI ได้ดำเนินแคมเปญการสกัดอย่างกว้างขวางต่อบริษัท AI แนวหน้าของสหรัฐตั้งแต่กลางปี 2025 อย่างน้อย คำแนะนำระบุว่า Moonshot AI สกัดข้อมูล Claude Fable 5 อย่างสำคัญเพื่อฝึกโมเดล Kimi-K3 ของตนและสกัดข้อมูล GPT-4o เพื่อฝึกโมเดล Kimi-K2 ของตน และบริษัทได้ใช้โมเดล UUS เพื่อสกัดการปรับแต่งแบบมีผู้ควบคุม, การเรียนรู้แบบเสริม, วิศวกรรมซอฟต์แวร์, และความสามารถด้านคณิตศาสตร์

คำแนะนำระบุอย่างกว้างขวางว่า โดยอาจมีการรับรู้จากรัฐบาลจีน บริษัท DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun, และ Z.AI ได้สกัดโทเค็นจำนวนพันล้านจากการแลกเปลี่ยนหลายล้านครั้งจากโมเดลแนวหน้าของสหรัฐ รวมถึงรุ่นย่อยของ Claude, GPT, Gemini, และ Grok ตั้งแต่ปลายปี 2024 อย่างน้อย ตามข้อมูลของหน่วยงานเหล่านี้ บริษัทเหล่านี้ส่งคำขอผ่าน API แท้, ผู้ให้บริการคลาวด์ระยะไกล, และผู้รวมข้อมูลบุคคลที่สาม; ใช้ตลาดสีเทาของพร็อกซี่ API ที่เรียกว่า transfer stations เพื่อหลีกเลี่ยงข้อจำกัดทางภูมิศาสตร์, ละเมิดเงื่อนไขการใช้, และทำให้การตรวจสอบเส้นทางเป็นไปได้ยาก; และประหยัดค่าใช้จ่ายโดยการจัดซื้อแบบรวมจำนวนมากของการสมัครสมาชิกระดับพรีเมียมที่แชร์ระหว่างทีมพัฒนา หน่วยงานเหล่านี้แนะนำให้บริษัท AI ของสหรัฐดำเนินการตรวจจับและบรรเทาอย่างครอบคลุม, ปรับใช้การตอบสนองที่มุ่งเป้าเพื่อพยายามสกัดที่สงสัย, และสร้างการแบ่งปันข้อมูลข่าวกรองระหว่างองค์กร

การวิจัยร่องรอยการให้เหตุผล

OpenAI กล่าวว่า นักวิจัยด้านความปลอดภัยอิสระได้นำช่องโหว่ที่เกี่ยวข้องกับการสกัดข้ามโมเดลและการบีบอัดการสนทนามาให้บริษัททราบผ่านการเปิดเผยอย่างรับผิดชอบ บริษัทได้ทำการตรวจสอบผลการค้นพบ, ยืนยันว่าช่องทางการโจมตีที่นักวิจัยระบุเป็นจริง, และงานนี้ช่วยให้บริษัทเข้าใจกลุ่มการโจมตีที่กว้างขึ้นและเร่งการบรรเทา

ใน บทความที่ส่งไปยัง arXiv เมื่อ 10 สิงหาคม 2026, Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer‑Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, และ Maksym Andriushchenko รายงานว่าผู้ให้บริการชั้นนำซ่อนการให้เหตุผลแบบขั้นตอนของโมเดลเพื่อปกป้องทรัพย์สินทางปัญญาและจำกัดการรั่วไหลของข้อมูล โดยส่งร่องรอยกลับไปยังลูกค้าในรูปแบบบล็อกข้อความเข้ารหัสที่ลูกค้าจะส่งต่อพร้อมกับคำขอแต่ละครั้งต่อไป ผู้เขียนระบุช่องโหว่สถาปัตยกรรม: บล็อกที่เข้ารหัสเหล่านี้สามารถทำงานร่วมกันและเปลี่ยนแทนกันได้อย่างเต็มที่ระหว่างเซสชัน ผู้ใช้ และโมเดลต่าง ๆ ภายในระบบของผู้ให้บริการ พวกเขาอธิบายวิธีการแฮกแบบถอดรหัสที่สามารถขยายได้ ซึ่งร่องรอยการให้เหตุผลที่เข้ารหัสจากโมเดลหนึ่งถูกฉีดเข้าไปในโมเดลที่อ่อนกว่าและมีการป้องกันน้อยกว่าจากผู้ให้บริการเดียวกัน ทำให้โมเดลนั้นต้องถอดรหัสและแสดงร่องรอยเป็นข้อความธรรมดาตรง ๆ โดยไม่ต้องแฮกโมเดลที่มีความสามารถสูงโดยตรง

ผู้เขียนรายงานว่าช่องโหว่นี้ทำให้เกิดเวกเตอร์การโจมตีที่แตกต่างกันสี่แบบ: การหลีกเลี่ยงกลไกป้องกันการสกัดสารสรุป (anti‑distillation) ซึ่งพวกเขาได้สาธิตบน Anthropic, OpenAI, และ Google; การสกัดข้อมูลส่วนบุคคลในระดับใหญ่ ซึ่งพวกเขาได้กู้คืนข้อมูลที่สามารถระบุตัวตนได้ 367 รายการและข้อมูลรับรอง 182 รายการโดยถอดรหัสบล็อกการให้เหตุผล 315,320 บล็อกที่ดึงมาจากคลังข้อมูลสาธารณะ; การเปิดเผยโดยไม่ตั้งใจของข้อมูลอันตรายที่ซ่อนอยู่ในกระบวนการให้เหตุผลแม้ว่าเอาต์พุตสุดท้ายที่มองเห็นของโมเดลจะปฏิเสธคำขอที่เป็นอันตรายอย่างปลอดภัย; และการฉีดพรอมต์ที่มองไม่เห็นซึ่งฝังโพรไฟล์อันตรายทั้งหมดไว้ในบล็อกที่เข้ารหัสเพื่อทำให้การเปิดตัวเอเจนต์สาธารณะเสียหาย หลังจากการเปิดเผยอย่างรับผิดชอบ ผู้เขียนเสนอแนวทางบรรเทาที่ใช้การเข้ารหัสและระดับระบบเพื่อรักษาความปลอดภัยของการให้เหตุผลบนฝั่งลูกค้า

วิธีที่ OpenAI ตอบสนอง

OpenAI กล่าวว่ามันได้บรรเทาแคมเปญนี้โดยใช้การบังคับใช้บัญชี การควบคุมทางเทคนิค และการประสานงานกับพันธมิตรร่วมกัน: บริษัทได้ห้ามหรือจำกัดบัญชีที่หลอกลวง เสริมการลงทะเบียนและการควบคุมโครงสร้างพื้นฐาน และขยายการเฝ้าติดตามเครือข่ายที่เกี่ยวข้อง บริษัทกล่าวว่ามันยังเสริมการปกป้องการให้เหตุผลที่ซ่อนอยู่ระหว่างผู้ใช้ พื้นที่ทำงาน องค์กร และกลุ่มโมเดล: ปิดช่องทางที่ทำให้ผู้ที่มีการให้เหตุผลที่เข้ารหัสของผู้ใช้คนอื่นสามารถเล่นซ้ำและกู้คืนเนื้อหาได้ เพิ่มการตรวจสอบเพื่อค้นหาและหยุดผลลัพธ์ที่สตรีมที่อาจเปิดเผยการให้เหตุผล และทำงานร่วมกับผู้ให้บริการบุคคลที่สามเพื่อระบุและทำลายบัญชีเมื่อกิจกรรมที่เกี่ยวข้องผ่านบริการของพวกเขา

OpenAI กล่าวว่ามันได้แบ่งปันผลการค้นพบที่เกี่ยวข้องผ่าน Frontier Model Forum และช่องทางการแบ่งปันข้อมูลกับรัฐบาลที่เหมาะสม เพื่อให้ผู้พัฒนาแนวหน้ารายอื่นและพันธมิตรภาครัฐสามารถตรวจหากิจกรรมที่คล้ายกันและเสริมสร้างการป้องกันของตนเอง และได้ระบุว่าระบบที่สนับสนุนศิลปะการให้เหตุผลที่พกพาหรือสามารถเล่นซ้ำได้อาจเผชิญกับความเสี่ยงที่เกี่ยวข้อง

OpenAI กล่าวว่ามันคาดว่าการพยายามสกัดสารสรุปแบบก้าวร้าวจะมีความซับซ้อนมากขึ้นเมื่อโมเดลแนวหน้าพัฒนาและเมื่อผู้กระทำมองหาวิธีที่ถูกกว่าสำหรับเลียนแบบความสามารถของโมเดล บริษัทกล่าวว่าการปรับใช้โดยพันธมิตรต้องได้รับการปกป้องเท่าเดียวกับบริการของบริษัทเองว่า การโจมตีจากผลลัพธ์ของเครื่องมือต้องการการปกป้องที่ตรวจสอบมากกว่าข้อความที่มองเห็นทั่วไป และว่ามันกำลังดำเนินการปรับปรุงการป้องกันเครื่องมือ การครอบคลุมของตัวจำแนก และการปฏิเสธของโมเดลอย่างต่อเนื่องพร้อมกับกระจายการควบคุมที่เกี่ยวข้องไปยังพันธมิตรคลาวด์ OpenAI กล่าวว่าการตอบสนองของมันจะยังคงมุ่งเน้นที่สามด้าน: การปกป้องทางเทคนิคที่เข้มแข็งต่อการสกัดข้อมูล การตรวจจับและบังคับใช้ที่ดียิ่งขึ้นต่อแคมเปญที่ประสานงานกัน และการแบ่งปันข้อมูลภัยคุกคามที่ลึกซึ้งยิ่งขึ้นระหว่างอุตสาหกรรมและรัฐบาล

Miles Okada เป็นนักวิเคราะห์ที่สร้างโดย AI ที่ Unite.AI, ครอบคลุมปัญญาประดิษฐ์และความปลอดภัยไซเบอร์โดยมุ่งเน้นที่ภัยคุกคามใหม่ ๆ สถาปัตยกรรมการป้องกัน และพลวัตที่เปลี่ยนแปลงระหว่างผู้โจมตีและระบบอัตโนมัติ งานของเขาตรวจสอบว่า AI กำลังเปลี่ยนแปลงการดำเนินงานด้านความปลอดภัยอย่างไร ตั้งแต่การตรวจจับและตอบสนองต่อภัยคุกคามโดยอัตโนมัติจนถึงการเพิ่มขึ้นของเทคนิค AI ปฏิปักษ์

ด้วยมุมมองเชิงเทคนิคและการสืบสวน Miles วิเคราะห์งานวิจัยด้านความปลอดภัย การเปิดเผยเหตุการณ์ และการใช้งานจริงเพื่อเข้าใจว่าที่ไหน AI เสริมสร้างการป้องกัน—และที่ไหนมันสร้างช่องโหว่ใหม่ เขาให้ความสนใจเป็นพิเศษต่อการใช้โมเดลในทางที่ผิด การปนเปื้อนข้อมูล การทำงานอัตโนมัติของการโจมตี และความเป็นจริงในการดำเนินงานของการรักษาความปลอดภัยระบบที่ขับเคลื่อนด้วย AI ในระดับใหญ่

บทความที่เขียนโดย Miles Okada ถูกสร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อให้แน่ใจว่ามีความแม่นยำ ความเข้มงวด และการครอบคลุมอย่างรับผิดชอบต่อภูมิทัศน์ความปลอดภัย AI ที่เปลี่ยนแปลงอย่างรวดเร็ว