พื้นฐาน AI
AIOps คืออะไร? ปัญญาประดิษฐ์สำหรับการดำเนินงานไอที
AIOps ใช้การเรียนรู้ของเครื่องและระบบอัตโนมัติกับข้อมูลการดำเนินงานไอทีเพื่อให้ทีมสามารถตรวจจับพฤติกรรมที่ไม่ปกติ ลดการแจ้งเตือนซ้ำ เชื่อมโยงเหตุการณ์ที่เกี่ยวข้อง จัดอันดับสาเหตุที่เป็นไปได้และแนะนำหรือดำเนินการตอบสนอง
AIOps ไม่ได้เป็นการทดแทนการดำเนินงานโดยอัตโนมัติ มันเป็นชั้นหนึ่งภายในระบบ ITOps และคุณค่าของมันขึ้นอยู่กับคุณภาพของข้อมูลวัดผล, โครงสร้างบริการ, ประวัติการเปลี่ยนแปลง, ข้อเสนอแนะจากมนุษย์และขอบเขตการทำงานอัตโนมัติที่ปลอดภัย
ประเด็นสำคัญ
- ทำให้เหตุการณ์เป็นมาตรฐานและเพิ่มบริบทของบริการก่อนนำโมเดลขั้นสูงไปใช้
- การตรวจจับความผิดปกติระบุการเบี่ยงเบน ไม่ได้หมายถึงความล้มเหลวหรือสาเหตุรากฐานเสมอ
- การเชื่อมโยงและการจัดอันดับสาเหตุที่เป็นไปได้ควรเปิดเผยหลักฐานและความไม่แน่นอน
- การแก้ไขอัตโนมัติต้องใช้สิทธิ์ขั้นต่ำ การอนุมัติ การทดสอบแบบคานารี การย้อนกลับและการตรวจสอบผลลัพธ์

สร้างชั้นข้อมูลการดำเนินงาน
แพลตฟอร์ม AIOps จะรับข้อมูลเมตริก, บันทึก, การติดตาม, การแจ้งเตือน, ตั๋ว, โครงสร้าง, การปรับใช้และการเปลี่ยนแปลงการกำหนดค่า เวลา, ตัวระบุและความเป็นเจ้าของบริการต้องได้รับการประสานให้ตรงกันเพื่อให้ระบบสามารถเชื่อมสัญญาณที่อ้างอิงถึงเหตุการณ์เดียวกันได้
การขาดหรือบริบทที่ไม่สอดคล้องกันทำให้เกิดการเชื่อมโยงที่ผิดพลาด การเก็บรักษาข้อมูล การเข้าถึงและความเป็นส่วนตัวก็สำคัญเช่นกัน เนื่องจากบันทึกอาจมีข้อมูลรับรองหรือข้อมูลส่วนบุคคล ใช้การกำกับดูแลเดียวกับระบบข้อมูลการผลิตอื่น ๆ
การตรวจจับและการลดสัญญาณรบกวน
ค่าเกณฑ์คงที่ทำงานได้กับขีดจำกัดที่รู้จัก; วิธีสถิติและ การเรียนรู้ของเครื่อง สามารถสร้างโมเดลความเป็นฤดูกาลหรือรูปแบบหลายตัวแปร การลบซ้ำจะจัดกลุ่มการแจ้งเตือนที่ซ้ำกัน ในขณะที่การกดทับจะลบการแจ้งเตือนที่ไม่สามารถดำเนินการได้ตามกฎที่กำหนด
ความผิดปกติเป็นเพียงการเบี่ยงเบนจากพฤติกรรมที่คาดหวัง การปล่อยเวอร์ชันที่วางแผนไว้, แคมเปญการจราจรและรอบธุรกิจอาจดูแปลกแต่เป็นเรื่องปกติที่ดี ควรประเมินความแม่นยำ, การเรียกคืน, ความล่าช้าการตรวจจับและภาระงานของผู้ปฏิบัติการ แทนการเฉลิมฉลองจำนวนการแจ้งเตือนที่ถูกลบ
การเชื่อมโยงและสาเหตุที่เป็นไปได้
การเชื่อมโยงเหตุการณ์เชื่อมอาการต่าง ๆ ผ่านกราฟการพึ่งพาและช่วงเวลา โมเดลสาเหตุที่เป็นไปได้สามารถจัดอันดับส่วนประกอบหรือการเปลี่ยนแปลงล่าสุดที่อาจอธิบายเหตุการณ์นี้ได้ ซึ่งช่วยให้การสืบสวนมีลำดับความสำคัญ แต่ไม่ได้กำหนดความเป็นสาเหตุ
แสดงหลักฐานที่สนับสนุน, สมมติฐานทางเลือกและระดับความมั่นใจ Explainable AI มีความสำคัญเป็นพิเศษเมื่อผู้ปฏิบัติการต้องตัดสินใจว่าจะเชื่อมต่อบริการหรือย้อนกลับการปรับใช้หรือไม่
จากการแนะนำสู่การอัตโนมัติ
Runbook สามารถรวบรวมการวินิจฉัย, รีสตาร์ท worker ที่ไม่มีสถานะ หรือขยายความจุ Copilot สามารถสรุปเหตุการณ์และดึงขั้นตอนการทำงานออกมาได้ ตัวแทนอาจวางแผนการเรียกใช้เครื่องมือ แต่สิทธิ์การผลิตควรจำกัดและการกระทำควรได้รับการตรวจสอบกับสถานะปัจจุบัน
เริ่มต้นด้วยการแนะนำแบบอ่านอย่างเดียว ส่งเสริมการกระทำที่พร้อมใช้งานผ่านการจำลอง, การอนุมัติของมนุษย์, การทดสอบแบบคานารีและการย้อนกลับอัตโนมัติ บันทึกข้อมูลนำเข้า, เวอร์ชันของโมเดล, การอนุญาตและผลลัพธ์ของทุกการกระทำ
การประเมินและข้อเสนอแนะการดำเนินงาน
ทำการเล่นซ้ำเหตุการณ์ในอดีตโดยไม่ให้ป้ายกำกับสุดท้ายรั่วไหลเข้าสู่ฟีเจอร์ ทดสอบบนบริการและการเปลี่ยนแปลงใหม่, วัดการกดทับที่ผิดพลาด, เวลาในการตรวจจับ, เวลาในการบรรเทา, การยอมรับของผู้ปฏิบัติการและการเกิดซ้ำ เปรียบเทียบกับกฎที่มีอยู่และฐานเส้นง่าย ๆ
การเปลี่ยนแปลงเกิดขึ้นเมื่อสถาปัตยกรรม, การจราจร หรือแนวปฏิบัติการตอบสนองเปลี่ยนแปลง ปิดลูปโดยให้ผู้ปฏิบัติการแก้ไขการเชื่อมโยงและผลลัพธ์ แล้วตรวจสอบว่าระบบลดภาระงานโดยไม่ซ่อนความเสี่ยงหรือสร้างความพึงพอใจต่อการอัตโนมัติหรือไม่
ข้อมูล AIOps และสายการวิเคราะห์
AIOps ใช้วิธีสถิติและการเรียนรู้ของเครื่องกับข้อมูลการดำเนินงานเช่นเมตริก, บันทึก, การติดตาม, เหตุการณ์, โครงสร้าง, ตั๋ว, และการเปลี่ยนแปลง สายการทำงานจะรวบรวมและทำให้สัญญาณเป็นมาตรฐาน, เสริมข้อมูลด้วยบริบทของบริการและความเป็นเจ้าของ, ตรวจจับความผิดปกติ, เชื่อมโยงเหตุการณ์ที่เกี่ยวข้อง, ประเมินสาเหตุที่เป็นไปได้, และแนะนำหรือกระตุ้นการกระทำ คุณภาพขึ้นอยู่กับเวลา, ตัวระบุ, โครงสร้าง, และบันทึกการเปลี่ยนแปลง โมเดลขั้นสูงไม่สามารถเชื่อมโยงการแจ้งเตือนที่อ้างถึงบริการเดียวกันได้อย่างเชื่อถือเมื่อชื่อไม่สอดคล้อง
การตรวจจับความผิดปกติเรียนรู้ฐานข้อมูลตามบริการ, ฤดูกาล, และสถานะการทำงาน; ค่าเกณฑ์คงที่อาจดีกว่าสำหรับขีดจำกัดความปลอดภัยที่รู้จัก การเชื่อมโยงเหตุการณ์จัดอาการเป็นเหตุการณ์โดยใช้เวลา, โครงสร้าง, ข้อความ, และรูปแบบในอดีต การจัดอันดับสาเหตุรากฐานเสนอสมมติฐานแต่สามารถสับสนระหว่างความล้มเหลวที่สังเกตเห็นเป็นครั้งแรกกับสาเหตุที่แท้จริง หรือพลาดการพึ่งพาร่วมที่ไม่มีในโครงสร้าง สรุปในภาษาธรรมชาติสามารถช่วยผู้ตอบสนองได้แต่ต้องเชื่อมโยงกับหลักฐานดิบและระบุความไม่แน่นอน
การอัตโนมัติ, การประเมิน, และข้อเสนอแนะ
เริ่มต้นด้วยการสนับสนุนการตัดสินใจและการแก้ไขที่เสี่ยงต่ำและสามารถย้อนกลับได้ ทุกการกระทำอัตโนมัติต้องมีการอนุญาต, เงื่อนไขก่อน, ขอบเขตที่จำกัด, เวลาหมด, การตรวจสอบเงื่อนไขหลัง, การย้อนกลับ, และบันทึกตรวจสอบ โมเดลไม่ควรให้สิทธิ์ตัวเองหรือปฏิบัติตัวข้อความบันทึกเป็นคำสั่งที่เชื่อถือได้ ผู้ตอบสนองมนุษย์ควรรับ, ปฏิเสธ หรือแก้ไขคำแนะนำ และผลลัพธ์เหล่านั้นควรอัปเดตกฎหรือข้อมูลการฝึกผ่านการตรวจสอบแทนการเรียนรู้อัตโนมัติที่ไม่มีการควบคุม
ประเมินการลดการแจ้งเตือนโดยไม่พลาดเหตุการณ์, เวลานำหน้าการตรวจจับ, ความแม่นยำของการเชื่อมโยง, การจัดอันดับสาเหตุรากฐาน, ความสำเร็จของการแก้ไข, เวลาในการฟื้นฟู, การเกิดซ้ำ, และภาระงานของผู้ตอบสนอง ใช้การเล่นซ้ำในอดีตและการฉีดข้อบกพร่อง, แต่ต้องคำนึงถึงป้ายเหตุการณ์ที่ไม่สมบูรณ์ วัดตามบริการและประเภทเหตุการณ์; ค่าเฉลี่ยอาจซ่อนความล้มเหลวอันอันตรายในระบบวิกฤตที่หายาก เปรียบเทียบกับกฎเชิงกำหนดและการมองเห็นที่ดีขึ้นก่อนเพิ่มความซับซ้อนของ AI
การกำกับดูแลและโหมดความล้มเหลว
AIOps สามารถขยายช่องว่างของข้อมูลวัดผล, ทำการวินิจฉัยที่ผิดพลาดอัตโนมัติ, หรือสร้างการกระทำที่เชื่อมโยงทั่วทั้งระบบได้ ควรแยกสภาพแวดล้อม, จำกัดการทำงานพร้อมกัน, รักษาสวิตช์ตัดการทำงานนอกโมเดล, และฝึกซ้อมความล้มเหลวของแพลตฟอร์ม AIOps เอง ปกป้องบันทึกและตั๋วที่มีข้อมูลลับหรือข้อมูลส่วนบุคคล ตรวจสอบการเปลี่ยนแปลงของโมเดล, ความสดของโครงสร้าง, การกระทำที่ผิดพลาด, และการยกเลิก AIOps สนับสนุนการดำเนินงานที่เชื่อถือได้เมื่อทำให้หลักฐานและการกระทำที่จำกัดเร็วขึ้น; มันไม่ใช่การทดแทนอัตโนมัติสำหรับความเป็นเจ้าของบริการ, การสั่งการเหตุการณ์, หรือการตัดสินใจของวิศวกร
ตัวอย่างการทำงาน: AIOps สำหรับเหตุการณ์การชำระเงิน
AIOps จัดกลุ่มการเพิ่มขึ้นของข้อผิดพลาด API, ความอิ่มตัวของฐานข้อมูล, และการแจ้งเตือนระดับภูมิภาคเป็นเหตุการณ์เดียวและเสริมข้อมูลด้วยการปรับใช้ล่าสุด, โครงสร้าง, และเจ้าของ ระบบจัดอันดับการปรับใช้ว่าเป็นสาเหตุที่เป็นไปได้ แต่เปิดเผยข้อมูลวัดผลดิบและทางเลือก นโยบายเชิงกำหนดหยุดการปรับใช้ต่อไป; ผู้สั่งการเหตุการณ์มนุษย์อนุมัติการเปลี่ยนแปลงการจราจรหลังจากตรวจสอบว่าความจุและความสอดคล้องของข้อมูลปลอดภัย
ระบบวัดความแม่นยำของการจัดกลุ่ม, เวลานำหน้าการตรวจจับ, ความแม่นยำของการจัดอันดับ, การยอมรับของผู้ตอบสนอง, การฟื้นฟู, และการแก้ไขที่ผิดพลาดในการเล่นซ้ำในอดีตและวันทดสอบ ทุกการกระทำอัตโนมัติมีขอบเขต, ความเป็นเอกลักษณ์, การตรวจสอบเงื่อนไขหลัง, และการย้อนกลับ บันทึกถูกทำความสะอาดและข้อความที่เป็นอันตรายไม่สามารถกลายเป็นคำสั่งได้ หลังเหตุการณ์ สาเหตุที่ยืนยันและผลลัพธ์ของการกระทำอัปเดตกฎที่ตรวจสอบและข้อมูลการประเมิน แพลตฟอร์ม AIOps ช่วยในหลักฐานและการประสานงาน; มันไม่เคยแทนที่การสั่งการเหตุการณ์หรือการอนุมัติจากภายนอก
หลักฐานการนำไปใช้และความพร้อมในการดำเนินงาน
การตัดสินใจในการผลิตต้องการมากกว่าการสาธิตที่ประสบความสำเร็จ กำหนดผู้ใช้เป้าหมาย, สภาพแวดล้อมการทำงาน, อินพุต, เอาต์พุต, การพึ่งพา, เจ้าของ, และผลของความล้มเหลวที่สำคัญแต่ละรายการ สร้างฐานข้อมูลที่ทำซ้ำได้และชุดการประเมินที่มีเวอร์ชันก่อนการปรับแต่ง ทดสอบกรณีทั่วไป, เงื่อนไขขอบเขต, อินพุตที่ผิดรูปหรือหายไป, การเปลี่ยนแปลงการกระจาย, การหยุดทำงานของการพึ่งพา, การใช้งานผิดวิธี, และกลุ่มหรือสภาพแวดล้อมที่อาจไม่ได้รับการสนับสนุนอย่างเพียงพอ วัดคุณภาพงานพร้อมกับการปรับเทียบหรือความไม่แน่นอน, ความหน่วง, ปริมาณการทำงาน, ต้นทุนทรัพยากร, การเข้าถึง, ความเป็นส่วนตัว, และความปลอดภัย บันทึกการแปลงและค่าเกณฑ์ทุกอย่างเพื่อให้ผู้ตรวจสอบอิสระสามารถทำซ้ำผลลัพธ์และแยกแยะหลักฐานจากต้นแบบที่ดึงดูด
ก่อนเปิดใช้งาน กำหนดอำนาจสำหรับการปล่อย, ข้อยกเว้น, การเปลี่ยนแปลง, การย้อนกลับ, และการยกเลิก ใช้การเปิดตัวเป็นขั้นตอน, รักษาการสำรองที่ปลอดภัย, และตรวจสอบการเฝ้าระวังด้วยการฉีดข้อบกพร่องโดยเจตนา การวัดผลการดำเนินงานควรเปิดเผยคุณภาพของอินพุต, พฤติกรรมของเอาต์พุต, เวอร์ชันของโมเดลหรือกฎ, สภาพสุขภาพของการพึ่งพา, การยกเลิกของมนุษย์, และผลลัพธ์ที่ยืนยันโดยไม่เก็บข้อมูลที่ละเอียดอ่อนที่ไม่จำเป็น กำหนดเกณฑ์การแจ้งเตือนและเจ้าของการตอบสนอง, จากนั้นตรวจสอบหลักฐานในโลกจริงหลังการปรับใช้แทนการสมมติว่าประสิทธิภาพออฟไลน์จะคงอยู่ ประเมินใหม่ทุกครั้งที่แหล่งข้อมูล, ผู้ใช้, โมเดล, ผู้จำหน่าย, นโยบาย, ฮาร์ดแวร์, หรือเป้าหมายเปลี่ยนแปลง ระบบที่ดูแลต้องมีขั้นตอนการกู้คืน, การเรียนรู้จากเหตุการณ์, การลบและการเก็บรักษาที่บันทึกไว้, และจุดชัดเจนที่ควรปิดการทำงานหรือแทนที่
คำถามที่พบบ่อย
AIOps คือเดียวกับการมองเห็นระบบหรือไม่?
ไม่ใช่ การมองเห็นระบบให้และสำรวจสัญญาณของระบบ; AIOps ใช้การวิเคราะห์และการอัตโนมัติกับสัญญาณเหล่านั้น แต่ละอย่างสามารถมีอยู่ได้โดยไม่ต้องพึ่งพาอีกด้าน
AIOps สามารถระบุสาเหตุรากฐานโดยอัตโนมัติได้หรือไม่?
มันสามารถจัดอันดับสมมติฐานและรวบรวมหลักฐานได้ แต่การอ้างอิงสาเหตุจำเป็นต้องมีโครงสร้าง, บริบทการเปลี่ยนแปลงและการตรวจสอบ หลายเหตุการณ์มีสาเหตุที่ทำงานร่วมกัน












