Nền tảng AI

AIOps là gì? Trí tuệ nhân tạo cho Vận hành CNTT

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

AIOps áp dụng học máy và tự động hoá vào dữ liệu vận hành CNTT để các đội ngũ có thể phát hiện hành vi bất thường, giảm cảnh báo trùng lặp, kết nối các sự kiện liên quan, xếp hạng các nguyên nhân khả dĩ và đề xuất hoặc thực hiện các hành động phản hồi.

AIOps không phải là một giải pháp thay thế tự động cho vận hành. Nó là một lớp bên trong hệ thống ITOps, và giá trị của nó phụ thuộc vào chất lượng dữ liệu đo lường, kiến trúc dịch vụ, lịch sử thay đổi, phản hồi của con người và các ranh giới tự động hoá an toàn.

Điểm chính

  • Chuẩn hoá các sự kiện và thêm ngữ cảnh dịch vụ trước khi áp dụng các mô hình phức tạp.
  • Phát hiện bất thường xác định các độ lệch, không nhất thiết là lỗi hoặc nguyên nhân gốc.
  • Xếp hạng tương quan và nguyên nhân khả dĩ nên hiển thị bằng chứng và mức độ không chắc chắn.
  • Khắc phục tự động cần quyền tối thiểu, phê duyệt, canary, quay lại và giám sát kết quả.
What is AIOps? Artificial Intelligence for IT Operations diagram showing telemetry, context, detect, correlate, recommend, feedback
AIOps nên giảm sự không chắc chắn trong vận hành đồng thời giữ cho bằng chứng, quyền hạn và trách nhiệm của con người luôn hiển thị.

Xây dựng lớp dữ liệu vận hành

Các nền tảng AIOps thu thập các chỉ số, nhật ký, truy vết, cảnh báo, vé, kiến trúc, triển khai và thay đổi cấu hình. Dấu thời gian, định danh và quyền sở hữu dịch vụ phải được điều chỉnh để hệ thống có thể kết nối các tín hiệu đề cập đến cùng một sự cố.

Thiếu hoặc không đồng nhất ngữ cảnh gây ra các tương quan sai lệch. Việc lưu trữ, truy cập và bảo mật dữ liệu cũng quan trọng vì nhật ký có thể chứa thông tin đăng nhập hoặc dữ liệu cá nhân. Áp dụng cùng mức quản trị như các hệ thống dữ liệu sản xuất khác.

Phát hiện và giảm nhiễu

Ngưỡng tĩnh hoạt động tốt cho các giới hạn đã biết; các phương pháp thống kê và học máy có thể mô hình hoá tính mùa vụ hoặc các mẫu đa biến. Việc loại bỏ trùng lặp nhóm các thông báo lặp lại, trong khi việc ức chế loại bỏ các cảnh báo không khả thi theo các quy tắc đã định.

Bất thường chỉ là một độ lệch so với hành vi mong đợi. Các bản phát hành đã lên kế hoạch, chiến dịch lưu lượng và chu kỳ kinh doanh có thể bất thường nhưng vẫn lành mạnh. Đánh giá độ chính xác, độ thu hồi, độ trễ phát hiện và khối lượng công việc của người vận hành thay vì ăn mừng số lượng cảnh báo đã loại bỏ.

Tương quan và nguyên nhân khả dĩ

Việc tương quan sự kiện liên kết các triệu chứng qua đồ thị phụ thuộc và cửa sổ thời gian. Mô hình nguyên nhân khả dĩ có thể xếp hạng các thành phần hoặc các thay đổi gần đây có thể giải thích sự cố. Điều này ưu tiên việc điều tra; nó không thiết lập tính nhân quả.

Hiển thị bằng chứng đóng góp, các giả thuyết thay thế và mức độ tin cậy. AI có thể giải thích đặc biệt quan trọng khi người vận hành phải quyết định có nên cô lập một dịch vụ hoặc quay lại một triển khai.

Từ đề xuất tới tự động hoá

Một runbook có thể thu thập chẩn đoán, khởi động lại một worker không trạng thái hoặc mở rộng khả năng. Các trợ lý (copilot) có thể tóm tắt sự cố và truy xuất quy trình. Các tác nhân có thể lên kế hoạch gọi công cụ, nhưng quyền sản xuất nên hẹp và các hành động cần được xác thực với trạng thái hiện tại.

Bắt đầu với các đề xuất chỉ đọc. Nâng cấp các hành động đã trưởng thành thông qua mô phỏng, phê duyệt của con người, canary và quay lại tự động. Ghi lại các đầu vào, phiên bản mô hình, ủy quyền và kết quả cho mỗi hành động.

Đánh giá và phản hồi vận hành

Phát lại các sự cố lịch sử mà không để rò rỉ nhãn cuối cùng vào các đặc trưng. Kiểm tra trên các dịch vụ và thay đổi mới, đo lường việc ức chế sai, thời gian phát hiện, thời gian khắc phục, sự chấp nhận của người vận hành và tần suất tái diễn. So sánh với các quy tắc hiện có và các baseline đơn giản.

Sự trôi dạt xảy ra khi kiến trúc, lưu lượng hoặc thực tiễn phản hồi thay đổi. Đóng vòng phản hồi bằng cách cho phép người vận hành chỉnh sửa các tương quan và kết quả, sau đó xem xét liệu hệ thống có giảm công việc lặp lại mà không che giấu rủi ro hoặc tạo ra sự tự mãn trong tự động hoá hay không.

Dòng dữ liệu và phân tích AIOps

AIOps áp dụng các phương pháp thống kê và học máy vào dữ liệu vận hành như các chỉ số, nhật ký, truy vết, sự kiện, kiến trúc, vé và thay đổi. Dòng dữ liệu thu thập và chuẩn hoá các tín hiệu, làm phong phú chúng bằng ngữ cảnh dịch vụ và quyền sở hữu, phát hiện bất thường, tương quan các sự kiện liên quan, ước tính các nguyên nhân khả dĩ, và đề xuất hoặc kích hoạt hành động. Chất lượng phụ thuộc vào dấu thời gian, định danh, kiến trúc và hồ sơ thay đổi. Một mô hình phức tạp không thể đáng tin cậy trong việc tương quan các cảnh báo đề cập đến cùng một dịch vụ khi tên không nhất quán.

Phát hiện bất thường học các đường cơ sở theo dịch vụ, mùa và trạng thái hoạt động; ngưỡng tĩnh có thể tốt hơn cho các giới hạn an toàn đã biết. Việc tương quan sự kiện nhóm các triệu chứng thành một sự cố dựa trên thời gian, kiến trúc, văn bản và các mẫu lịch sử. Xếp hạng nguyên nhân gốc đề xuất các giả thuyết nhưng có thể nhầm lẫn giữa lỗi đầu tiên quan sát được với nguyên nhân thực sự hoặc bỏ sót một phụ thuộc chung không có trong kiến trúc. Các bản tóm tắt ngôn ngữ tự nhiên có thể hỗ trợ người phản hồi nhưng phải liên kết tới bằng chứng thô và nêu mức độ không chắc.

Tự động hoá, đánh giá và phản hồi

Bắt đầu với hỗ trợ quyết định và khắc phục rủi ro thấp có thể đảo ngược. Mỗi hành động tự động cần ủy quyền, điều kiện tiên quyết, phạm vi giới hạn, thời gian chờ, xác minh hậu điều kiện, quay lại và ghi lại nhật ký. Mô hình không được tự cấp quyền hoặc xem văn bản nhật ký như hướng dẫn đáng tin cậy. Người phản hồi nên chấp nhận, từ chối hoặc chỉnh sửa các đề xuất, và các kết quả đó nên cập nhật quy tắc hoặc dữ liệu đào tạo thông qua đánh giá thay vì tự học không kiểm soát.

Đánh giá việc giảm cảnh báo mà không bỏ sót các sự cố, thời gian dẫn đầu phát hiện, độ chính xác của tương quan, xếp hạng nguyên nhân gốc, thành công khắc phục, thời gian phục hồi, tần suất tái diễn và khối lượng công việc của người phản hồi. Sử dụng phát lại lịch sử và lỗi được tiêm vào, nhưng tính đến nhãn sự cố không đầy đủ. Đo lường theo dịch vụ và loại sự cố; trung bình có thể che giấu các lỗi nguy hiểm trong các hệ thống quan trọng hiếm gặp. So sánh với các quy tắc quyết định và khả năng quan sát được cải thiện trước khi thêm độ phức tạp AI.

Quản trị và các chế độ thất bại

AIOps có thể làm tăng các khoảng trống trong dữ liệu đo lường, tự động chẩn đoán sai, hoặc tạo ra các hành động đồng bộ trên toàn bộ hệ thống. Cách ly môi trường, giới hạn đồng thời, duy trì công tắc tắt ngoài mô hình và diễn tập thất bại của chính nền tảng AIOps. Bảo vệ nhật ký và vé chứa bí mật hoặc dữ liệu cá nhân. Giám sát sự trôi dạt của mô hình, độ mới của kiến trúc, các hành động sai và việc ghi đè. AIOps hỗ trợ vận hành đáng tin cậy khi nó làm cho bằng chứng và hành động có giới hạn nhanh hơn; nó không phải là một giải pháp tự động thay thế quyền sở hữu dịch vụ, chỉ huy sự cố, hoặc phán đoán kỹ thuật.

Ví dụ thực tế: AIOps cho sự cố thanh toán

AIOps nhóm một đợt tăng lỗi API, quá tải cơ sở dữ liệu và các cảnh báo khu vực thành một sự cố và làm phong phú nó bằng một triển khai gần đây, kiến trúc và người sở hữu. Nó xếp hạng triển khai này là một yếu tố đóng góp khả dĩ nhưng vẫn hiển thị dữ liệu đo lường thô và các lựa chọn thay thế. Một chính sách quyết định dừng việc triển khai tiếp theo; một chỉ huy sự cố con người phê duyệt chuyển lưu lượng sau khi kiểm tra rằng khả năng và tính nhất quán dữ liệu là an toàn.

Hệ thống đo lường độ chính xác của việc nhóm, thời gian dẫn đầu phát hiện, độ chính xác của xếp hạng, sự chấp nhận của người phản hồi, quá trình phục hồi và khắc phục sai trong phát lại lịch sử và các ngày mô phỏng. Tất cả các hành động tự động đều có giới hạn, tính không thay đổi, kiểm tra hậu điều kiện và khả năng quay lại. Nhật ký được làm sạch và văn bản độc hại không thể trở thành lệnh. Sau sự cố, nguyên nhân đã xác nhận và kết quả hành động cập nhật các quy tắc đã xem xét và dữ liệu đánh giá. Nền tảng AIOps hỗ trợ bằng chứng và phối hợp; nó không bao giờ thay thế chỉ huy sự cố hay ủy quyền bên ngoài.

Bằng chứng triển khai và sẵn sàng vận hành

Một quyết định triển khai thực tế cần nhiều hơn một buổi trình diễn thành công. Xác định người dùng dự kiến, môi trường vận hành, đầu vào, đầu ra, phụ thuộc, người sở hữu và hậu quả của mỗi lỗi quan trọng. Thiết lập một baseline có thể tái tạo và một bộ đánh giá có phiên bản trước khi tinh chỉnh. Kiểm tra các trường hợp thông thường, điều kiện biên, đầu vào sai định dạng hoặc thiếu, sự dịch chuyển phân phối, mất kết nối phụ thuộc, lạm dụng, và các nhóm hoặc môi trường có khả năng bị thiếu hỗ trợ. Đo lường chất lượng nhiệm vụ cùng với hiệu chuẩn hoặc độ không chắc, độ trễ, thông lượng, chi phí tài nguyên, khả năng tiếp cận, quyền riêng tư và bảo mật. Ghi lại mọi chuyển đổi và ngưỡng để một người đánh giá độc lập có thể tái tạo kết quả và phân biệt bằng chứng với một nguyên mẫu hấp dẫn.

Trước khi ra mắt, chỉ định quyền cho việc phát hành, ngoại lệ, thay đổi, quay lại và ngừng sử dụng. Sử dụng triển khai theo giai đoạn, duy trì một dự phòng an toàn và xác minh giám sát với các lỗi được tiêm cố ý. Dữ liệu đo lường vận hành nên tiết lộ chất lượng đầu vào, hành vi đầu ra, phiên bản mô hình hoặc quy tắc, sức khỏe phụ thuộc, ghi đè của con người và kết quả đã xác nhận mà không thu thập dữ liệu nhạy cảm không cần thiết. Xác định ngưỡng cảnh báo và người chịu trách nhiệm phản hồi, sau đó xem xét bằng chứng thực tế sau khi triển khai thay vì giả định hiệu năng ngoại tuyến sẽ kéo dài. Đánh giá lại mỗi khi nguồn dữ liệu, người dùng, mô hình, nhà cung cấp, chính sách, phần cứng hoặc mục tiêu thay đổi. Một hệ thống được duy trì cũng cần có tài liệu về phục hồi, học hỏi từ sự cố, quy trình xóa và lưu trữ, và một điểm rõ ràng mà tại đó nó nên bị vô hiệu hoá hoặc thay thế.

Câu hỏi thường gặp

AIOps có giống với khả năng quan sát không?

Không. Khả năng quan sát cung cấp và khám phá các tín hiệu hệ thống; AIOps sử dụng phân tích và tự động hoá trên các tín hiệu đó. Mỗi thứ có thể tồn tại độc lập với nhau.

AIOps có thể tự động xác định nguyên nhân gốc không?

Nó có thể xếp hạng các giả thuyết và thu thập bằng chứng, nhưng các khẳng định nhân quả đòi hỏi kiến trúc, ngữ cảnh thay đổi và xác thực. Nhiều sự cố có nhiều nguyên nhân tương tác.

Tài liệu tham khảo chính

Haziqa là một Nhà khoa học dữ liệu với kinh nghiệm rộng rãi trong việc viết nội dung kỹ thuật cho các công ty AI và SaaS.