Mô hình và nền tảng AI

Phát hiện bất thường trong kinh doanh: Ngăn chặn gian lận với Phát hiện bất thường

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Phát hiện bất thường với MIDAS

Phát hiện bất thường đã trở thành một trong những công cụ học máy hữu ích nhất trong năm năm qua. Nó có thể được sử dụng từ gian lận đến kiểm soát chất lượng. Liệu có thể cô lập những kẻ gian lận trên các trang web đánh giá trực tuyến không? Liệu các giao dịch tài chính gian lận có thể được phát hiện khi chúng xảy ra không? Liệu dữ liệu cảm biến trực tiếp có thể thông báo về sự cố lưới điện trước khi chúng xảy ra không?

Phát hiện bất thường cung cấp câu trả lời cho các câu hỏi như vậy. Xác định các bất thường trong dữ liệu là một nhiệm vụ hiểu dữ liệu quan trọng. Bằng cách tiếp xúc với các tập dữ liệu lớn với các công cụ học máy và phương pháp thống kê, các mẫu bình thường trong dữ liệu có thể được học. Khi các sự kiện không nhất quán xảy ra, các thuật toán phát hiện bất thường có thể cô lập hành vi bất thường và đánh dấu bất kỳ sự kiện nào không tương ứng với các mẫu đã học. Chức năng này rất quan trọng trong nhiều trường hợp kinh doanh. Phát hiện bất thường cho phép các ứng dụng trong một số lượng lớn lĩnh vực, từ bảo mật đến tài chính và giám sát IoT.

Các đồ thị quy mô web hiện nay rất phổ biến và là một biểu diễn chung của các cấu trúc dữ liệu lớn. Chúng cung cấp năng lượng cho cả ứng dụng trực tuyến và ngoại tuyến. Một số ví dụ trực tuyến là các mạng xã hội lớn, các công cụ khuyến nghị sản phẩm và các đồ thị giao dịch tài chính. Ngoài trời: các mạng đường, các nền tảng IoT và các cảm biến điện áp trong lưới điện đều là nguồn của một lượng lớn dữ liệu giống như đồ thị. Việc có dữ liệu được biểu diễn dưới dạng đồ thị mang lại cả lợi ích và thách thức cho chủ sở hữu của các tập dữ liệu đó. Một mặt, nó cho phép biểu diễn các điểm dữ liệu và mối quan hệ của chúng trong không gian đa chiều. Mặt khác, các thuật toán có thể mở rộng để phân tích và giải thích dữ liệu là cần thiết. Điều này đã dẫn đến một tăng cường tập trung nghiên cứu vào các phương pháp như phát hiện bất thường trên dữ liệu đồ thị.

Hãy cùng xem xét một thuật toán tiên tiến được phát triển cho phát hiện bất thường trong dữ liệu đồ thị động.

MIDAS

Microcluster-Based Detector of Anomalies in Edge Streams (MIDAS) là một thuật toán giải quyết phát hiện bất thường trên dữ liệu đồ thị động. Nó được phát triển bởi các nhà nghiên cứu tại Đại học Quốc gia Singapore, những người cho rằng phương pháp của họ vượt trội so với các phương pháp hiện tại. Phương pháp của họ giảm bớt điểm yếu chung nhất của các triển khai phát hiện bất thường trước đó:

Dưới đây là baseline mới cho phát hiện bất thường được phát triển bởi Siddarth Bhatia và nhóm của anh tại Đại học Singapore

Giới thiệu MIDAS: Baseline mới cho Phát hiện bất thường trong Đồ thị

Giới thiệu MIDAS: Baseline mới cho Phát hiện bất thường trong Đồ thị. Nguồn ảnh: Blog

Biểu diễn dữ liệu dưới dạng đồ thị tĩnh

Các đồ thị tĩnh chỉ chứa thông tin kết nối và bỏ qua thông tin thời gian. Chúng cũng được gọi là ảnh chụp đồ thị và chỉ có thể được sử dụng để phát hiện các thực thể đồ thị không bình thường (ví dụ: các nút, cạnh hoặc đồ thị con đáng ngờ). Tuy nhiên, đối với nhiều ứng dụng thực tế, khía cạnh thời gian cũng rất quan trọng: nó liên quan đến việc biết khi cấu trúc đồ thị đã thay đổi. Để minh họa, trong một đồ thị tĩnh đại diện cho luồng giao thông mạng, một cạnh chỉ thông báo rằng có một kết nối giữa một địa chỉ IP nguồn và một địa chỉ IP đích. Nhưng mô tả thời gian của cạnh là không có và do đó thời gian khi hai địa chỉ kết nối là không biết. Vì các đồ thị tĩnh không thể mô hình hóa thông tin thời gian như vậy, các phương pháp phát hiện bất thường được xây dựng trên các đồ thị như vậy chỉ cung cấp hỗ trợ hạn chế cho các ứng dụng thực tế.

Mặt khác, MIDAS xử lý dữ liệu được lưu trữ trong một đồ thị động. Mỗi phần tử trong đồ thị có một dấu thời gian liên kết, đại diện cho thời gian khi phần tử đó được thêm vào đồ thị. Tiếp theo ví dụ trên, một đồ thị giao thông mạng động cũng sẽ thông báo về khi một kết nối giữa hai địa chỉ IP xảy ra. Dấu thời gian thay đổi mỗi khi một cạnh hoặc nút hiện có được cập nhật, hoặc khi các cạnh mới được thêm vào đồ thị. Như vậy, các đồ thị động là một cấu trúc thay đổi theo thời gian phù hợp hơn với nhiều ứng dụng thực tế, vốn là động. Chúng cho phép sử dụng cả thông tin kết nối và thời gian để phát hiện các phần tử đồ thị đáng ngờ. Dựa trên khả năng đó, MIDAS có thể phát hiện bất thường trong thời gian thực và do đó cung cấp hỗ trợ cho nhiều trường hợp kinh doanh.

MIDAS được tối ưu hóa để hoạt động trên dữ liệu đồ thị động. Như chúng ta đã thấy ở trên, các đồ thị động cho phép biểu diễn dữ liệu thay đổi theo thời gian. Tuy nhiên, điều này cũng có nghĩa là cấu trúc đồ thị bản thân cũng thay đổi theo thời gian. Điều này giới thiệu một số thách thức cho các thuật toán phát hiện bất thường nhằm sử dụng dữ liệu này trong các ứng dụng thời gian thực. Một ví dụ là khả năng mở rộng của phương pháp liên quan đến các đặc征 đồ thị thay đổi. Dữ liệu đồ thị lớn tương ứng với một số ứng dụng cần các thuật toán tuyến tính có thể mở rộng đến kích thước của đồ thị. MIDAS chạy theo cách trực tuyến và xử lý mỗi cạnh trong thời gian và bộ nhớ không đổi. Các tác giả cũng báo cáo rằng thuật toán chạy “162-633 lần nhanh hơn so với các phương pháp hiện tại”. Điều này làm cho thuật toán phù hợp với các ứng dụng thời gian thực, nơi xử lý các luồng dữ liệu lớn là cần thiết.

Những trường hợp kinh doanh nào cần MIDAS?

Để có một cái nhìn sâu sắc về phát hiện bất thường được sử dụng trong thế giới kinh doanh hiện nay, chúng tôi đã phỏng vấn nhà cung cấp tiền điện tử dựa trên Canada, NDAX. NDAX sử dụng phát hiện bất thường trong ba lĩnh vực của kinh doanh. Hoạt động kinh doanh chung, bộ phận tiếp thị và nhóm tuân thủ. Phát hiện bất thường giúp xác định các lỗi, cho phép họ cải thiện hiệu suất của trang web và quá trình đăng ký khách hàng. Nó cũng cho phép họ cung cấp hướng dẫn cho các nhóm phát triển phần mềm và hoạt động văn phòng về cách giải quyết các vấn đề đó. Lưu lượng truy cập trang web cũng là một lĩnh vực có thể tận dụng sức mạnh của phát hiện bất thường. Hiểu biết về các ngoại lệ trong lưu lượng truy cập trang web cung cấp thông tin và hiểu biết tốt hơn cho nhóm tiếp thị, cho phép họ xác định xem một chiến dịch tiếp thị có hiệu quả hay không. Do đó, cung cấp một bức tranh rõ ràng hơn về lĩnh vực nào là quan trọng nhất để tập trung nỗ lực. Ví dụ cuối cùng của chúng tôi là cách phát hiện bất thường khi đăng ký khách hàng giúp nhóm tuân thủ xác định gian lận tiềm năng và giảm rủi ro khách hàng.

Trong cuộc thảo luận với chúng tôi, Julia Baranovskaya, Giám đốc Tuân thủ của NDAX, nhấn mạnh tầm quan trọng của phát hiện bất thường đã được nhấn mạnh trong đại dịch hiện tại. Có một sự gia tăng 300% trong việc phát hiện gian lận trong vài tháng qua. Thời gian khó khăn kết hợp với lưu lượng truy cập trực tuyến cao mời gọi các vụ lừa đảo nhắm vào người thất nghiệp và người cao tuổi. Với phát hiện bất thường, chúng tôi hiện có thể biến các ngoại lệ này thành chỉ số của gian lận hoặc xu hướng. Biểu đồ sau cho thấy sự thay đổi của gian lận trong nửa đầu năm nay.

NDAX đã tìm thấy sự gia tăng gian lận trong Q2, đặc biệt là các vụ lừa đảo liên quan đến người cao tuổi và đăng bài việc làm giả.

Vậy về doanh nghiệp của bạn?

Các thuật toán phát hiện bất thường có thể giúp các doanh nghiệp xác định và phản ứng với các điểm dữ liệu không bình thường trong nhiều kịch bản. Một hệ thống bảo mật ngân hàng có thể sử dụng phát hiện bất thường để xác định các giao dịch gian lận. Tương tự, các chủ sở hữu nhà máy sản xuất phụ thuộc vào phát hiện bất thường để đối phó với thiết bị bị lỗi và thực hiện các biện pháp bảo trì dự đoán. Trong các mạng cảm biến IoT, phát hiện bất thường được sử dụng như một phần của các giải pháp giám sát tình trạng và để ngăn chặn việc triển khai phần mềm độc hại không mong muốn. Điểm cuối cùng là rõ ràng: các doanh nghiệp có quyền truy cập vào một lượng lớn dữ liệu có thể sử dụng MIDAS (và các thuật toán phát hiện bất thường khác) để xác định các mẫu không bình thường trong thời gian thực.


Làm thế nào để cấu trúc dữ liệu của bạn và chúng tôi có thể giúp bạn thiết lập một giải pháp phát hiện bất thường hiện đại?

Hãy gửi cho chúng tôi một dòng và cho chúng tôi biết. Đội ngũ khoa học dữ liệu của Blue Orange Digital rất vui được giúp phát hiện bất thường hoạt động cho lợi ích của bạn!

Nguồn ảnh chính: Canva

Josh Miramant là CEO và người sáng lập của Blue Orange Digital, một cơ quan hàng đầu về khoa học dữ liệu và học máy có văn phòng tại New York City và Washington DC. Miramant là một diễn giả nổi tiếng, nhà tương lai học và là cố vấn chiến lược kinh doanh và công nghệ cho các công ty doanh nghiệp và khởi nghiệp. Ông giúp các tổ chức tối ưu hóa và tự động hóa kinh doanh của họ, triển khai các kỹ thuật phân tích dựa trên dữ liệu và hiểu được ý nghĩa của các công nghệ mới như trí tuệ nhân tạo, dữ liệu lớn và Internet của vạn vật.