Nền tảng AI

IT Operations (ITOps) là gì?

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

IT operations (ITOps) là công việc vận hành các dịch vụ công nghệ mà một tổ chức phụ thuộc vào. Nó bao gồm tính toán, mạng, danh tính, thiết bị đầu cuối, nền tảng đám mây, cơ sở dữ liệu, lưu trữ, sao lưu và các quy trình vận hành giữ cho các thành phần này luôn sẵn sàng, an toàn và có thể hỗ trợ.

ITOps hiện đại không chỉ giới hạn ở trung tâm vận hành mạng giám sát bảng điều khiển. Các nhóm ngày càng quản lý hạ tầng định nghĩa bằng phần mềm, dịch vụ nền tảng, tự động hoá và sở hữu phân tán trong khi vẫn chịu trách nhiệm về sự cố, năng lực, liên tục và mức dịch vụ.

Những điểm chính

  • ITOps quản lý các dịch vụ và các phụ thuộc của chúng trên môi trường tại chỗ, đám mây và biên.
  • Khả năng quan sát, cấu hình và kiểm kê cung cấp ngữ cảnh cần thiết để giải thích các lỗi.
  • Quản lý sự cố khôi phục dịch vụ; quản lý vấn đề giải quyết các nguyên nhân lặp lại hoặc hệ thống.
  • ITOps có sự chồng chéo với ITSM, SRE, DevOps, SecOps và AIOps nhưng không đồng nhất với bất kỳ một trong số chúng.
What is IT Operations (ITOps)? diagram showing services, telemetry, detect, triage, restore, improve
Hoạt động bảo vệ kết quả dịch vụ bằng cách kết hợp ngữ cảnh đáng tin cậy, phản hồi chuẩn bị và học tập liên tục.

Dịch vụ, tài sản và cấu hình

Hoạt động bắt đầu bằng việc biết dịch vụ nào tồn tại, ai sở hữu chúng, người dùng nào phụ thuộc vào chúng và hạ tầng nào hỗ trợ chúng. Kiểm kê tài sản ghi lại các thành phần; quản lý cấu hình ghi lại các mối quan hệ liên quan và trạng thái được kiểm soát.

Một danh mục không bao giờ được điều chỉnh sẽ gây hiểu lầm. Tự động khám phá khi có ích, xác định các nguồn đáng tin cậy và ghi lại độ tin cậy hoặc độ mới thay vì giả vờ mọi bản đồ phụ thuộc đều hoàn chỉnh.

Khả năng quan sát và mục tiêu dịch vụ

Các chỉ số định lượng hành vi, nhật ký ghi lại sự kiện và dấu vết theo dõi công việc qua các dịch vụ. Kiểm tra tổng hợp có thể thử nghiệm hành trình người dùng. Khả năng quan sát hữu ích bắt đầu từ các câu hỏi và mục tiêu dịch vụ, sau đó thu thập các tín hiệu cần thiết để trả lời chúng.

Cảnh báo nên xác định các điều kiện cần hành động kịp thời. Ngưỡng mà không ảnh hưởng tới người dùng tạo ra tiếng ồn, trong khi thiếu ngữ cảnh phụ thuộc làm chậm chẩn đoán. AIOps có thể hỗ trợ việc tương quan, nhưng nó cần dữ liệu đo lường đáng tin cậy và phản hồi vận hành.

Quản lý sự cố, vấn đề và thay đổi

Quản lý sự cố phối hợp việc phát hiện, phân loại, giảm thiểu, truyền thông và khôi phục. Vai trò rõ ràng giảm bớt sự nhầm lẫn trong áp lực. Giải pháp tạm thời có thể khôi phục dịch vụ trong khi điều tra vấn đề sau này giải quyết nguyên nhân sâu hơn.

Quản lý thay đổi đánh giá và ghi lại rủi ro mà không biến mọi thay đổi thành một hàng đợi. Các thay đổi tiêu chuẩn, tự động và ít rủi ro có thể theo các lộ trình đã được phê duyệt trước; các thay đổi có tác động lớn cần bằng chứng mạnh hơn, lập lịch và chuẩn bị khôi phục.

Năng lực, độ bền và liên tục

Các nhóm dự báo nhu cầu tài nguyên, loại bỏ các nút thắt và kiểm tra hành vi dưới tải. Sao lưu chỉ hữu ích khi việc khôi phục được kiểm tra. Dự phòng chỉ có ích khi các chế độ lỗi độc lập và chuyển đổi dự phòng thực sự hoạt động.

Liên tục kinh doanh xác định các ưu tiên, thời gian khôi phục và mức mất dữ liệu chấp nhận được. Các phụ thuộc vào danh tính, DNS, mặt phẳng điều khiển đám mây và nhà cung cấp nên được đưa vào các bài tập thay vì giả định sẵn có.

ITOps, ITSM, SRE và DevOps

Quản lý dịch vụ CNTT cung cấp các quy trình để điều chỉnh dịch vụ với nhu cầu của tổ chức. Kỹ thuật độ tin cậy trang web (SRE) áp dụng kỹ thuật phần mềm vào vận hành và sử dụng mục tiêu mức dịch vụ và ngân sách lỗi. DevOps kết hợp phản hồi giữa phát triển và vận hành.

SecOps tập trung vào các mối đe dọa và phản hồi, trong khi ITOps duy trì sức khỏe dịch vụ rộng hơn. Sơ đồ tổ chức khác nhau; yêu cầu quan trọng là quyền sở hữu rõ ràng và bằng chứng chia sẻ giữa các lĩnh vực này.

Mô hình vận hành ITOps

IT operations giữ cho các dịch vụ công nghệ của tổ chức luôn sẵn sàng, hiệu năng, an toàn và có khả năng khôi phục. Phạm vi thường bao gồm thiết bị đầu cuối, danh tính, mạng, máy chủ, đám mây, lưu trữ, hợp tác, cơ sở dữ liệu, giám sát, bàn hỗ trợ, sao lưu và dịch vụ của nhà cung cấp. ITOps hiện đại bao phủ hạ tầng sở hữu và nền tảng được quản lý, vì vậy trách nhiệm phải được nêu rõ ngay cả khi vận hành được thuê ngoài. Một danh mục cấu hình hoặc dịch vụ kết nối các thành phần kỹ thuật với chủ sở hữu, người dùng, phụ thuộc, phân loại dữ liệu và mức độ quan trọng kinh doanh.

Quản lý dịch vụ sắp xếp các sự cố, yêu cầu, vấn đề, thay đổi, tài sản, kiến thức và mức dịch vụ. Quản lý sự cố khôi phục dịch vụ; quản lý vấn đề điều tra các nguyên nhân lặp lại; cho phép thay đổi đánh giá và phối hợp rủi ro. Xem mọi thay đổi như một phê duyệt chậm tạo ra các lối thoát, trong khi tự động hoá không được quản lý tạo ra lỗi không kiểm soát. Các thay đổi tiêu chuẩn ít rủi ro có thể được phê duyệt trước và tự động; các thay đổi có rủi ro cao cần bằng chứng, truyền thông, khôi phục và lập lịch dựa trên tác động.

Độ tin cậy, năng lực và liên tục

Giám sát nên theo dõi các dịch vụ hướng tới người dùng và các phụ thuộc, không chỉ dựa trên số lượng thiết bị. Xác định mục tiêu về khả dụng, độ trễ, năng lực, độ mới và hỗ trợ cùng với các chủ doanh nghiệp. Cảnh báo các triệu chứng có thể hành động và tiêu thụ ngân sách lỗi; làm phong phú các sự kiện bằng thông tin về chủ sở hữu và các thay đổi gần đây. Các mô hình lập kế hoạch năng lực bao gồm nhu cầu, bão hòa, giấy phép và thời gian chờ. Độ co giãn của đám mây giảm độ trễ cung cấp nhưng không loại bỏ hạn ngạch, giới hạn khu vực hoặc kiểm soát chi phí.

Liên tục kinh doanh yêu cầu sao lưu đã được kiểm tra, khôi phục, phục hồi danh tính, các lựa chọn mạng thay thế, liên hệ nhà cung cấp và quy trình thủ công. Xác định mục tiêu thời gian khôi phục và điểm khôi phục cho mỗi dịch vụ. Sao lưu không phải là bằng chứng của việc khôi phục cho đến khi nó được khôi phục và xác thực. Luyện tập các tình huống ransomware, mất vùng, chứng chỉ hết hạn, sự cố danh tính và thất bại nhà cung cấp. Theo dõi cấu hình và hạ tầng dưới dạng mã khi có thể để việc khôi phục có thể tái tạo.

Bảo mật, tự động hoá và chỉ số

Sử dụng nguyên tắc tối thiểu quyền, quản lý bản vá và lỗ hổng, kiểm soát thiết bị đầu cuối, phân đoạn mạng, ghi nhật ký và phản hồi sự cố. Tự động hoá công việc lặp lại với tính không thay đổi, giới hạn, phê duyệt và kiểm toán. Đo lường khả năng sẵn sàng dịch vụ, tái phát sự cố, hoàn thành yêu cầu, thất bại thay đổi, khôi phục, mức độ phơi bày bản vá, năng lực, chi phí và sự hài lòng của người dùng — không chỉ đóng ticket. ITOps thành công khi công nghệ hỗ trợ công việc một cách dự đoán được và có thể khôi phục sau thất bại, không phải khi hạ tầng trông bận rộn hay bảng điều khiển có quá nhiều chỉ báo xanh.

Ví dụ thực tế: khôi phục dịch vụ hợp tác

Một công ty đặt mục tiêu thời gian khôi phục bốn giờ và mục tiêu điểm khôi phục một giờ cho nền tảng hợp tác. Công ty kiểm kê danh tính, DNS, mạng, dữ liệu, khóa, cấu hình, tích hợp và các phụ thuộc nhà cung cấp. Bài tập khôi phục giả định vùng chính và tài khoản quản trị không khả dụng. Các nhà vận hành kích hoạt danh tính khẩn cấp được bảo vệ độc lập, khôi phục cấu hình dịch vụ và dữ liệu vào một vùng cô lập, và xác nhận quyền, tin nhắn, tích hợp và truy cập khách hàng. Các chủ doanh nghiệp xác nhận dịch vụ đã khôi phục bằng các hành trình người dùng thực tế thay vì chỉ dựa vào kiểm tra sức khỏe hạ tầng.

Bài tập ghi lại mức mất dữ liệu thực tế, thời gian đã trôi qua, các bước thủ công, các liên hệ thất bại và các phụ thuộc ẩn. Sao lưu khôi phục được các tệp nhưng không có khóa mã hoá hoặc chính sách danh tính sẽ được đánh dấu là chưa hoàn chỉnh. Các hành động khắc phục được chỉ định cho chủ sở hữu và ngày thực hiện, và sổ hướng dẫn được cập nhật và kiểm tra lại. Các mẫu giám sát và truyền thông được bao gồm. Tổ chức đo lường bằng chứng khôi phục thay vì thành công của công việc sao lưu, nhận ra rằng ITOps đáng tin cậy phải khôi phục dịch vụ mà người dùng cần trong các điều kiện thất bại thực tế.

Bằng chứng triển khai và sẵn sàng vận hành

Quyết định triển khai cần nhiều hơn một buổi trình diễn thành công. Xác định người dùng mục tiêu, môi trường vận hành, đầu vào, đầu ra, phụ thuộc, chủ sở hữu và hậu quả của mỗi lỗi quan trọng. Thiết lập nền tảng có thể tái tạo và bộ đánh giá có phiên bản trước khi tinh chỉnh. Kiểm tra các trường hợp thông thường, điều kiện biên, đầu vào sai định dạng hoặc thiếu, sự thay đổi phân phối, mất dịch vụ phụ thuộc, lạm dụng, và các nhóm hoặc môi trường có khả năng bị thiếu hỗ trợ. Đo lường chất lượng nhiệm vụ cùng với độ hiệu chuẩn hoặc độ không chắc chắn, độ trễ, thông lượng, chi phí tài nguyên, khả năng tiếp cận, quyền riêng tư và bảo mật. Ghi lại mọi chuyển đổi và ngưỡng để người đánh giá độc lập có thể tái tạo kết quả và phân biệt bằng chứng với một nguyên mẫu hấp dẫn.

Trước khi ra mắt, chỉ định quyền cho việc phát hành, ngoại lệ, thay đổi, khôi phục và ngừng sử dụng. Sử dụng triển khai theo giai đoạn, duy trì một phương án dự phòng an toàn, và xác minh giám sát với các lỗi được chèn có chủ đích. Dữ liệu đo lường vận hành nên tiết lộ chất lượng đầu vào, hành vi đầu ra, phiên bản mô hình hoặc quy tắc, sức khỏe phụ thuộc, can thiệp của con người và kết quả đã xác nhận mà không thu thập dữ liệu nhạy cảm không cần thiết. Xác định ngưỡng cảnh báo và người chịu trách nhiệm phản hồi, sau đó xem xét bằng chứng thực tế sau khi triển khai thay vì giả định hiệu suất ngoại tuyến sẽ kéo dài. Đánh giá lại mỗi khi nguồn dữ liệu, người dùng, mô hình, nhà cung cấp, chính sách, phần cứng hoặc mục tiêu thay đổi. Một hệ thống được duy trì cũng cần có tài liệu về khôi phục, học hỏi từ sự cố, quy trình xóa và lưu trữ, và một điểm rõ ràng khi nó nên bị vô hiệu hoá hoặc thay thế.

Câu hỏi thường gặp

Mục tiêu chính của ITOps là gì?

Cung cấp và khôi phục các dịch vụ công nghệ đáng tin cậy trong phạm vi các ràng buộc về bảo mật, hiệu suất, liên tục và chi phí đã thỏa thuận.

Cơ sở hạ tầng đám mây có được vận hành hoàn toàn bởi nhà cung cấp đám mây không?

Không. Các nhà cung cấp vận hành một phần của nền tảng cơ bản, trong khi khách hàng vẫn chịu trách nhiệm về cấu hình, danh tính, dữ liệu, khối lượng công việc, giám sát và nhiều quyết định ở mức dịch vụ.

Tài liệu tham khảo chính

Alex dẫn dắt hoạt động tin tức được hỗ trợ bởi AI của Unite.AI, kết hợp báo chí, nghiên cứu và tự động hoá để hỗ trợ việc đưa tin về trí tuệ nhân tạo một cách kịp thời và có khả năng mở rộng. Công việc của anh giúp đảm bảo các phát triển AI mới nổi được đưa lên một cách hiệu quả trong khi vẫn duy trì tiêu chuẩn biên tập của tờ báo.