Mô hình và nền tảng AI
Agentic SRE: Làm thế nào Cơ sở hạ tầng Tự chữa lành đang Định hình lại AIOps Doanh nghiệp vào năm 2026

Các hệ thống CNTT doanh nghiệp đã đạt đến một điểm mà các hoạt động tập trung vào con người không thể theo kịp. Viết microservices, lập trình cạnh, và 5G đã nhân lên các依赖 và chế độ thất bại, và do đó, mỗi tương tác người dùng có thể cascade trên hàng chục dịch vụ. Do đó, các hệ thống tạo ra một dòng dữ liệu ghi, số liệu và dấu vết áp đảo trong vài giây. Do đó, các kỹ sư thường đối mặt với một Tường giám sát, nơi giải quyết một cảnh báo đơn lẻ ngay lập tức được theo sau bởi hàng trăm cảnh báo khác đòi hỏi sự chú ý.
Thông qua năm 2024 và 2025, sự tăng trưởng của dữ liệu telemetry đã thách thức các phương pháp Kỹ sư tin cậy trang web (SRE) truyền thống. Mệt mỏi cảnh báo trở nên phổ biến, cải thiện Thời gian trung bình để giải quyết (MTTR) chậm lại, và các đội phải đối mặt với một nghịch lý trong đó tầm nhìn hoàn chỉnh không dẫn đến kiểm soát tốt hơn. Ngoài ra, các can thiệp thủ công, kịch bản tĩnh và các quy trình dựa trên vé không thể xử lý sự phức tạp ngày càng tăng của các hệ thống hiện đại. Sự thất bại bây giờ theo các mẫu không thể đoán trước, và các microservices tương tác động trong khi các nút cạnh thay đổi trạng thái liên tục.
Các đột phá về phần cứng, chẳng hạn như kiến trúc Rubin của NVIDIA (NVDA ), hiện làm cho các tác nhân lý trí nặng có thể thực hiện được ở quy mô lớn. Các doanh nghiệp đang áp dụng Agentic SRE vào năm 2026, nơi các tác nhân thông minh chịu trách nhiệm về kết quả tin cậy. Các tác nhân này liên tục phân tích trạng thái hệ thống, thực hiện các biện pháp khắc phục và xác minh kết quả. Hơn nữa, các kỹ sư con người tập trung vào việc định nghĩa các chính sách, thiết lập các rào cản và thiết lập ý định kinh doanh. Do đó, cách tiếp cận này tạo ra cơ sở hạ tầng tự chữa lành thực sự và định hình lại những gì AIOps doanh nghiệp có thể cung cấp trong các môi trường luôn bật, quy mô lớn.
Agentic SRE là gì: Từ Tự động hóa Kịch bản đến Tác nhân Lý trí
Trước khi kiểm tra các hạn chế của các phương pháp hiện có, cần phải làm rõ những gì phân biệt Agentic SRE với các mô hình tự động hóa truyền thống được sử dụng trong các môi trường doanh nghiệp.
Tại sao các Nguyên tắc Kỹ sư Tin cậy Trang web Cổ điển không còn Đủ
Kỹ sư tin cậy trang web truyền thống dựa trên Mục tiêu Mức dịch vụ và các cuốn sách chạy được định nghĩa trước để duy trì độ tin cậy của hệ thống. Khi một số liệu vượt quá một ngưỡng định nghĩa, một kỹ sư con người can thiệp. Trong một số trường hợp, một kịch bản thực hiện một hành động khắc phục định nghĩa trước. Cách tiếp cận này hoạt động hiệu quả trong các môi trường nơi hành vi của hệ thống vẫn ổn định và có thể dự đoán được theo thời gian.
Tuy nhiên, các hệ thống doanh nghiệp đã thay đổi đáng kể. Các microservices tương tác động trên các nền tảng phân tán. Các phụ thuộc phát triển thường xuyên. Do đó, hành vi của hệ thống trở nên khó dự đoán hơn. Sự thất bại thường xuất hiện mà không có mẫu trước. Do đó, tự động hóa tĩnh gặp khó khăn trong việc phản ứng hiệu quả. Các kịch bản được định nghĩa trước chỉ giải quyết các điều kiện đã biết và không thể thích nghi khi các sự cố khác với các kịch bản dự kiến.
Ngoài sự phức tạp kỹ thuật, các quy trình hoạt động giới thiệu các hạn chế thêm. Các quy trình dựa trên vé yêu cầu sự phê duyệt của con người cho cả các hành động khắc phục cơ bản. Khi các đội chờ đợi để khởi động lại các dịch vụ hoặc điều chỉnh khả năng, quá trình phục hồi chậm lại. Do đó, MTTR tăng lên, và chi phí hoạt động tăng lên. Các nút thắt con người trở thành một yếu tố hạn chế, không phải vì các kỹ sư thiếu kỹ năng, mà vì việc ra quyết định thủ công không thể theo kịp với tốc độ và khối lượng của hệ thống.
Định nghĩa Agentic trong Bối cảnh Kỹ sư Tin cậy Trang web
Được cho những hạn chế này, Agentic SRE giới thiệu một mô hình hoạt động khác. Thay vì phản ứng với các cảnh báo riêng lẻ, các tác nhân thông minh lý trí trên toàn bộ bối cảnh hệ thống. Các tác nhân này áp dụng lý trí chuỗi suy nghĩ cho các nhật ký, số liệu và dữ liệu sự cố lịch sử. Do đó, các quyết định khắc phục xuất hiện từ phân tích chứ không phải từ các quy tắc được định nghĩa trước.
Hơn nữa, Agentic SRE hoạt động thông qua các cấu trúc đa tác nhân phối hợp. Trong mô hình này, trách nhiệm được phân phối trên các tác nhân với các vai trò khác nhau. Một tác nhân phát hiện các bất thường. Một tác nhân khác đánh giá các nguyên nhân gốc rễ có thể xảy ra. Một tác nhân thứ ba thực hiện các hành động khắc phục. Một tác nhân thứ tư xác minh quá trình phục hồi so với các mục tiêu tin cậy được định nghĩa. Lưu lượng phối hợp này phản ánh các đội hoạt động của con người nhưng loại bỏ các độ trễ gây ra bởi việc bàn giao và phê duyệt.
Do đó, vai trò của các kỹ sư thay đổi đáng kể. Mô hình con người trong vòng thay thế việc thực hiện hoạt động trực tiếp bằng việc giám sát và quản lý. Các kỹ sư định nghĩa các chính sách, chỉ định các hành động có thể chấp nhận được và mã hóa ý định kinh doanh. Họ đánh giá kết quả chứ không phải thực hiện các can thiệp lặp đi lặp lại. Do đó, nỗ lực hoạt động chuyển hướng khỏi việc xử lý sự cố phản ứng và hướng tới thiết kế hệ thống, lập kế hoạch độ tin cậy và quản lý độ tin cậy lâu dài.
Agentic SRE so với AIOps Truyền thống: Sự Khác biệt là gì
Tại sao AIOps Di sản Không giải quyết được Phản hồi Sự cố Hiện đại
AIOps di sản, hoặc AIOps 1.0, tập trung vào việc nhận dạng mẫu và nhóm cảnh báo. Nó giảm tiếng ồn và cải thiện tầm nhìn, nhưng các đội con người vẫn chịu trách nhiệm về việc khắc phục. Các hệ thống này có thể xác định các sự cố và nhấn mạnh các nguyên nhân có thể xảy ra, nhưng chúng không thể giải quyết các sự cố một cách an toàn bằng chính mình. Các kỹ sư vẫn phải giải thích các khuyến nghị và thực hiện hành động, điều này giữ cho phản ứng của họ phản ứng.
Hạn chế trở nên rõ ràng hơn khi các hệ thống trở nên phức tạp hơn. Các sự cố hiện đại bao gồm nhiều dịch vụ và phụ thuộc. Phát hiện một nút thắt cổ chai cơ sở dữ liệu hoặc một vấn đề bộ nhớ không phục hồi dịch vụ bằng chính nó. Không có hành động khắc phục tự động, sự hiểu biết đơn thuần không giảm thời gian phục hồi. Điều này tạo ra một Khoảng cách Khuyến nghị, trong đó việc hiểu các vấn đề không dẫn đến giải pháp nhanh hơn.
Agentic AIOps Đóng vòng Thực hiện
Agentic AIOps vượt qua các hạn chế của các hệ thống cũ bằng cách kết hợp phân tích với thực hiện. Các tác nhân thông minh hành động trên các tín hiệu đã được xác thực thay vì dừng lại ở các khuyến nghị. Sử dụng các Mô hình Hành động Lớn, chúng thực hiện các biện pháp khắc phục có cấu trúc trên các ứng dụng và cơ sở hạ tầng, biến quan sát thành hành động được kiểm soát.
Ví dụ, một tác nhân có thể phát hiện hành vi bộ nhớ bất thường, theo dõi nó đến một thay đổi mã cụ thể và triển khai một container đã được sửa đổi trong một môi trường giai đoạn. Sau đó, nó xác minh hành vi hệ thống so với các mục tiêu được định nghĩa trước khi quảng bá sửa chữa đến sản xuất. Mỗi bước theo các chính sách và ràng buộc an toàn, trong khi các kỹ sư con người quan sát và xem xét kết quả chứ không phải thực hiện các lệnh.
Do đó, phản hồi sự cố trở nên quyết định hơn là phản ứng. Thời gian phục hồi không còn phụ thuộc vào sự sẵn có của con người. Thời gian ngừng hoạt động giảm, tính nhất quán cải thiện và AIOps phát triển từ một công cụ tư vấn thành một hệ thống hoạt động cho phép cơ sở hạ tầng tự chữa lành ở quy mô doanh nghiệp.
Tại sao Cơ sở hạ tầng Tự chữa lành đang Được ưa chuộng
Việc áp dụng cơ sở hạ tầng tự chữa lành đang được tăng tốc do cả tiến bộ công nghệ và nhu cầu tổ chức. Các cải tiến về phần cứng đã làm cho nó có thể chạy các tác nhân lý trí nặng trên các hệ thống doanh nghiệp lớn với chi phí thấp hơn và phản hồi nhanh hơn. Ngoài ra, các chip AI chuyên dụng cho phép các tác nhân phân tích các luồng dữ liệu phức tạp và hành động trên chúng trong thời gian thực, một khả năng trước đây không thực tế. Hơn nữa, các yếu tố thị trường khuyến khích việc áp dụng. Tài năng SRE có kỹ năng hạn chế, chi phí hoạt động tăng và các tổ chức phải đối mặt với áp lực ngày càng tăng để duy trì độ tin cậy trong khi giảm mệt mỏi của con người.
Hoạt động phụ thuộc vào con người tạo ra các độ trễ và tăng khả năng xảy ra lỗi. Các đội thường dành nhiều thời gian hơn để phản hồi các cảnh báo hơn là ngăn chặn sự cố. Do đó, các sự cố mất nhiều thời gian hơn để giải quyết và tính nhất quán hoạt động bị ảnh hưởng. Các hệ thống Agentic SRE giúp giải quyết những thách thức này bằng cách cho phép các tác nhân thông minh liên tục theo dõi hệ thống, thực hiện phân tích nguyên nhân gốc rễ, thực hiện các biện pháp khắc phục và xác minh kết quả. Do đó, các kỹ sư con người có thể tập trung vào việc định nghĩa các chính sách, thiết lập các rào cản và hướng dẫn ý định kinh doanh thay vì thực hiện các nhiệm vụ hoạt động lặp đi lặp lại.
Ngoài ra, chi phí của nút thắt con người mở rộng ra ngoài thời gian phản hồi. Burnout và tỷ lệ rời bỏ công việc của các kỹ sư giảm sự bền vững của tổ chức và hạn chế khả năng quản lý cơ sở hạ tầng phức tạp. Do đó, các hệ thống tự chữa lành giảm áp lực hoạt động, cải thiện độ tin cậy và cho phép các kỹ sư dành nỗ lực cho công việc chiến lược như lập kế hoạch độ tin cậy và quản lý độ tin cậy lâu dài. Do đó, tiến bộ công nghệ và khuyến khích hoạt động đang kết hợp để làm cho các hoạt động CNTT tự động, tự động hóa trở thành một giải pháp thực tế và cần thiết cho các doanh nghiệp hiện đại.
Công nghệ Đằng sau Agentic SRE
Các hệ thống Agentic SRE kết hợp telemetry, lý trí và tự động hóa được kiểm soát vào một đường ống đóng. Đường ống này phát hiện, chẩn đoán và khắc phục các vấn đề với sự can thiệp của con người tối thiểu. Hệ thống thường dựa trên ba lớp lõi: một mặt phẳng dữ liệu thống nhất, một lớp lý trí và một lớp hành động. Mỗi lớp hoạt động trong các chính sách và rào cản nghiêm ngặt để đảm bảo thực hiện an toàn và đáng tin cậy.
Telemetry Thống nhất với OpenTelemetry
Tự chữa lành bắt đầu với dữ liệu quan sát nhất quán và chất lượng cao. Các nhật ký, số liệu, dấu vết và sự kiện từ các microservices, cụm Kubernetes, mạng và nền tảng đám mây được thu thập và tiêu chuẩn hóa. OpenTelemetry cung cấp một khuôn khổ để xuất dữ liệu này, sau đó được tổng hợp vào một nền tảng quan sát và AIOps tập trung.
Với một luồng thống nhất, các hệ thống Agentic SRE có thể tương quan các tín hiệu trên toàn bộ ngăn xếp. Do đó, các điểm mù và hiểu lầm, xảy ra khi mỗi công cụ chỉ nhìn thấy một phần của hệ thống, được giảm đáng kể. Ngoài ra, tầm nhìn toàn diện cho phép các tác nhân phản ứng chính xác với các bất thường và thay đổi hệ thống theo thời gian thực.
Lý trí Nhận thức với RAG và Biểu đồ Phụ thuộc
Lớp lý trí cho phép các tác nhân di chuyển vượt ra ngoài việc nhận dạng mẫu đơn giản. Dòng Retrieval-Augmented Generation (RAG) kéo các sự cố lịch sử, các cuốn sách chạy, dữ liệu cấu hình và phân tích hậu sự cố từ các cơ sở kiến thức nội bộ. Do đó, các quyết định dựa trên lịch sử hoạt động thực tế và các chính sách chứ không phải trên bộ nhớ mô hình chung.
Các bản đồ dịch vụ và biểu đồ phụ thuộc, thường được thực hiện với các cơ sở dữ liệu đồ thị hoặc mô hình topo, nắm bắt các mối quan hệ lên và xuống dòng. Do đó, các tác nhân có thể đánh giá tác động của các hành động có thể, đánh giá bán kính nổ và xác định các điểm an toàn nhất cho can thiệp. Sự kết hợp này của bối cảnh lịch sử và phân tích phụ thuộc cho phép các tác nhân hoạt động với độ chính xác so sánh được với các kỹ sư có kinh nghiệm.
Mô hình Hành động Lớn và Thực hiện được Quản lý bởi Chính sách
Lớp hành động chuyển đổi các quyết định thành các thay đổi an toàn và có thể kiểm toán được trong sản xuất. Các Mô hình Hành động Lớn hoặc các tác nhân được hỗ trợ bởi công cụ giao diện với các API cơ sở hạ tầng như Kubernetes, SDK của nhà cung cấp đám mây, hệ thống CI/CD và các nền tảng cơ sở hạ tầng như mã. Do đó, chúng có thể thực hiện các hoạt động như khởi động lại, quay lại, định tuyến lưu lượng và cập nhật cấu hình tự động.
Các hành động này luôn hoạt động dưới các rào cản Chính sách-là-Mã. Các khuôn khổ tương tự như Open Policy Agent định nghĩa các ranh giới hoạt động nghiêm ngặt, vì vậy các tác nhân chỉ thực hiện các nhiệm vụ được phê duyệt. Do đó, mọi thay đổi đều có thể kiểm toán, có thể theo dõi và phù hợp với các tiêu chuẩn của tổ chức. Các kỹ sư con người không còn cần phải thực hiện các can thiệp thường xuyên. Thay vào đó, họ giám sát kết quả, thiết lập các chính sách và xem xét các hành động của tác nhân, đảm bảo độ tin cậy và tuân thủ mà không cần tham gia thủ công liên tục.
Các Khả năng Cốt lõi của Cơ sở hạ tầng Tự chữa lành
Cơ sở hạ tầng tự chữa lành cung cấp ba khả năng cốt lõi hoạt động cùng nhau để duy trì độ tin cậy của hệ thống với sự can thiệp của con người tối thiểu. Đầu tiên, phát hiện dự đoán xác định các sự cố xám trước khi chúng leo thang thành các sự cố hoàn chỉnh. Những vấn đề tinh vi này, chẳng hạn như suy giảm hiệu suất nhỏ hoặc cạnh tranh tài nguyên, thường không được các cảnh báo dựa trên ngưỡng truyền thống nhận thấy. Bằng cách phân tích liên tục telemetry trên các dịch vụ, các tác nhân phát hiện các mẫu báo hiệu các vấn đề tiềm ẩn sớm. Do đó, các đội có thể ngăn chặn các sự cố trước khi chúng ảnh hưởng đến người dùng.
Hơn nữa, phân tích nguyên nhân gốc rễ tự động cho phép các tác nhân theo dõi các bất thường trên nhiều lớp của hệ thống và liên kết chúng với các thay đổi mã, cập nhật cấu hình hoặc sửa đổi cơ sở hạ tầng gần đây. Sự tương quan thời gian thực này giảm nhu cầu về điều tra thủ công và tăng tốc độ giải quyết sự cố. Do đó, các nguyên nhân gốc rễ được xác định nhanh chóng và các hành động khắc phục có thể được áp dụng với độ chính xác.
Ngoài ra, xác minh và quay lại tự động đảm bảo rằng tất cả các biện pháp khắc phục đều an toàn và hiệu quả. Các tác nhân xác minh các bản sửa lỗi so với các Mục tiêu Mức dịch vụ được định nghĩa để xác nhận rằng hiệu suất hệ thống đáp ứng các tiêu chuẩn độ tin cậy. Nếu một thay đổi thất bại hoặc giới thiệu sự không ổn định, hệ thống tự động quay lại trạng thái ổn định. Do đó, rủi ro hoạt động giảm, thời gian ngừng hoạt động được giảm thiểu và độ tin cậy của hệ thống tổng thể được cải thiện. Cùng nhau, các khả năng này tạo thành một chu kỳ đóng vòng trong đó phát hiện, chẩn đoán và khắc phục củng cố lẫn nhau, tạo ra cơ sở hạ tầng doanh nghiệp tự chữa lành thực sự.
Lo ngại về Tin cậy và An toàn trong Agentic SRE
Việc giới thiệu đầy đủ tự động hóa trong Kỹ sư Tin cậy Trang web tạo ra các thách thức mới cho các doanh nghiệp. Khi các tác nhân thông minh chịu trách nhiệm về việc phát hiện, chẩn đoán và khắc phục các sự cố, khả năng xảy ra sai sót cũng tăng lên. Ví dụ, một tác nhân có thể hiểu lầm các tín hiệu telemetry và thực hiện các hành động gây gián đoạn dịch vụ. Do đó, các tổ chức phải triển khai các biện pháp phòng ngừa nghiêm ngặt để quản lý rủi ro này một cách hiệu quả.
Một cách tiếp cận quan trọng là thiết kế các tác nhân với các quyền hạn tối thiểu. Mỗi tác nhân được cấp các ranh giới hoạt động rõ ràng, đảm bảo rằng nó chỉ có thể thực hiện các nhiệm vụ được phê duyệt. Ngoài ra, các doanh nghiệp sử dụng các khuôn khổ Chính sách-là-Mã, chẳng hạn như Open Policy Agent, để thực thi các ranh giới này một cách nhất quán. Sự kết hợp này đảm bảo rằng ngay cả khi một tác nhân hành động không chính xác, tác động của nó sẽ được giới hạn và kiểm soát.
Hơn nữa, một số hoạt động quan trọng vẫn đòi hỏi sự giám sát của con người. Ví dụ, việc thay đổi DNS toàn cầu đòi hỏi sự phê duyệt của con người. Kiểm soát phân lớp này cân bằng hiệu quả với an toàn. Việc ghi nhật ký và theo dõi rõ ràng tăng cường trách nhiệm giải trình, cung cấp khả năng hiển thị vào mọi hành động của tác nhân. Do đó, các doanh nghiệp có thể áp dụng các hệ thống tự chữa lành với sự tự tin lớn hơn, biết rằng rủi ro hoạt động được kiểm soát và độ tin cậy của hệ thống được bảo tồn.
Kết luận
Triển khai các hệ thống tự động mang lại nhiều lợi ích, nhưng cũng đòi hỏi quản lý rủi ro cẩn thận. Bằng cách kết hợp các tác nhân có quyền hạn tối thiểu với các ranh giới hoạt động rõ ràng, các doanh nghiệp có thể ngăn chặn các hành động không mong muốn. Hơn nữa, việc duy trì sự giám sát của con người đối với các nhiệm vụ quan trọng đảm bảo rằng các thay đổi có tác động cao luôn được xác minh. Việc ghi nhật ký và theo dõi rõ ràng cung cấp khả năng hiển thị liên tục, củng cố trách nhiệm giải trình trên toàn hệ thống. Do đó, niềm tin vào cơ sở hạ tầng tự chữa lành phát triển không phải từ việc loại bỏ con người hoàn toàn, mà từ việc thiết kế các biện pháp kiểm soát làm cho tự động hóa trở nên có thể dự đoán, an toàn và có thể kiểm toán. Sự cân bằng cẩn thận này cho phép các tổ chức tin tưởng vào các tác nhân thông minh trong khi vẫn bảo vệ cả hoạt động và kết quả kinh doanh.












