Phỏng vấn
Christian Stano, Field CTO tại Anyscale – Phỏng vấn

Christian Stano, Field CTO tại Anyscale, đã xây dựng sự nghiệp tại giao điểm của cơ sở hạ tầng AI quy mô lớn, nền tảng học máy và tính toán phân tán. Trước khi gia nhập Anyscale, anh đã lãnh đạo tổ chức nền tảng AI/ML tại Attentive, nơi anh đã mở rộng cơ sở hạ tầng hỗ trợ cá nhân hóa cho hơn nửa tỷ người đăng ký và giúp thúc đẩy việc áp dụng các hệ thống tính toán thống nhất dựa trên Ray, cải thiện tốc độ phát triển trong khi giảm chi phí hoạt động. Trước đó trong sự nghiệp, anh đã làm việc trong lĩnh vực an ninh mạng, kiến trúc đám mây và các sáng kiến AI trong lĩnh vực công tại các tổ chức như Coalfire và Deloitte, nơi anh đã đóng góp vào một trong những nền tảng học máy đầu tiên của Bộ Quốc phòng Hoa Kỳ. Kinh nghiệm của anh bao gồm kỹ thuật nền tảng AI, MLOps, cơ sở hạ tầng bản địa đám mây, khả năng của nhà phát triển và mở rộng tổ chức, mang lại cho anh kinh nghiệm sâu sắc trong việc giúp các doanh nghiệp triển khai AI ở quy mô sản xuất.
Anyscale là công ty đứng sau Ray, khuôn khổ tính toán phân tán mã nguồn mở được sử dụng rộng rãi để mở rộng các công việc AI và Python trên các cụm CPU và GPU. Được thành lập bởi các nhà tạo ra Ray từ RISELab của UC Berkeley, công ty tập trung vào việc đơn giản hóa việc triển khai, điều phối và quản lý cơ sở hạ tầng AI quy mô lớn cho đào tạo, suy luận, xử lý dữ liệu và các công việc AI. Nền tảng của công ty cho phép các tổ chức chạy các hệ thống AI phân tán trên môi trường đám mây và tại chỗ trong khi cung cấp khả năng quan sát, quản lý và tối ưu hóa hiệu suất được thiết kế cho các ứng dụng AI hiện đại. Ray đã trở thành một lớp cốt lõi trong ngăn xếp cơ sở hạ tầng AI mới nổi, giúp các nhà phát triển mở rộng công việc từ một máy đơn đến hàng nghìn nút với các thay đổi tối thiểu đối với mã Python hiện có.
Bạn đã làm việc trong lĩnh vực an ninh mạng, nền tảng ML trong lĩnh vực công và hệ thống cá nhân hóa siêu quy mô. Những mẫu nào bạn thường thấy khi các tổ chức cố gắng chuyển từ các thử nghiệm AI sang sản xuất?
Trong các ngành công nghiệp, ba mẫu thường xuất hiện. Đầu tiên, các đội không có một con đường được vạch ra đáng tin cậy từ phát triển đến sản xuất. Họ có thể xây dựng một mô hình trong một cuốn sổ tay, nhưng không có cách tiêu chuẩn hóa để đưa nó vào sản xuất. Mỗi lần triển khai trở thành một trường hợp riêng lẻ, và mỗi lần thất bại là một điều bất ngờ. Thứ hai, cơ sở hạ tầng không thể mở rộng với nhu cầu. Hệ thống hoạt động trong một thử nghiệm sẽ bị sập khi bạn cung cấp cho nó các khối lượng dữ liệu thực hoặc lưu lượng truy cập thực. Thứ ba, các đội đang bay mà không có tầm nhìn. Họ thiếu khả năng quan sát để biết hệ thống của họ đang hoạt động như thế nào, ở đâu chúng sẽ bị hỏng và khi nào cần can thiệp.
Điều kết nối tất cả ba là thách thức gốc cùng nhau — các đội không có một mô hình tinh thần vững chắc cho việc mở rộng quy mô. Họ cố gắng giải quyết mọi thứ cùng một lúc thay vì có chủ đích về việc sắp xếp thứ tự. Tôi nghĩ về nó như ba giai đoạn: làm cho nó hoạt động, làm cho nó đúng, làm cho nó nhanh. Những giai đoạn này không phải là các cột mốc một lần — những giai đoạn này là lặp đi lặp lại. Bạn luôn ưu tiên giữa những gì bị hỏng ngay bây giờ và những gì sẽ bị hỏng tiếp theo. Các đội thành công biết họ đang ở giai đoạn nào và giữ kỷ luật về việc không nhảy vượt trước khi nền tảng được thiết lập vững chắc.
Tại Anyscale, chúng tôi thấy các đội đến ở mọi giai đoạn. Một số vẫn đang cố gắng làm cho nó hoạt động — họ cần một con đường đáng tin cậy từ phát triển đến sản xuất. Những người khác đã có điều đó nhưng đang bị nhấn chìm trong sự phức tạp của hoạt động và cần phải làm cho nó đúng. Và nhiều người đến với chúng tôi vì họ đã xây dựng một thứ gì đó hoạt động, nhưng không thể đẩy nó lên quy mô mà doanh nghiệp đòi hỏi. Một lớp tính toán thống nhất giúp ở mỗi giai đoạn, nhưng điểm vào phụ thuộc vào nơi đau đớn nhất.
Tại Attentive, bạn đã giúp mở rộng các hệ thống AI hỗ trợ hàng trăm triệu người dùng. Những nút thắt kiến trúc hoặc tổ chức lớn nhất bạn phải vượt qua để đạt được mức độ mở rộng đó là gì?
Nút thắt lớn nhất là đường cong S của sự phức tạp cơ sở hạ tầng. Khi chúng tôi đẩy các mô hình của mình để kết hợp nhiều dữ liệu hơn và phục vụ nhiều khách hàng hơn, chúng tôi đã đạt đến một điểm giới hạn tính toán nơi thậm chí các nút được mở rộng theo chiều dọc lớn nhất cũng bị lỗi bộ nhớ và không thể cắt giảm được. Cơ sở hạ tầng tính toán của chúng tôi không thể theo kịp quy mô của dữ liệu.
Phản ứng tự nhiên là thêm nhiều công cụ để làm việc xung quanh các giới hạn. Đây là cuốn sổ tay nội bộ của tôi từ kinh nghiệm trước. Mỗi công cụ giải quyết một vấn đề hẹp nhưng thêm sự phức tạp về hoạt động. Đường ống ML của chúng tôi đối mặt với việc trở thành một bản vá các tích hợp, và mỗi trường hợp sử dụng mới có nghĩa là nhiều việc khâu hơn, nhiều chế độ thất bại hơn, chi phí cao hơn và nhiều chi phí hơn cho đội nền tảng.
Điều cuối cùng đã mở khóa quy mô cho chúng tôi là thống nhất xử lý dữ liệu, đào tạo, suy luận và phục vụ lên Ray và Anyscale. Tác động là ngay lập tức: với chi phí cơ sở hạ tầng giảm đáng kể, chu kỳ đào tạo nhanh hơn ngay cả khi các khối lượng dữ liệu tăng, và khả năng mở rộng mô hình lên hàng trăm lần khách hàng hơn.
Điều gì đã thúc đẩy quyết định của bạn để tham gia Anyscale tại giai đoạn này, và bạn nhìn thấy vai trò của Field CTO định hình việc áp dụng AI trong doanh nghiệp như thế nào?
Kinh nghiệm của tôi khi đưa Anyscale vào Attentive đã thay đổi cơ bản cuốn sổ tay của tôi để xây dựng các nền tảng ML. Trước đó, một phần đáng kể của kỹ thuật nền tảng là chi phí của việc khâu các hệ thống rời rạc lại với nhau. Với Anyscale, chúng tôi đã có thể loại bỏ nhiều phần chi phí đó và thay vào đó tập trung vào trải nghiệm của nhà phát triển, độ tin cậy và hiệu suất. Sự thay đổi đó đã có tác động lớn đến cả năng suất của đội và kết quả hệ thống. Việc tham gia Anyscale là một cơ hội để làm việc trên vấn đề đó toàn thời gian và giúp các tổ chức khác điều hướng qua sự chuyển đổi tương tự. Với vai trò Field CTO, vai trò của tôi thực sự là đưa những bài học từ thế giới thực và biến chúng thành các mẫu có thể lặp lại mà khách hàng của chúng tôi có thể áp dụng khi họ mở rộng AI.
Nhiều doanh nghiệp vẫn còn mắc kẹt trong giai đoạn “thử nghiệm” của AI. Từ quan điểm của bạn, điều gì cụ thể bị hỏng khi các công ty cố gắng mở rộng các thí nghiệm ban đầu này thành các hệ thống sản xuất?
Khi các công ty chuyển từ các thí nghiệm AI sang sản xuất, điều gì bị hỏng hiếm khi chỉ là mô hình — đó là hệ thống và hoạt động xung quanh. Trong một số trường hợp, các đội sớm đạt đến giới hạn cơ sở hạ tầng và không thể đào tạo hoặc phục vụ ở quy mô họ muốn. Họ phải giới hạn số lượng khách hàng hoặc trường hợp sử dụng mà mô hình của họ phục vụ như một kết quả. Thường xuyên hơn, các vấn đề xuất hiện trong sản xuất thông qua các trường hợp cạnh hoặc thay đổi dữ liệu. Một trong những điểm thất bại phổ biến nhất là bộ nhớ: khi kích thước dữ liệu, phân phối hoặc phương thức thay đổi, các công việc hết bộ nhớ và thất bại. Những vấn đề này khó dự đoán và thậm chí khó tự động phục hồi hơn. Thực tế là thất bại là không thể tránh khỏi trong sản xuất AI. Mục tiêu không phải là tránh nó hoàn toàn, mà là phát hiện nhanh, hiểu nó và xây dựng các hệ thống tự chữa lành để giải quyết nó trước khi nó ảnh hưởng đến doanh nghiệp.
Ray, khuôn khổ tính toán phân tán được tạo bởi đội đứng sau Anyscale, đang thu hút sự chú ý như một nền tảng cho các công việc AI. Tại sao việc thực hiện phân tán đang trở thành một lớp quan trọng trong cơ sở hạ tầng AI hiện đại?
Thực hiện phân tán và quản lý công việc đã trở thành yếu tố then chốt cho các đường ống AI. Các công việc AI hiện đại vốn song song và đòi hỏi nhiều tài nguyên. Đào tạo, suy luận và xử lý dữ liệu đều yêu cầu phối hợp một lượng lớn nhiệm vụ trên CPU và GPU, thường là động. Trong cảnh quan tính toán ngày nay, sự phức tạp của việc quản lý các công việc này trên tài nguyên khan hiếm là một gánh nặng hoạt động khổng lồ. Các hệ thống truyền thống không được thiết kế cho mức độ phức tạp hoặc quy mô này. Các khuôn khổ như Ray là quan trọng vì chúng cho phép các đội mở rộng công việc một cách mượt mà từ một máy đơn đến hàng nghìn nút bằng cách tự động hóa sự phối hợp cơ bản. Sự thay đổi này phản ánh một bước chuyển lớn hơn hướng tới tính toán bản địa AI, nơi cơ sở hạ tầng được thiết kế cụ thể cho các mẫu của các công việc AI thay vì được điều chỉnh từ các mô hình cũ hơn.
Khi nhiều công ty hơn áp dụng Ray thông qua nền tảng Anyscale, bạn thấy sự khác biệt gì giữa các tổ chức tiêu chuẩn hóa một cách tiếp cận thống nhất so với những tổ chức khâu các công cụ rời rạc lại với nhau?
Sự khác biệt giữa các nền tảng thống nhất và các công cụ rời rạc cuối cùng phụ thuộc vào sự tập trung và hiệu quả. Khi các đội dựa vào nhiều hệ thống không kết nối, họ dành một lượng thời gian đáng kể để khâu các hệ thống đó lại với nhau, quản lý sự không nhất quán và phản hồi với các sự cố trên các môi trường khác nhau. Điều này tạo ra chi phí hoạt động và làm chậm quá trình thử nghiệm. Ngược lại, một cách tiếp cận thống nhất cho phép các đội tập trung nỗ lực của họ vào việc cải thiện một hệ thống duy nhất, điều này dẫn đến độ tin cậy tốt hơn, hiệu suất mạnh mẽ hơn và trải nghiệm của nhà phát triển được简化 hơn. Nó cũng đơn giản hóa các quy trình gọi và gỡ lỗi vì các mẫu nhất quán và dễ hiểu hơn. Kết quả không chỉ là hiệu quả kỹ thuật, mà còn là sự rõ ràng của tổ chức.
Dựa trên kinh nghiệm xây dựng các nền tảng ML từ đầu đến cuối, bạn đánh giá trải nghiệm của nhà phát triển (DevEx) quan trọng như thế nào trong việc tăng tốc việc áp dụng AI trên các đội?
Trải nghiệm của nhà phát triển là một trong những lĩnh vực có ảnh hưởng lớn nhất để tăng tốc việc áp dụng AI. Khi các đội nền tảng đầu tư vào việc làm cho các hệ thống dễ sử dụng hơn thông qua các công việc tiêu chuẩn hóa, mẫu và giảm ma sát cơ sở hạ tầng, họ khuếch đại năng suất của mọi kỹ sư trong tổ chức. Điều này đặc biệt quan trọng trong AI, nơi tốc độ thay đổi cực kỳ nhanh và các đội cần phải lặp lại nhanh chóng để duy trì tính cạnh tranh. Cải thiện trải nghiệm của nhà phát triển trực tiếp dịch thành thử nghiệm nhanh hơn, thời gian sản xuất nhanh hơn và cuối cùng là tác động kinh doanh lớn hơn. Các công cụ mã hóa AI khuếch đại những nguyên tắc DevEx cơ bản này. Về nhiều cách, đó là cách tăng tốc độ trên toàn tổ chức một cách hiệu quả nhất.
Hiệu quả về chi phí đang trở thành một mối quan tâm lớn khi các công việc AI mở rộng. Một số cách bị bỏ qua nhất mà các doanh nghiệp có thể giảm chi phí cơ sở hạ tầng mà không ảnh hưởng đến hiệu suất là gì?
Khi các công việc AI mở rộng, quản lý chi phí trở nên quan trọng và phức tạp hơn. Một trong những thách thức bị bỏ qua nhiều nhất là cách nhanh chóng chi phí có thể tăng vọt do sự kém hiệu quả, đặc biệt là với cơ sở hạ tầng dựa trên GPU. Các cụm lớn có thể khởi động hàng nghìn nút, và nếu tài nguyên không được quản lý hoặc tắt đúng cách, chi phí sẽ tích lũy nhanh chóng. Điều này tạo ra một dạng lan rộng AI cụ thể, nơi sử dụng tính toán tăng nhanh hơn so với khả năng theo dõi hoặc kiểm soát của các đội. Để giải quyết vấn đề này, cần có sự kết hợp giữa quản lý mạnh mẽ, khả năng hiển thị và tự động hóa, chẳng hạn như tự động mở rộng, tự động kết thúc và quản lý tài nguyên tập trung. Ở quy mô, hiệu quả về chi phí không chỉ là một mối quan tâm hoạt động, mà còn là một phần cơ bản của thiết kế hệ thống.
Bạn đã làm việc trên mọi thứ, từ các cửa hàng tính năng đến các hệ thống suy luận thời gian thực. Bạn nghĩ sự cân bằng giữa các công việc AI theo lô và thời gian thực đang thay đổi như thế nào?
Sự cân bằng giữa các công việc AI theo lô và thời gian thực không thay đổi cơ bản — nó vẫn là một câu hỏi về yêu cầu kinh doanh. Xử lý theo lô thường có hiệu quả về chi phí hơn và dễ dàng hoạt động hơn, khiến nó phù hợp với nhiều trường hợp sử dụng. Các hệ thống thời gian thực thì cần thiết khi độ trễ ảnh hưởng trực tiếp đến trải nghiệm của người dùng hoặc kết quả kinh doanh, chẳng hạn như trong các ứng dụng trò chuyện hoặc phát hiện gian lận. Cả hai phương pháp sẽ tiếp tục cùng tồn tại, và chìa khóa cho các tổ chức là xây dựng các nền tảng có thể hỗ trợ cả hai một cách hiệu quả. Quyết định cuối cùng phụ thuộc vào sự cân bằng giữa chi phí, độ trễ và độ tin cậy.
Nhìn về tương lai, một nền tảng AI doanh nghiệp “chín” trông như thế nào trong 2-3 năm — và các công cụ như Ray và nền tảng như Anyscale phù hợp với tương lai đó như thế nào?
Trong vài năm tới, các nền tảng AI doanh nghiệp chín sẽ được định nghĩa bởi một số đặc điểm chính. Chúng sẽ dựa trên cơ sở hạ tầng thống nhất hỗ trợ toàn bộ vòng đời AI, từ xử lý dữ liệu đến đào tạo đến suy luận, thay vì một tập hợp các công cụ rời rạc. Chúng sẽ có hoạt động ngày 2 mạnh mẽ, với khả năng quan sát tự động, độ tin cậy và khả năng gỡ lỗi nhanh. Quản lý chi phí sẽ được dự đoán và quản lý, cho phép các tổ chức mở rộng một cách bền vững. Và có lẽ quan trọng nhất, chúng sẽ cho phép tốc độ của nhà phát triển cao, giúp các đội dễ dàng chuyển từ ý tưởng sang sản xuất nhanh chóng. Các nền tảng như Ray và Anyscale đóng vai trò trung tâm trong tương lai này bằng cách cung cấp nền tảng bản địa AI giúp đạt được mức độ quy mô và hiệu quả này.
Cảm ơn bạn vì cuộc phỏng vấn tuyệt vời, độc giả muốn tìm hiểu thêm có thể truy cập Anyscale.












