Phỏng vấn
Corey Sanders, Phó Chủ tịch Sản phẩm tại CoreWeave – Loạt Phỏng vấn

Corey Sanders, Phó Chủ tịch Sản phẩm tại CoreWeave (CRWV ), dẫn đầu chiến lược sản phẩm và thực hiện cho một trong những nền tảng đám mây tập trung vào AI phát triển nhanh nhất. Ông chịu trách nhiệm mở rộng đổi mới, tạo ra các giải pháp được thiết kế riêng cho khách hàng và tăng cường vị thế của CoreWeave trên thị trường cơ sở hạ tầng AI. Trước khi đến CoreWeave, Sanders đã dành hai thập kỷ tại Microsoft (MSFT ) trong các vai trò lãnh đạo cấp cao bao gồm kỹ thuật đám mây, nền tảng cụ thể cho ngành, chiến lược giải pháp thương mại và quan hệ đối tác doanh nghiệp lớn, với kinh nghiệm sâu sắc trong việc kết nối thực hiện kỹ thuật và chiến lược tiếp thị.
CoreWeave là một nhà cung cấp đám mây bản địa AI được xây dựng đặc biệt cho tính toán hiệu suất cao và các công việc AI quy mô lớn. Công ty này vận hành một mạng lưới trung tâm dữ liệu đang mở rộng nhanh chóng trên khắp Hoa Kỳ và châu Âu, cung cấp cơ sở hạ tầng và phần mềm được thiết kế cho đào tạo AI, suy luận, và các trường hợp sử dụng tính toán tiên tiến. Bằng cách tập trung vào kiến trúc được thiết kế riêng thay vì đám mây chung, CoreWeave đã trở thành một đối tác cơ sở hạ tầng quan trọng cho các phòng thí nghiệm AI và doanh nghiệp đang tìm kiếm hiệu suất, khả năng mở rộng và hiệu quả ở quy mô lớn.
Bạn đã dành hơn 20 năm tại Microsoft làm việc trên các dự án kỹ thuật Windows, chiến lược bán hàng đám mây, và Microsoft Cloud cho Ngành. Điều gì mà sự tiến bộ đó đã dạy bạn về những gì thực sự thúc đẩy việc áp dụng doanh nghiệp, và bạn đang áp dụng những bài học đó như thế nào tại CoreWeave?
Việc áp dụng doanh nghiệp bắt đầu bằng việc giải quyết một vấn đề cụ thể của khách hàng. Đổi mới vì lợi ích của đổi mới không thực sự quan trọng đối với doanh nghiệp. Điều quan trọng là đặt mình vào vị trí của họ để hiểu những gì thực sự gây khó khăn cho họ – dù đó là chi phí hỗ trợ, sự phức tạp của hoạt động, kết nối với khách hàng, hoặc quản lý các đội toàn cầu và dòng sản phẩm mới – và sau đó cung cấp các dịch vụ giúp họ. Họ thường sẵn sàng áp dụng phương pháp đổi mới, nhưng điều quan trọng nhất là giúp họ giải quyết vấn đề của mình. Lỗi phổ biến nhất mà tôi đã thấy trong thiết kế sản phẩm là quá tập trung vào sự “cool” của sản phẩm. Mặc dù điều đó có trọng lượng trong không gian tiêu dùng, nhưng khách hàng doanh nghiệp cuối cùng quan tâm nhiều hơn đến tính hữu ích hơn là sự “cool”.
CoreWeave thường được mô tả là cung cấp cơ sở hạ tầng AI được thiết kế riêng. Về mặt thực tế, điều đó có nghĩa là gì từ góc độ sản phẩm, và các nền tảng đám mây chung gặp khó khăn như thế nào với các công việc AI?
Lợi thế lớn nhất của việc được thiết kế riêng là khả năng tập trung và cung cấp dịch vụ mà không cần giải quyết mọi trường hợp sử dụng chung. Tôi sẽ đưa ra hai ví dụ: một trong phần mềm và một trong phần cứng.
Về phía phần mềm, dịch vụ Lưu trữ Đối tượng của chúng tôi với bộ nhớ đệm LOTA tập trung cụ thể vào việc đệm cho các công việc AI. Nó triển khai trực tiếp trên các nút GPU, cung cấp điểm cuối S3 cho ứng dụng và phản hồi các yêu cầu GPU bằng cách mở rộng bộ nhớ đệm của nó trên nhiều nút. Điều này làm tăng lưu lượng dữ liệu lên đến 7 GB/s, vượt xa so với những gì các đám mây chung cung cấp. Chúng tôi có thể đạt được điều này vì chúng tôi đưa ra các giả định về thiết kế xung quanh các công việc AI cụ thể, phân chia đọc/ghi và bố cục cụm. Nếu khách hàng sử dụng điều này để lưu trữ một cơ sở dữ liệu hoặc một trang web thương mại điện tử, nó sẽ không có tác động tương tự. Đó là định nghĩa của phần mềm được thiết kế riêng.
Ví dụ về phần cứng tương tự. Với việc triển khai rộng rãi các SKU NVIDIA (NVDA ) mới nhất – nhiều trong số đó yêu cầu làm mát bằng chất lỏng – CoreWeave đã xây dựng chuyên môn và thiết kế trung tâm dữ liệu cụ thể để hỗ trợ những nhu cầu đó. Không giống như các đám mây lớn hơn xây dựng cho tính linh hoạt và sau đó phải thêm làm mát bằng chất lỏng một cách hồi cứu, CoreWeave xây dựng các trung tâm dữ liệu tập trung vào AI từ đầu. Điều này dẫn đến chi phí thấp hơn và khả năng sẵn sàng cao hơn cho các loại SKU mới nhất.
Dưới đây là hình ảnh của bộ nhớ đệm LOTA được đề cập.

Khi khách hàng lần đầu tiên nghĩ về việc mở rộng quy mô AI, nhiều người tin rằng họ chỉ cần truy cập vào GPU. Điều gì mà họ thường nhận ra mình đang thiếu khi bắt đầu đào tạo hoặc cung cấp mô hình ở quy mô lớn?
Nhìn xét sự phức tạp của việc chạy các công việc trên các cụm GPU lớn, các dịch vụ xung quanh trở thành những yếu tố quyết định thành công thực sự. Điều này bao gồm cả những dịch vụ rõ ràng như lưu trữ và mạng, nhưng cũng bao gồm các dịch vụ hoạt động quan trọng như quan sát, điều phối và bảo mật. Đây là nơi CoreWeave thực sự tỏa sáng với dịch vụ Mission Control của chúng tôi. Nó cung cấp cho khách hàng sự hiểu biết sâu sắc về sức khỏe của nút và thời gian chạy trên toàn bộ đội tàu của họ, tích hợp trực tiếp kiến thức đó vào động cơ điều phối. Điều này cho phép khách hàng đối xử với cơ sở hạ tầng của mình không phải là 1.000 GPU riêng lẻ, mà là một thực thể công việc gắn kết duy nhất.
Điều gì là ưu tiên hàng đầu về sản phẩm mà bạn đang tập trung vào để cải thiện kết quả cho khách hàng, cho dù đó là hiệu suất, độ tin cậy, dự đoán chi phí, hay trải nghiệm của nhà phát triển?
Trong nền tảng cốt lõi, chúng tôi luôn tập trung vào hiệu suất, độ tin cậy và khả năng quan sát. Chúng tôi phải đảm bảo rằng khách hàng có thể chạy công việc theo cách có thể lặp lại và dự đoán, đồng thời tận dụng mọi TFLOP trong mỗi GPU. Ngoài ra, chúng tôi đang làm việc để đơn giản hóa quá trình tích hợp cho khách hàng có thể không quen thuộc với mọi tính năng của một công cụ như SLURM (mà mọi người đều sử dụng, nhưng gần như mọi người đều ghét). Cuối cùng, chúng tôi đang phát triển các dịch vụ và mô hình hóa đơn bổ sung để làm cho việc đổi mới và bắt đầu dễ dàng hơn. Hiện tại, việc thử nghiệm là khá khó khăn do các rào cản cao như hạn chế khả năng, cam kết ba năm, và nhu cầu về chuyên gia chuyên sâu chỉ để bắt đầu. Chúng tôi muốn mang lại sự dễ dàng đổi mới trở lại nền tảng AI.
Khi ngày càng nhiều công việc AI chuyển từ đào tạo nặng sang suy luận nặng, sự chuyển đổi này ảnh hưởng đến thiết kế cơ sở hạ tầng và quyết định về lộ trình sản phẩm như thế nào?
Điều đó tạo ra cơ hội đáng kể để áp dụng sự khác biệt hiện có của CoreWeave vào các yêu cầu suy luận. Ví dụ, bộ nhớ đệm LOTA mà tôi đã đề cập tập trung vào việc cung cấp dữ liệu cho GPU trong quá trình đào tạo; tuy nhiên, chúng tôi có thể lấy công nghệ đó, tích hợp nó vào các thứ như KVCache, và biến nó thành một yếu tố khác biệt mạnh mẽ cho suy luận. Tương tự, các công cụ như Mission Control trở nên quan trọng hơn cho suy luận, vì việc quan sát sức khỏe của GPU là rất quan trọng để chạy các ứng dụng có tính sẵn sàng cao.
Trong một đến hai năm tới, điều gì sẽ định nghĩa sự lãnh đạo trong thị trường đám mây AI, và những khả năng nào sẽ quan trọng nhất đối với khách hàng?
Tôi nghĩ rằng sự lãnh đạo sẽ được định nghĩa bởi hai điều. Thứ nhất là việc cung cấp các yêu cầu về quy mô ngày càng tăng cho đào tạo. Điều này sẽ đòi hỏi sự tiến bộ trong khả năng quan sát, giám sát sức khỏe và khả năng phục hồi tự động. Khi bạn chuyển từ hàng trăm đến hàng chục nghìn GPU phân bố toàn cầu, việc phản hồi thủ công với các sự cố là điều không thể.
Thứ hai là việc cung cấp các dịch vụ đúng cho suy luận và các công việc có tính chủ động. Điều này đòi hỏi khả năng triển khai toàn cầu và các mô hình kinh doanh khuyến khích thử nghiệm. Mẫu sử dụng này là điều đã giúp đám mây phát triển ban đầu, và nó đã bị mất đi một chút trong thời đại AI. Chúng tôi cần mang nó trở lại thông qua sự hỗ trợ nền tảng tốt hơn, khả năng đa đám mây và sự dễ sử dụng đa khu vực.
Bạn trước đây đã lãnh đạo các sáng kiến đám mây cụ thể cho ngành, bao gồm chăm sóc sức khỏe, bán lẻ, dịch vụ tài chính, sản xuất và đám mây chủ quyền. Những bài học từ các lĩnh vực đó có thể chuyển trực tiếp sang cơ sở hạ tầng AI, và những gì không?
Các thay đổi thế hệ trong GPU tiếp tục giới thiệu những sự phức tạp mới. Mỗi bản phát hành mới mang lại sự kết nối tăng, bộ nhớ cao hơn và nhu cầu về năng lượng lớn hơn, tất cả đều đòi hỏi chúng tôi phải xem xét lại các giả định về cách các nút được kết nối và phần mềm được cung cấp. Chúng tôi phải tiếp tục tập trung vào công việc này để duy trì vị trí lãnh đạo của mình. Mặt khác, khu vực đang cải thiện nhanh nhất là tốc độ mà khách hàng có thể thích nghi với các chân đế tính toán lớn hơn; tốc độ họ đang thích nghi với các chân đế tính toán lớn hơn là ấn tượng.
Khi các trung tâm dữ liệu và cụm AI tiếp tục mở rộng quy mô, những thách thức hoạt động nào đang chứng minh là khó giải quyết nhất hiện nay, và những thách thức nào đang cải thiện nhanh nhất?
Các thay đổi thế hệ của GPU tiếp tục tạo ra những sự phức tạp mới trong thiết kế và phần mềm. Mỗi bản phát hành GPU mới đi kèm với khả năng kết nối tăng, bộ nhớ cao hơn, nhu cầu về năng lượng lớn hơn, v.v., đòi hỏi chúng tôi phải xem xét lại các giả định về cách các nút được kết nối, cách các giá đỡ được quản lý và cách phần mềm được cung cấp. Chúng tôi sẽ cần tiếp tục tập trung vào công việc này để đảm bảo rằng chúng tôi duy trì vị trí lãnh đạo của mình. Những thách thức đang cải thiện nhanh nhất là những gì khách hàng có thể đạt được với sự mở rộng quy mô của tính toán.
Trong cơ sở hạ tầng AI, độ tin cậy vượt quá thời gian hoạt động. CoreWeave định nghĩa độ tin cậy như thế nào, và những chỉ số nào phản ánh thành công tốt nhất từ góc độ khách hàng?
Ở quy mô lớn, yếu tố quan trọng nhất đối với khách hàng là đơn giản là hoàn thành công việc. Trong các hoạt động lớn, các sự cố hoặc chậm trễ cá nhân là điều dự kiến. Khóa là cách chúng tôi phát hiện và phản hồi tự động với những vấn đề đó để đảm bảo công việc được hoàn thành bất chấp những thách thức. Đây là lý do tại sao chúng tôi tích hợp Mission Control vào các dịch vụ cấp cao hơn như SUNK (Slurm trên Kubernetes). Nó cho phép khách hàng phản hồi với các sự cố tự động mà không mất hàng giờ hoặc hàng tuần công việc. Đối với chúng tôi, thành công không chỉ là về thời gian hoạt động của nút; đó là về thành công của công việc.
Nhìn về tương lai, bạn tin rằng sự thay đổi lớn nào trong cơ sở hạ tầng AI vẫn chưa được đánh giá cao, cho dù liên quan đến sự tiến hóa của phần cứng, chuyên môn hóa của các ngăn xếp, yêu cầu về chủ quyền, hay các mô hình triển khai mới?
Tôi tin rằng sự xuất hiện của Học tăng cường (RL) như một phần quan trọng của ngăn xếp AI vẫn chưa được đánh giá cao. Mặc dù không phải là một lĩnh vực nghiên cứu mới, nhưng nó đã bị lu mờ trong làn sóng đầu tiên của sự phát triển LLM. RL đang trở lại và sẽ đóng vai trò quan trọng trong việc làm cho các dịch vụ AI trở nên phản ứng hơn với các phong cảnh thay đổi của người dùng. Vì vậy, chúng tôi rất hào hứng về dịch vụ RL không máy chủ mà chúng tôi có ngày hôm nay.
Cảm ơn vì cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm nên truy cập CoreWeave.












