Phỏng vấn
Jeronimo De Leon, Trưởng nhóm sản phẩm AI tại Backblaze – Loạt bài phỏng vấn

Jeronimo De Leon là một nhà lãnh đạo quản lý sản phẩm giàu kinh nghiệm với hơn 10 năm kinh nghiệm trong việc thúc đẩy đổi mới dựa trên AI trong môi trường doanh nghiệp và khởi nghiệp. Hiện tại, ông đang giữ vị trí Trưởng nhóm sản phẩm AI tại Backblaze, nơi ông dẫn đầu việc phát triển các tính năng AI/ML, tập trung vào cách Backblaze nâng cao chu kỳ sống của dữ liệu AI cho kiến trúc MLOps của khách hàng và triển khai các công cụ và tác nhân AI để tối ưu hóa hoạt động nội bộ.
Backblaze là một công ty lưu trữ và sao lưu đám mây cung cấp sao lưu tự động không giới hạn cho cá nhân và doanh nghiệp, cùng với các giải pháp lưu trữ đối tượng có thể mở rộng cho các khối lượng công việc doanh nghiệp, truyền thông và ứng dụng. Dịch vụ của họ tập trung vào tính khả dụng, bảo mật dữ liệu, phục hồi dễ dàng và tương thích mượt mà với các hệ thống hiện có.
Bạn mang lại hơn một thập kỷ kinh nghiệm trong quản lý sản phẩm dựa trên AI – từ làm việc với LLMs tại Intelas và RAG tại Welcome.AI đến việc ra mắt chatbot của Bloomberg và hiện đang dẫn đầu nỗ lực AI tại Backblaze. Những kinh nghiệm này đã định hình quan điểm của bạn về vai trò của lưu trữ đám mây trong việc mở rộng quy mô các công việc AI/ML như thế nào?
Kể từ khi bắt đầu các dự án AI tại IBM Watson, tôi đã thấy tốc độ đổi mới tăng tốc đáng kể. Những gì trước đây mất nhiều năm để chuyển từ nghiên cứu sang sản xuất hiện nay chỉ mất vài tháng. Tuy nhiên, các thách thức cơ bản về cơ sở hạ tầng vẫn còn giống nhau: dữ liệu ở đâu, chúng ta lưu trữ nó ở đâu và làm thế nào để truy cập nó một cách hiệu quả?
Trước đây, các hạn chế là tính toán và mô hình, nhưng hiện nay chúng ta có rất nhiều mô hình đã được đào tạo trước và có nhiều nhà cung cấp tính toán. Tuy nhiên, khi bắt đầu một dự án trước đây, chúng ta thường phải bắt đầu với một dự án thu thập và xử lý dữ liệu, điều đó vẫn còn giống nhau ngày nay. Tôi liên tục thấy các tổ chức gặp phải cùng một nút thắt về việc hợp nhất dữ liệu từ các nguồn khác nhau. Các tổ chức thành công là những tổ chức giải quyết vấn đề truy cập dữ liệu sớm, tạo ra một nền tảng có thể mở rộng cùng với sự trưởng thành của AI. Các quyết định về kiến trúc lưu trữ của bạn sẽ quyết định tốc độ bạn có thể chuyển sang đào tạo mô hình và đổi mới.
Bạn thấy lưu trữ đám mây đóng vai trò quan trọng nhất ở đâu trong chu kỳ sống của AI – từ thu thập và xử lý dữ liệu đến đào tạo, tinh chỉnh, suy luận và giám sát?
Lưu trữ đám mây rất quan trọng trong toàn bộ chu kỳ sống của AI, với các giai đoạn quan trọng trong việc thu thập, xử lý, đào tạo và suy luận dữ liệu. Ở giai đoạn đầu, việc hợp nhất, lập danh mục và bảo mật các kho lưu trữ một cách hệ thống giúp tăng tốc các dự án mới và làm cho việc thử nghiệm các mô hình mới trở nên dễ dàng. Dữ liệu sạch, được xử lý tốt thường đánh bại việc chỉ có nhiều dữ liệu, điều này làm cho lưu trữ trở thành trung tâm của cả chất lượng và quy mô. Một trong những câu nói yêu thích của Backblaze là: “Không phải là tích trữ nếu đó là dữ liệu.” Bạn không bao giờ biết nó sẽ có giá trị như thế nào, vì vậy các tổ chức nên thu thập càng nhiều càng tốt. Trong quá trình đào tạo, lưu trữ có thể mở rộng đảm bảo luồng dữ liệu lớn, và trong quá trình suy luận, việc捕获 đầu ra dự đoán và phản hồi của người dùng cho phép sự lặp lại liên tục. Cuối cùng, lưu trữ là nền tảng quyết định tốc độ bạn có thể đổi mới với AI.
Những trở ngại lớn nhất mà các tổ chức gặp phải khi mở rộng quy mô lưu trữ cho AI là gì, và làm thế nào những thách thức này khác nhau giữa các công ty khởi nghiệp nhỏ và các doanh nghiệp lớn?
Những trở ngại lớn nhất trong việc mở rộng quy mô lưu trữ cho AI là chi phí, quản lý dữ liệu và khả năng truy cập. Lưu trữ khối lượng lớn dữ liệu chỉ là một phần của thách thức; nó cũng phải được tổ chức, có thể truy cập và quản lý với các kiểm soát phù hợp. Dữ liệu sạch, được cấu trúc tốt thường có giá trị hơn là chỉ có nhiều dữ liệu.
Đối với các công ty khởi nghiệp, thách thức ban đầu là thu thập đủ dữ liệu để đào tạo và tinh chỉnh mô hình của họ. Một khi họ có nó, chi phí và kiến trúc trở thành những rào cản tiếp theo.
Đối với các doanh nghiệp lớn, thách thức là sự phức tạp. Dữ liệu của họ dồi dào nhưng bị phân mảnh trên các silo, hệ thống cũ và các chế độ tuân thủ, khiến việc hợp nhất và truy cập trở nên khó khăn.
Các tổ chức thành công coi lưu trữ như một công cụ chiến lược giúp mở rộng quy mô về chi phí, hiệu suất và khả năng truy cập cùng với sự trưởng thành của AI.
Trong số chi phí, độ trễ, bảo mật và tuân thủ, bạn thấy rào cản nào là quan trọng nhất đối với việc mở rộng quy mô AI ngày nay, và làm thế nào các tổ chức nên ưu tiên giải quyết nó?
Trong số chi phí, độ trễ, bảo mật và tuân thủ, độ trễ là một trong những rào cản quan trọng nhất. Nó ảnh hưởng trực tiếp đến cả đào tạo mô hình và suy luận, và suy luận đặc biệt ảnh hưởng đến trải nghiệm người dùng. Các tổ chức làm mọi thứ có thể để giảm độ trễ ở giai đoạn này, vì sự chậm trễ trong việc cung cấp dự đoán có thể làm suy yếu việc áp dụng.
Chi phí vẫn là một thách thức liên tục khi khối lượng dữ liệu tăng trưởng, và tuân thủ trở nên quan trọng hơn khi các tổ chức mở rộng quy mô, đặc biệt là trong các ngành công nghiệp có quy định. Các công ty khởi nghiệp thường tập trung đầu tiên vào chi phí và độ trễ, trong khi các doanh nghiệp lớn phải cân bằng độ trễ với quản trị và nhu cầu quy định. Ưu tiên nên là xây dựng lưu trữ để giảm thiểu độ trễ cho đào tạo và suy luận, đồng thời vẫn đảm bảo hiệu quả về chi phí và tuân thủ khi áp dụng AI mở rộng.
Các doanh nghiệp thường nhấn mạnh nhu cầu về tính linh hoạt và khả năng truy cập dễ dàng vào dữ liệu để thúc đẩy đổi mới AI. Từ quan điểm của bạn, tính linh hoạt thực sự trong truy cập dữ liệu trông như thế nào, và tại sao nó lại quan trọng như vậy?
Trong một bài nói gần đây, tôi đã nhấn mạnh ý tưởng về việc lưu trữ thông minh. Tính linh hoạt thực sự trong truy cập dữ liệu bắt đầu với việc tập trung thông tin vào một kho lưu trữ có cấu trúc, có thể tìm kiếm. Điều đó có nghĩa là thống nhất các định dạng đa dạng, chuẩn hóa và gắn thẻ cho sự nhất quán, và cho phép lập chỉ mục để truy vấn trong tương lai. Cách tiếp cận này đảm bảo rằng dữ liệu không chỉ được lưu trữ mà còn được làm cho có thể sử dụng.
Nó rất quan trọng vì nó đặt nền tảng cho phân tích và mô hình hóa. Khi dữ liệu được cấu trúc và có thể tìm kiếm, các đội có thể di chuyển nhanh hơn, thử nghiệm tự do hơn và giảm độ trễ trong cả đào tạo và suy luận. Nếu không có tính linh hoạt này, lưu trữ nhanh chóng trở thành một nút thắt chứ không phải là một công cụ cho đổi mới AI.
Bạn có thể chia sẻ các ví dụ thực tế – như với khách hàng như Decart AI hoặc Wynd Labs – để chứng minh cách tiếp cận lưu trữ đám mây phù hợp có thể trực tiếp kích hoạt đổi mới AI?
Đây là hai ví dụ tuyệt vời về cách tiếp cận lưu trữ đám mây phù hợp có thể trực tiếp kích hoạt đổi mới AI. Decart tập trung vào đào tạo mô hình, nơi di chuyển dữ liệu đến tính toán một cách hiệu quả là rất quan trọng. Với Backblaze B2, họ đã mở rộng quy mô lên 16PB trong 90 ngày, đào tạo trên nhiều cụm GPU với chi phí không có dữ liệu ra và đạt được hiệu quả gấp 10 lần so với các đối thủ. Tính tin cậy và hiệu quả đó đã giải phóng họ để đổi mới nhanh hơn.
Wynd Labs tập trung vào khả năng truy cập dữ liệu của khách hàng. Họ tiêu thụ petabyte mỗi ngày và phục vụ hàng chục petabyte mỗi tháng. Với hiệu suất cao và không có chi phí ra của Backblaze, họ có thể mở rộng quy mô để đáp ứng nhu cầu của doanh nghiệp và tái đầu tư tài nguyên vào phát triển sản phẩm. Khả năng cung cấp truy cập dữ liệu ở quy mô đó đã mở ra cơ hội mới cho nền tảng của họ.
Cả hai trường hợp đều chứng minh rằng chiến lược lưu trữ phù hợp đã biến cơ sở hạ tầng từ một hạn chế thành một công cụ cho đổi mới, cho phép các công ty tập trung vào đổi mới AI thay vì quản lý chi phí và phức tạp.
Khi các mô hình AI và tập dữ liệu trở nên phức tạp hơn, bạn sẽ đưa ra lời khuyên gì cho các tổ chức đang cố gắng cân bằng hiệu suất lưu trữ với hiệu quả về chi phí?
Các tổ chức cần nghĩ về việc sử dụng dữ liệu lâu dài của họ cùng với sản phẩm của họ. Việc thu thập, xử lý, di chuyển và chạy suy luận trên dữ liệu sẽ là cốt lõi của cách sản phẩm của họ phát triển. Nếu họ không tính đến điều đó ngay bây giờ, chi phí và thách thức về lưu trữ sẽ chỉ tăng lên theo thời gian. Vì AI sẽ là một phần trung tâm của sản phẩm và tổ chức của họ, lưu trữ phải được thiết kế sớm để cân bằng hiệu suất với hiệu quả về chi phí để nó có thể mở rộng quy mô một cách mượt mà khi họ phát triển.
Bảo mật và tuân thủ đặc biệt quan trọng trong các ngành công nghiệp có quy định. Bạn thấy lưu trữ đám mây sẽ phát triển như thế nào để hỗ trợ các nhu cầu quản trị trong khi vẫn cho phép các đội đổi mới nhanh?
Quản trị là một phần quan trọng của lưu trữ. Việc đơn giản hóa truy cập với một nền tảng vững chắc cho cách dữ liệu được quản lý, bảo mật và kiểm toán là rất quan trọng. Tôi thấy lưu trữ đám mây đang phát triển với các kiểm soát tích hợp mạnh mẽ hơn như mã hóa mặc định, quyền truy cập chi tiết, nhật ký kiểm toán và các tùy chọn cư trú dữ liệu. Không kém phần quan trọng là dòng dõi dữ liệu. Trong AI, việc biết dữ liệu đến từ đâu, nó đã được xử lý như thế nào và nó cung cấp cho các mô hình như thế nào là rất quan trọng cho cả tuân thủ và niềm tin.
Đồng thời, các nền tảng lưu trữ đang cải thiện khả năng sử dụng để các đội có thể di chuyển nhanh. Khi quản trị, dòng dõi và khả năng truy cập làm việc cùng nhau, các tổ chức có thể đáp ứng các yêu cầu quy định trong khi vẫn tiếp tục đổi mới với AI ở tốc độ.
Đối với các tổ chức đang đánh giá hoặc di chuyển đến B2, bạn sẽ đưa ra lời khuyên hoặc hướng dẫn gì về việc triển khai – đặc biệt là liên quan đến việc di chuyển dữ liệu, tích hợp với các ngăn xếp MLOps hoặc tính toán hiện có, hoặc tối ưu hóa cho thông lượng và egress?
Vì B2 tương thích với S3, nó tích hợp trực tiếp vào các ngăn xếp MLOps và tính toán hiện có mà không cần kiến trúc lại. Chúng tôi thường làm việc với khách hàng về một概念 kiểm tra để xác nhận việc di chuyển, hiệu suất và tích hợp trước khi mở rộng quy mô. Từ đó, trọng tâm là tối ưu hóa thông lượng, di chuyển dữ liệu và điều phối dữ liệu để các đội có thể đào tạo trên các cụm, chạy suy luận và lặp lại nhanh mà không bị chậm lại bởi các nút thắt cơ sở hạ tầng.
Khi các khối lượng công việc AI tiếp tục mở rộng – đặc biệt là với các xu hướng xung quanh LLMs, tập dữ liệu quy mô exabyte và chiến lược đa đám mây hoặc kết hợp – Backblaze đang phát triển các dịch vụ lưu trữ của mình như thế nào để đáp ứng các nhu cầu mới nổi này?
Tại Backblaze, chúng tôi tập trung không chỉ vào cách dữ liệu được sử dụng ngày nay mà còn vào cách nó sẽ được điều phối trong tương lai. Lưu trữ không chỉ là một kho lưu trữ; nó đang trở thành một công cụ cho phép truy cập nhanh, di chuyển hiệu quả và điều phối đáng tin cậy dữ liệu trên các môi trường. Với LLMs và tập dữ liệu quy mô exabyte, nền tảng này về khả năng truy cập dễ dàng và thông lượng cao sẽ rất quan trọng không chỉ cho đào tạo và suy luận mà còn cho lớp các tác nhân AI mới nổi đang dựa vào dữ liệu để làm cho các quy trình tự động hóa. Kết quả là một nền tảng lưu trữ cho phép đổi mới ngay bây giờ và chuẩn bị cho các tổ chức cho những gì tiếp theo.
Cảm ơn bạn vì cuộc phỏng vấn tuyệt vời, độc giả muốn tìm hiểu thêm có thể truy cập Backblaze.












