Phỏng vấn

Leo Brunnick, Giám đốc Sản phẩm tại Cloudera – Loạt phỏng vấn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Leo Brunnick, Giám đốc Sản phẩm tại Cloudera, là một nhà điều hành công nghệ dày dặn kinh nghiệm và doanh nhân với hơn ba thập kỷ kinh nghiệm trong việc xây dựng và mở rộng phần mềm, truyền thông kỹ thuật số và các tổ chức công nghệ doanh nghiệp. Tại Cloudera, ông lãnh đạo Quản lý Sản phẩm, Kỹ thuật và Hỗ trợ Khách hàng, giám sát hướng đi sản phẩm và công nghệ của công ty khi mở rộng khả năng nền tảng dữ liệu và AI. Trước khi gia nhập Cloudera vào năm 2025, Brunnick đã dành sáu năm tại Naviga, gần đây nhất là Giám đốc Vận hành, nơi ông dẫn dắt hơn 600 chuyên gia trong các lĩnh vực sản phẩm, kỹ thuật, marketing, R&D, hỗ trợ khách hàng và dịch vụ chuyên nghiệp. Trong giai đoạn đầu sự nghiệp, ông sáng lập và giữ vị trí CEO của Patheos, phát triển nền tảng truyền thông kỹ thuật số lên khoảng 15 triệu lượt truy cập hàng tháng trước khi thực hiện một thoái vốn thành công, và đã làm việc tám năm với vai trò Giám đốc Sản phẩm tại công ty quản lý nội dung doanh nghiệp Vignette. Bối cảnh của ông còn bao gồm tư vấn công nghệ tại Andersen Consulting và phục vụ như một sĩ quan bộ binh trong Lực lượng Thủy quân Lục chiến Hoa Kỳ.

Cloudera là một công ty dữ liệu doanh nghiệp và AI tập trung vào việc giúp các tổ chức quản lý, điều hành, phân tích và áp dụng AI vào dữ liệu bất kể nơi dữ liệu đó nằm — trên các đám mây công cộng, trung tâm dữ liệu riêng và môi trường biên. Nền tảng lai của nó kết hợp quản lý dữ liệu, phân tích, học máy, AI sinh tạo và ngày càng nhiều khả năng AI tự động trong khi nhấn mạnh bảo mật doanh nghiệp, quản trị, riêng tư và khả năng di chuyển khối lượng công việc. Chiến lược nền tảng hiện tại của công ty bao gồm Cloudera Anywhere Cloud, một kiến trúc được thiết kế để cung cấp cho doanh nghiệp trải nghiệm đám mây nhất quán trên các môi trường hạ tầng khác nhau, cùng với một lakehouse dữ liệu mở, lớp vải dữ liệu thống nhất, xử lý dữ liệu thời gian thực và các công cụ để phát triển và triển khai mô hình AI và các tác nhân. Cloudera cho biết công nghệ của mình quản lý hơn 25 exabyte dữ liệu và được các doanh nghiệp toàn cầu lớn sử dụng để hiện đại hóa hạ tầng dữ liệu mà không yêu cầu tất cả các khối lượng công việc hoặc dữ liệu nhạy cảm phải chuyển sang đám mây công cộng.

Hành trình sự nghiệp của bạn đã trải qua tư vấn công nghệ, lãnh đạo các tổ chức sản phẩm tại Vignette và Naviga, sáng lập và mở rộng Patheos, và hiện đang giữ vị trí Giám đốc Sản phẩm tại Cloudera. Những trải nghiệm đó đã hình thành cách bạn suy nghĩ về việc xây dựng các nền tảng công nghệ doanh nghiệp như thế nào trong thời điểm AI đang thay đổi căn bản cách các tổ chức sử dụng dữ liệu của họ?

Trong tất cả các tình huống đó, nguyên tắc giống nhau vẫn áp dụng. Công nghệ có giá trị nhất khi nó làm cho những thứ phức tạp trở nên dễ sử dụng hơn cho con người. Điểm này càng trở nên quan trọng hơn hiện nay, khi AI tạo ra những cơ hội đáng kể đồng thời thêm một lớp phức tạp nữa cho các doanh nghiệp đã đang điều hướng dữ liệu đám mây, trung tâm dữ liệu và ngày càng nhiều môi trường chủ quyền.

Khi chúng tôi xây dựng thời kỳ tiếp theo tại Cloudera, tôi thường suy nghĩ về cách chúng tôi có thể giúp các tổ chức hưởng lợi từ công nghệ mới mà không buộc họ phải suy nghĩ lại toàn bộ những gì họ đã xây dựng. Trong vài năm qua, các doanh nghiệp đã xây dựng các khu dữ liệu, ứng dụng, mô hình quản trị và quy trình vận hành của mình. Sẽ không hợp lý khi bỏ toàn bộ những thứ đó mỗi khi một công nghệ mới xuất hiện. Các nền tảng thành công trong thời đại AI sẽ dựa trên những gì các tổ chức đã có, đồng thời cung cấp cho họ sự linh hoạt và kiểm soát để thích nghi khi nhu cầu phát triển.

Cloudera gần đây đã giới thiệu Cloudera Anywhere Cloud để giúp các doanh nghiệp xây dựng và vận hành AI trên các đám mây công cộng, hạ tầng riêng, đám mây chủ quyền, môi trường tại chỗ và biên. Vấn đề nào bạn đã thấy ở khách hàng khiến Cloudera tin rằng kiến trúc thống nhất kiểu này là cần thiết?

Có áp lực ngày càng tăng lên khách hàng trong việc đưa AI vào thực tiễn, ngay cả khi dữ liệu và hạ tầng của họ được phân tán trên nhiều môi trường hơn bao giờ hết. Dữ liệu có thể tồn tại trên các đám mây công cộng, trung tâm dữ liệu riêng, môi trường chủ quyền và biên, mỗi nơi có yêu cầu bảo mật, quy định, hiệu suất và kinh tế riêng. Việc quản lý tất cả các môi trường này có thể tạo ra gánh nặng vận hành đáng kể cho các tổ chức.

Ý tưởng đằng sau Anywhere Cloud là các doanh nghiệp không nên phải lựa chọn giữa tính linh hoạt của đám mây và việc duy trì kiểm soát, bảo mật và quản trị dữ liệu của mình. Các tổ chức cần một cách nhất quán để triển khai, quản trị và mở rộng các dịch vụ dữ liệu và AI ở bất cứ nơi nào phù hợp nhất với doanh nghiệp. Với một mặt phẳng điều khiển duy nhất, các công ty có thể dành ít thời gian hơn để quản lý hạ tầng cơ sở và tập trung nhiều hơn vào các kết quả mà họ muốn đạt được với dữ liệu và AI, bất kể môi trường nào dữ liệu tồn tại.

Bạn đã nói rằng AI doanh nghiệp đã “vượt qua mô hình chỉ dùng đám mây công cộng”. Những hạn chế lớn nhất mà các doanh nghiệp gặp phải khi cố gắng chạy AI sản xuất hoàn toàn trong môi trường đám mây công cộng là gì, và những khối lượng công việc nào đang ngày càng chuyển sang các nơi khác?

Các nền tảng thành công trong thời đại AI sẽ dựa trên những gì các tổ chức đã có và cung cấp cho họ sự linh hoạt để thích nghi khi nhu cầu phát triển. Đám mây công cộng vẫn là một phần quan trọng của chiến lược công nghệ doanh nghiệp, nhưng không phải là lựa chọn duy nhất. Khi AI chuyển sang giai đoạn sản xuất, các công ty cần xác định nơi dữ liệu và khối lượng công việc của họ nên chạy dựa trên các yếu tố như quy định, bảo mật và chi phí.

Điều này cho thấy các quyết định về việc đặt tải trọng công việc đang được đưa ra một cách có chủ đích hơn. Một số ứng dụng AI chắc chắn phù hợp với đám mây công cộng, trong khi các tải trọng công việc liên quan đến dữ liệu nhạy cảm hoặc chịu quy định có thể phải ở lại trung tâm dữ liệu riêng hoặc môi trường chủ quyền. Trong một số trường hợp khác, các tải trọng công việc sẽ tốt hơn khi được đặt ở biên vì độ trễ là một yếu tố quan trọng. Mục tiêu không phải là rời bỏ đám mây công cộng; mà là cho phép doanh nghiệp linh hoạt chạy mỗi loại tải trọng công việc ở vị trí phù hợp nhất, mà không bị buộc phải tạo một mô hình vận hành riêng cho mỗi môi trường.

Cloudera Anywhere Cloud bao gồm một trợ lý copilot có khả năng tự động chuyển các yêu cầu ngôn ngữ tự nhiên thành quy trình dữ liệu và các hoạt động hạ tầng. Bạn kỳ vọng các hệ thống này sẽ trở nên tự chủ đến mức nào, và doanh nghiệp nên duy trì giám sát con người ở đâu khi các trợ lý ngày càng kiểm soát nhiều hơn hạ tầng dữ liệu quan trọng?

Các trợ lý sẽ tiếp tục thực hiện các công việc vận hành lặp đi lặp lại mà hiện đang chiếm thời gian của các đội dữ liệu và hạ tầng. Nếu một trợ lý có thể diễn đạt kết quả bằng ngôn ngữ tự nhiên và sau đó chuyển đổi thành một quy trình hoặc hành động hạ tầng, nó sẽ giảm đáng kể ma sát và làm cho các khả năng dữ liệu nâng cao trở nên sẵn có cho nhiều người hơn.

Sự tự chủ cao hơn cũng tạo ra nhu cầu lớn hơn về quản trị hiệu quả. Các công ty phải có các chính sách rõ ràng quy định trợ lý được phép truy cập gì, những hành động nào nó có thể thực hiện độc lập, và khi nào cần phê duyệt của con người. Ảnh hưởng tiềm năng càng lớn của một hành động, các kiểm soát càng trở nên quan trọng. Tự chủ và quản trị nên tiến triển song song để cung cấp cho trợ lý đủ tự do đạt được lợi nhuận năng suất thực sự, đồng thời đảm bảo tổ chức duy trì giám sát và kiểm soát dữ liệu và hạ tầng then chốt.

Cloudera đang hợp tác với NVIDIA để mang lại tăng tốc GPU bản địa thông qua cuDF cho các tải trọng công việc Apache Spark 4.1, với khả năng cải thiện hiệu năng lên tới 4 lần mà không yêu cầu các tổ chức phải viết lại các ứng dụng PySpark hoặc SQL hiện có. Tại sao việc loại bỏ nhu cầu viết lại mã lại quan trọng đối với việc tăng tốc độ áp dụng AI doanh nghiệp?

Các công ty đã đầu tư đáng kể vào các ứng dụng, kỹ năng và quy trình dữ liệu hiện có. Chuyển sang công nghệ mới đòi hỏi hơn chỉ công việc kỹ thuật. Nó có thể gây rủi ro, trì hoãn kết quả và tạo ra sự gián đoạn trên các hệ thống đã hoạt động.

Tăng tốc không mã giúp giải quyết thách thức này. Các tổ chức có thể sử dụng các tải trọng công việc PySpark và SQL hiện có để thu được lợi ích của tăng tốc GPU mà không cần thay đổi căn bản cách các đội ngũ của họ vận hành. Điều này làm cho công nghệ dễ tiếp nhận hơn đồng thời cải thiện hiệu năng của các quy trình dữ liệu hỗ trợ phân tích và AI và bảo vệ các khoản đầu tư hiện có.

GPU ngày càng được sử dụng không chỉ cho việc huấn luyện và suy luận mô hình, mà còn cho việc chuẩn bị dữ liệu và phân tích. Bạn có dự đoán tăng tốc GPU sẽ trở thành một phần tiêu chuẩn của ngăn xếp dữ liệu doanh nghiệp, và điều này có thể thay đổi kinh tế học của việc chuẩn bị các bộ dữ liệu khổng lồ cho AI như thế nào?

Theo quan điểm của tôi, các doanh nghiệp sẽ trở nên thành thạo hơn trong việc ghép nối hạ tầng với các tải trọng công việc của mình. GPU đã thay đổi cách thực hiện huấn luyện và suy luận mô hình, và kỹ thuật dữ liệu là lĩnh vực sáng tạo tiếp theo rõ ràng, vì việc chuẩn bị các bộ dữ liệu lớn có thể là một nút thắt quan trọng khi đưa các ứng dụng AI vào sản xuất.

Tác động kinh tế cũng quan trọng không kém, vì xử lý nhanh hơn có thể làm được nhiều hơn chỉ hoàn thành một công việc Spark nhanh hơn. Giảm thời gian chạy tính toán có thể hạ thấp chi phí hạ tầng đồng thời giúp các đội dữ liệu lặp lại nhanh hơn, một yếu tố ngày càng quan trọng khi tải trọng AI tăng lên. Theo nghiên cứu của chúng tôi, 84% người trả lời đã thấy tải trọng AI làm tăng chi phí hạ tầng, khiến việc doanh nghiệp xem xét toàn bộ quy trình dữ liệu để tìm cơ hội cải thiện cả hiệu năng và chi phí trở nên quan trọng hơn. Xử lý dữ liệu tăng tốc GPU có thể trở thành một phần quan trọng của phương trình này.

Một trong những lời hứa của Cloudera Anywhere Cloud là cho phép các tổ chức đặt tải trọng công việc ở bất kỳ nơi nào mà yêu cầu pháp lý, kinh tế hoặc vận hành quy định, mà không cần liên tục di chuyển hoặc sao chép dữ liệu. Việc đưa tính toán AI đến dữ liệu, thay vì đưa toàn bộ dữ liệu doanh nghiệp đến AI, quan trọng như thế nào?

Điều này là thiết yếu vì các doanh nghiệp đã dành nhiều năm xây dựng khối lượng dữ liệu khổng lồ trên các môi trường khác nhau, và việc di chuyển toàn bộ dữ liệu đó vào một nơi duy nhất cho AI thường không khả thi. Nó có thể tốn kém và mất thời gian, trong khi các yêu cầu về bảo mật, riêng tư hoặc chủ quyền có thể ngăn cản các tổ chức di chuyển một số dữ liệu hoàn toàn.

Hiện tại, không thực tế cho các doanh nghiệp di chuyển an toàn toàn bộ dữ liệu của mình đến các ứng dụng và môi trường khác nhau nơi AI đang được triển khai. Đưa AI đến dữ liệu cho phép các tổ chức sử dụng nhiều hơn dữ liệu hiện có mà vẫn giữ chúng ở vị trí cần thiết. Nó cũng mang lại sự linh hoạt để chạy tải trọng công việc ở nơi hợp lý nhất dựa trên yêu cầu kinh doanh và kỹ thuật. Khi AI ngày càng được nhúng sâu vào toàn bộ doanh nghiệp, khả năng vận hành nhất quán ở bất kỳ nơi nào dữ liệu tồn tại sẽ trở nên ngày càng quan trọng.

Sở hữu dữ liệu đã trở thành một mối quan tâm lớn khi các chính phủ và các ngành công nghiệp chịu quy định áp dụng AI. Các yêu cầu AI có tính chủ quyền đang thay đổi kiến trúc mà các doanh nghiệp cần như thế nào, và bạn có kỳ vọng các đám mây chủ quyền và hạ tầng AI riêng sẽ trở nên quan trọng đáng kể trong vài năm tới không?

Chắc chắn. Chủ quyền đang trở thành một yêu cầu kiến trúc, không chỉ là một vấn đề tuân thủ. Các tổ chức cần biết dữ liệu của họ được lưu trữ ở đâu và các khối tải AI của họ đang chạy ở đâu, cũng như ai có quyền truy cập và cách mà tài sản trí tuệ và thông tin nhạy cảm được bảo vệ.

Các tổ chức không còn có thể giả định rằng mọi thứ có thể được tập trung trong một đám mây công cộng duy nhất. Họ cần sự linh hoạt để vận hành trên các đám mây chủ quyền, hạ tầng riêng, đám mây công cộng và hệ thống tại chỗ đồng thời áp dụng quản trị nhất quán trên mỗi môi trường. Những yêu cầu này sẽ ngày càng quan trọng hơn khi AI tiến sâu hơn vào các ngành công nghiệp chịu quy định và các quy trình kinh doanh quan trọng. Các tổ chức có thể đổi mới đồng thời duy trì kiểm soát dữ liệu và môi trường AI sẽ có vị thế tốt hơn để mở rộng AI một cách có trách nhiệm.

Khi các tác nhân AI tự động có quyền truy cập vào dữ liệu doanh nghiệp, ứng dụng và hạ tầng, quản trị dữ liệu truyền thống có thể không còn đủ. Quản trị cần tiến triển như thế nào khi những người dùng truy cập và thực hiện trên dữ liệu doanh nghiệp ngày càng là các tác nhân AI chứ không phải con người?

Trong quá khứ, quản trị chủ yếu dựa trên con người và ứng dụng có khả năng truy cập dữ liệu. Các tác nhân bổ sung một khía cạnh mới, vì chúng có thể truy cập thông tin, suy luận về nó và thực hiện hành động dựa trên những gì chúng tìm thấy.

Vì vậy, các doanh nghiệp phải áp dụng các khái niệm như danh tính, quyền truy cập, nguồn gốc, khả năng quan sát và truy cập không tin cậy đối với các tác nhân để đảm bảo an ninh và quản trị dữ liệu của họ. Các tổ chức cần biết tác nhân nào đã truy cập dữ liệu nào, họ đã làm gì với thông tin đó, những hành động nào họ thực hiện, và liệu những hành động đó có phù hợp với chính sách công ty hay không. Quản trị không thể được đưa vào sau khi một tác nhân đã thực hiện hành động; nó phải được xây dựng trong môi trường để các chính sách và biện pháp bảo vệ di chuyển cùng dữ liệu và luôn được thực thi bất kể thực thể liên quan là người, ứng dụng hay tác nhân tự động.

Cloudera đang nhấn mạnh các tiêu chuẩn mở như Apache Iceberg, Polaris, Spark, Kafka và Trino thay vì yêu cầu khách hàng phải hoạt động hoàn toàn trong một ngăn xếp độc quyền. Khi hạ tầng AI tập trung quanh các nền tảng lớn, tiêu chuẩn mở và khả năng tương tác sẽ quan trọng như thế nào trong việc ngăn chặn một thế hệ mới của việc khóa vendor AI?

AI càng trở thành một phần của hạ tầng doanh nghiệp, tiêu chuẩn mở càng trở nên quan trọng. AI đang phát triển nhanh chóng, và các tổ chức cần tránh đưa ra các quyết định kiến trúc hôm nay có thể hạn chế các mô hình, engine, hạ tầng hoặc công nghệ họ có thể sử dụng trong tương lai.

Các công nghệ như Apache Iceberg, Spark, Kafka, Trino và các catalog mở mang lại cho các tổ chức sự linh hoạt trong việc sử dụng các công cụ khác nhau cho các khối tải khác nhau đồng thời duy trì khả năng tương tác trên môi trường dữ liệu của họ. Điều này đặc biệt quan trọng khi các doanh nghiệp ngày càng vận hành trên các đám mây công cộng, hạ tầng chủ quyền và trung tâm dữ liệu riêng, nơi họ cần tự do quyết định nơi dữ liệu và khối tải AI chạy mà không phải xây dựng lại quanh một nhà cung cấp duy nhất.

Một cách tiếp cận mở cũng giúp dễ dàng hơn trong việc áp dụng các khả năng AI mới đồng thời dựa trên các khoản đầu tư hiện có, thay vì phải liên tục di chuyển hoặc sao chép dữ liệu khi công nghệ phát triển. Khi bối cảnh AI tiếp tục thay đổi, các tiêu chuẩn mở mang lại cho các tổ chức sự linh hoạt để phát triển kiến trúc theo thời gian đồng thời duy trì sự lựa chọn và kiểm soát đối với dữ liệu, hạ tầng và các quyết định công nghệ của họ.

Cảm ơn bạn đã tham gia phỏng vấn tuyệt vời, độc giả muốn tìm hiểu thêm nên truy cập Cloudera.

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.