Phỏng vấn
Tiến sĩ Stavros Papadopoulos, Người sáng lập và Giám đốc điều hành, TileDB – Loạt phỏng vấn

TileDB là cơ sở dữ liệu hiện đại tích hợp tất cả các loại dữ liệu, mã và tính toán trong một sản phẩm duy nhất. TileDB được tách ra từ MIT và Intel (INTC ) Labs vào tháng 5 năm 2017.
Trước khi thành lập TileDB, Inc. vào tháng 2 năm 2017, Tiến sĩ Stavros Papadopoulos là Nhà khoa học nghiên cứu cấp cao tại Phòng thí nghiệm tính toán song song của Intel và là thành viên của Trung tâm Khoa học và Công nghệ Intel về Dữ liệu lớn tại MIT CSAIL trong ba năm. Ông cũng đã dành khoảng hai năm làm Giảng viên trợ lý tại Khoa Khoa học và Kỹ thuật Máy tính của Đại học Khoa học và Công nghệ Hồng Kông (HKUST). Stavros nhận bằng tiến sĩ về Khoa học Máy tính tại HKUST dưới sự hướng dẫn của Giáo sư Dimitris Papadias và từng giữ vị trí nghiên cứu sau tiến sĩ tại Đại học Hồng Kông với Giáo sư Yufei Tao.
Bạn trước đây là Nhà khoa học nghiên cứu cấp cao tại Phòng thí nghiệm tính toán song song của Intel và là thành viên của Trung tâm Khoa học và Công nghệ Intel về Dữ liệu lớn tại MIT CSAIL trong ba năm. Bạn có thể chia sẻ với chúng tôi một số điểm nổi bật từ thời kỳ này trong cuộc đời của bạn?
Trong thời gian tại Intel Labs và MIT, tôi đã có cơ hội hợp tác với các chuyên gia hàng đầu trong hai lĩnh vực khoa học khác nhau: tính toán hiệu suất cao (tại Intel) và cơ sở dữ liệu (tại MIT). Kiến thức và chuyên môn tôi có được đã trở thành chìa khóa trong việc định hình tầm nhìn của tôi để tạo ra một loại hệ thống cơ sở dữ liệu mới, mà tôi cuối cùng đã xây dựng như một dự án nghiên cứu trong ISTC và tách ra thành TileDB.
Bạn có thể giải thích tầm nhìn đằng sau TileDB và cách nó nhằm mục đích cách mạng hóa cảnh quan cơ sở dữ liệu hiện đại?
Trong những năm gần đây, đã có một sự gia tăng lớn trong các ứng dụng học máy và Trí tuệ nhân tạo tạo ra giúp các tổ chức đưa ra quyết định tốt hơn. Mỗi ngày, các tổ chức đều phát hiện ra các mẫu mới trong dữ liệu của họ và sau đó sử dụng thông tin này để đạt được lợi thế cạnh tranh. Những mẫu này xuất hiện từ một phổ dữ liệu ngày càng rộng lớn phải được lưu trữ và quản lý để có thể khai thác. Từ dữ liệu bảng truyền thống đến các nguồn dữ liệu phức tạp hơn như bài đăng trên mạng xã hội, email, hình ảnh, video và dữ liệu cảm biến, khả năng suy luận từ dữ liệu đòi hỏi phải phân tích tổng hợp. Khi các loại dữ liệu tăng lên, nhiệm vụ này trở nên khó khăn hơn, đòi hỏi một loại cơ sở dữ liệu mới. Đây chính xác là lý do tại sao TileDB được tạo ra.
Tại sao lại quan trọng đối với các tổ chức để ưu tiên cơ sở hạ tầng dữ liệu của họ trước khi phát triển các khả năng phân tích và học máy tiên tiến?
Trong sự hào hứng áp dụng Trí tuệ nhân tạo, có một sự thật quan trọng và thường bị bỏ qua – thành công của bất kỳ sáng kiến Trí tuệ nhân tạo nào đều gắn liền với chất lượng và hiệu suất của cơ sở hạ tầng dữ liệu cơ bản.
Vấn đề là dữ liệu phức tạp không được biểu diễn tự nhiên dưới dạng bảng thường được coi là “không có cấu trúc” và thường được lưu trữ dưới dạng tệp phẳng trong các định dạng dữ liệu tùy chỉnh hoặc được quản lý bởi các cơ sở dữ liệu được xây dựng riêng cho mục đích đó. Các nhà khoa học dữ liệu phải dành rất nhiều thời gian để thu thập dữ liệu để hợp nhất nó. Theo ước tính, 80-90 phần trăm thời gian của các nhà khoa học dữ liệu được dành để làm sạch dữ liệu và chuẩn bị nó cho việc hợp nhất. Điều đó làm chậm thời gian đào tạo các thuật toán Trí tuệ nhân tạo và đạt được khả năng dự đoán. Hơn nữa, điều này có nghĩa là chỉ 10-20 phần trăm thời gian của các nhà khoa học dữ liệu được dành để tạo ra thông tin.
Những sai lầm phổ biến mà các tổ chức gặp phải khi họ tập trung nhiều hơn vào các ứng dụng Trí tuệ nhân tạo và học máy tại chi phí của cơ sở hạ tầng dữ liệu mạnh mẽ?
Các tổ chức có xu hướng tập trung vào những thứ mới mẻ. Các mô hình ngôn ngữ lớn, cơ sở dữ liệu vector và ứng dụng Trí tuệ nhân tạo tạo ra trên cơ sở hạ tầng dữ liệu là những ví dụ hiện tại, tại chi phí của việc giải quyết cơ sở hạ tầng dữ liệu cơ bản vốn quan trọng đối với thành công phân tích. Đơn giản nói, nếu tổ chức của bạn làm như vậy, bạn có thể sẽ dành rất nhiều thời gian để ráp nối cơ sở hạ tầng dữ liệu và chậm trễ hoặc bỏ lỡ cơ hội để thu được thông tin.
Bạn có thể giải thích thêm về điều gì làm cho một cơ sở dữ liệu trở nên “linh hoạt” và tại sao tính linh hoạt này lại quan trọng đối với phân tích dữ liệu hiện đại?
Một cơ sở dữ liệu linh hoạt là một cơ sở dữ liệu có thể thay đổi để phù hợp với tất cả các loại dữ liệu – bất kể loại dữ liệu nào – và lưu trữ chúng cùng nhau theo cách thống nhất. Một cơ sở dữ liệu linh hoạt mang lại cấu trúc cho dữ liệu mà nếu không sẽ được coi là “không có cấu trúc”. Theo ước tính, 80 phần trăm hoặc nhiều hơn dữ liệu trên thế giới là không phải bảng và hầu hết các mô hình Trí tuệ nhân tạo / học máy (bao gồm cả mô hình ngôn ngữ lớn) được đào tạo trên loại dữ liệu này.
TileDB cấu trúc dữ liệu trong các mảng đa chiều. Định dạng này cải thiện hiệu suất và hiệu quả chi phí so với các cơ sở dữ liệu truyền thống như thế nào?
Điểm mạnh cơ bản của một cơ sở dữ liệu mảng đa chiều là nó có thể thay đổi để phù hợp với hầu như bất kỳ loại dữ liệu và ứng dụng nào. Một vector, ví dụ, chỉ là một mảng một chiều. Bằng cách mang lại cấu trúc cho dữ liệu “không có cấu trúc” này, bạn có thể hợp nhất cơ sở hạ tầng dữ liệu, giảm đáng kể chi phí, loại bỏ các silo, tăng năng suất và tăng cường bảo mật. Đi một bước xa hơn, khi cơ sở hạ tầng tính toán được kết hợp với cơ sở hạ tầng quản lý dữ liệu, bạn có thể trích xuất giá trị tức thì từ dữ liệu của mình.
Có những trường hợp sử dụng đáng chú ý nào mà TileDB đã cải thiện đáng kể hiệu suất quản lý và phân tích dữ liệu?
Trường hợp sử dụng đầu tiên của TileDB là lưu trữ, quản lý và phân tích dữ liệu gen lớn, điều này rất khó và tốn kém để mô hình hóa và lưu trữ trong một cơ sở dữ liệu bảng truyền thống. Chúng tôi đã quan sát thấy những lợi ích về hiệu suất đáng kinh ngạc (lên đến 100 lần nhanh hơn trong nhiều trường hợp so với các cơ sở dữ liệu và giải pháp tùy chỉnh khác). Tuy nhiên, mô hình mảng đa chiều của chúng tôi là phổ quát và có thể xử lý hiệu quả các loại dữ liệu khác, chẳng hạn như hình ảnh y sinh, hình ảnh vệ tinh, chuyển录 đơn bào và dữ liệu điểm mây như LiDAR và SONAR.
TileDB cung cấp các công cụ mã nguồn mở cho tính tương tác. Một cách tiếp cận mã nguồn mở như thế nào lại có lợi cho cộng đồng khoa học và khoa học dữ liệu?
Chúng tôi là những người ủng hộ mã nguồn mở tại TileDB. Thư viện lõi và đặc tả định dạng dữ liệu đều là mã nguồn mở. Ngoài ra, các sản phẩm khoa học sự sống của chúng tôi, được xây dựng trên thư viện mảng lõi, cũng là mã nguồn mở. Điều này bao gồm TileDB-SOMA, một gói cho quản lý dữ liệu đơn bào hiệu quả và có thể mở rộng, được xây dựng hợp tác với Quỹ Chan Zuckerberg và cung cấp cho CELLxGENE Discover Census – bộ dữ liệu đơn bào được quản lý đầy đủ lớn nhất trên thế giới. Điều này cũng là mã nguồn mở và được sử dụng bởi các cơ sở giáo dục và các công ty dược phẩm lớn trên toàn cầu.
Bạn thấy xu hướng tương lai trong quản lý dữ liệu là gì?
Khi dữ liệu trở nên phong phú hơn, các ứng dụng Trí tuệ nhân tạo trở nên thông minh hơn. Các mô hình ngôn ngữ lớn đang trở nên mạnh mẽ hơn, tận dụng nhiều loại dữ liệu và tích hợp các mô hình này với các tập dữ liệu đa dạng đang mở ra một biên giới mới trong Trí tuệ nhân tạo được gọi là Trí tuệ nhân tạo đa phương thức.
Thực tế, Trí tuệ nhân tạo đa phương thức có nghĩa là người dùng không bị giới hạn ở một loại đầu vào và một loại đầu ra, và có thể đẩy một mô hình với hầu như bất kỳ loại đầu vào nào để tạo ra hầu như bất kỳ loại nội dung. Chúng tôi xem TileDB là cơ sở dữ liệu lý tưởng để hỗ trợ Trí tuệ nhân tạo đa phương thức, được xây dựng để hỗ trợ bất kỳ loại dữ liệu mới và khác nhau nào có thể xuất hiện.
Cảm ơn vì bài đánh giá tuyệt vời, độc giả muốn tìm hiểu thêm nên truy cập TileDB.












