인터뷰

타일DB의 스타브로스 파파도풀로스 박사, 설립자 및 최고경영자 – 인터뷰 시리즈

mm
Unite.AI를 Google의 선호 소스에 추가

타일DB는 코드와 컴퓨팅을 하나의 제품으로 통합하는 현대적인 데이터베이스입니다. 타일DB는 2017년 5월에 MIT와 인텔 랩스에서 분사되었습니다.

(INTC )

타일DB를 설립하기 전에, 스타브로스 파파도풀로스 박사는 인텔 병렬 컴퓨팅 랩의 선임 연구 과학자였으며, MIT CSAIL의 인텔 사이언스 앤 테크놀로지 센터 สำหร 빅데이터에서 3년간 일했습니다. 그는 또한 홍콩 과학기술 대학의 컴퓨터 과학 및 공학부에서 약 2년간 방문 조교수로 일했습니다. 스타브로스 파파도풀로스 박사는 홍콩 과학기술 대학에서 디미트리스 파파디아스 교수의 지도하에 컴퓨터 과학 박사 학위를 받았으며, 홍콩 중국 대학에서 유페이 타오 교수와 함께 박사 후 연구원으로 일했습니다.

당신은 이전에 인텔 병렬 컴퓨팅 랩의 선임 연구 과학자였으며, MIT CSAIL의 인텔 사이언스 앤 테크놀로지 센터에서 3년간 일했습니다. 이 기간 동안의 주요亮點을 공유해 주시겠습니까?

인텔 랩스와 MIT에서 일하는 동안, 저는 두 가지 다른 과학 분야의 유명한 연구자들과 협력할 수 있는 유일한 기회를 가졌습니다: 고성능 컴퓨팅(인텔)과 데이터베이스(MIT). 이때 얻은 지식과 전문 지식은 새로운 유형의 데이터베이스 시스템을 만들기 위한 비전을 형성하는 데 핵심이 되었습니다. 이는 최종적으로 ISTC 내의 연구 프로젝트로 발전하여 타일DB가 되었습니다.

타일DB의 비전과 현대적인 데이터베이스 풍경을 혁신하는 방법을 설명해 주시겠습니까?

최근 몇 년 동안, 기계 학습과 생성형 AI 애플리케이션의 사용이 크게 증가했습니다. 이러한 애플리케이션은 조직이 더好的 결정을 내리도록 도와줍니다. 매일, 조직은 데이터에서 새로운 패턴을 발견하고, 이를 통해 경쟁 우위를 얻습니다. 이러한 패턴은 다양한 데이터 모달리티에서 나타나며, 이를 수집하고 관리하여 의미를 추출할 수 있어야 합니다. 전통적인 테이블 형식의 데이터에서 더 복잡한 데이터 소스(예: 소셜 포스트, 이메일, 이미지, 비디오, 센서 데이터)로, 데이터 유형이 증가함에 따라 이러한 작업은 더 어려워지고 있습니다. 이는 새로운 유형의 데이터베이스가 필요합니다. 이것이 타일DB가 만들어진 이유입니다.

조직이 고급 분석과 기계 학습 기능을 개발하기 전에 데이터 인프라를 우선순위로 하는 것이 왜 중요합니까?

AI를 채택하는 열기에 숨겨진 중요한 진실이 있습니다. 즉, 모든 AI 이니셔티브의 성공은 기본 데이터 인프라의 품질과 성능에 내재적으로 연결되어 있습니다.

문제는 복잡한 데이터가 테이블 형식으로 자연스럽게 표현되지 않는 경우 “비정형”으로 간주되고, 일반적으로 플랫 파일로 저장되거나 목적에 맞게 설계된 별도의 데이터베이스로 관리됩니다. 데이터 과학자들은 데이터를 통합하기 위해 많은 시간을 데이터를 다루는 데 소비합니다. 데이터 과학자들이 데이터를 정리하고 병합하기 위해 80-90%의 시간을 소비한다고 추정됩니다. 이는 AI 알고리즘을 훈련하고 예측 기능을 달성하기까지의 시간을 지연시킵니다. 또한, 이는 데이터 과학자들이 통찰력을 얻기 위해 10-20%의 시간만을 사용한다는 것을 의미합니다.

조직이 데이터베이스 인프라를 강화하는 것보다 AI 및 ML 애플리케이션에 더 집중할 때 일반적으로 직면하는 함정은 무엇입니까?

조직은 일반적으로 새로운 기술에 집중합니다. 대형 언어 모델, 벡터 데이터베이스 및 데이터 인프라 위에 구축된 생성형 AI 애플리케이션은 현재의 예입니다. 그러나 이러한 기술에 대한 집중은 분석 성공에 필수적인 기본 데이터 인프라를 무시할 수 있습니다. 간단히 말해, 조직이 이러한 함정을 피하지 못하면, 데이터 인프라를 통합하는 데 많은 시간을 소비할 수 있으며, 통찰력을 얻는 데 필요한 기회를 놓칠 수 있습니다.

적응형 데이터베이스가 무엇이며, 현대적인 데이터 분석을 위해 이러한 적응성이 왜 필수적인지 설명해 주시겠습니까?

적응형 데이터베이스는 모든 데이터(모달리티에 관계없이)를 수용하고 통일된 방식으로 저장할 수 있는 데이터베이스입니다. 이는 “비정형” 데이터에 구조를 제공합니다. 세계의 데이터 중 80% 이상이 비정형이라고 추정됩니다. 대부분의 AI/ML 모델(包括 LLMs)은 이러한 유형의 데이터에서 훈련됩니다.

타일DB는 다차원 배열로 데이터를 구조화합니다. 전통적인 데이터베이스와 비교하여 이 형식은 어떻게 성능과 비용 효율성을 개선합니까?

다차원 배열 데이터베이스의 기본 강점은 거의 모든 데이터 모달리티와 애플리케이션을 수용할 수 있다는 것입니다. 예를 들어, 벡터는 단일 차원 배열입니다. 이러한 “비정형” 데이터에 구조를 제공함으로써, 데이터 인프라를 통합할 수 있으며, 비용을 크게 줄일 수 있습니다. 또한, 데이터와 컴퓨팅 인프라를 결합하면 데이터에서 즉시 가치를 추출할 수 있습니다.

타일DB가 데이터 관리와 분석 성능을 크게 개선한 주목할만한 사용 사례는 무엇입니까?

타일DB의 첫 번째 사용 사례는 전통적인 테이블 형식의 데이터베이스에서 모델링하고 저장하기 어려운 방대한 유전체 데이터의 저장, 관리 및 분석이었습니다. 우리는 다른 데이터베이스와 맞춤형 솔루션보다 100배 빠른 성능 개선을 관찰했습니다. 그러나 다차원 배열 모델은 다른 데이터 모달리티도 효율적으로 캡처할 수 있습니다. 예를 들어, 타일DB는 생물의학 이미징, 위성 이미징, 단일 세포 전사체학 및 LiDAR 및 SONAR와 같은 점군 데이터를 처리하기에 탁월합니다.

타일DB는 상호 운용성을 위한 오픈 소스 도구를 제공합니다. 오픈 소스 접근 방식은 과학 및 데이터 과학 커뮤니티에 어떻게 도움이 됩니까?

타일DB에서 우리는 오픈 소스를 강력하게 지지합니다. 핵심 라이브러리와 데이터 형식 사양은 모두 오픈 소스입니다. 또한, 라이프 사이언스 오퍼링은 핵심 배열 라이브러리를 기반으로 구축되며, 오픈 소스입니다. 이것에는 타일DB-SOMA가 포함되어 있으며, 이는 단일 세포 데이터를 효율적이고 확장 가능하게 관리하기 위한 패키지입니다. 이는 찬 자커버그 재단과 협력하여 구축되었으며, 세계에서 가장 큰 완전히 큐레이팅된 단일 세포 데이터 세트인 CELLxGENE Discover Census를 구동합니다. 이것도 오픈 소스이며, 전 세계의 학술 기관과 주요 제약 회사에서 사용됩니다.

데이터 관리의 미래 트렌드는 무엇이라고 생각합니까?

데이터가 더 풍부해짐에 따라, AI 애플리케이션이 더智能해집니다. 대형 언어 모델은 더 강력해지고 있으며, 다양한 데이터 모달리티를 활용하고, 이러한 LLM과 다양한 데이터 세트의 통합은 다중 모달 AI라는 새로운 AI 분야를 개척하고 있습니다.

실제적으로, 다중 모달 AI는 사용자가 하나의 입력과 하나의 출력 유형으로 제한되지 않고, 모델에 거의 모든 입력을 제공하여 거의 모든 콘텐츠 유형을 생성할 수 있음을 의미합니다. 우리는 타일DB를 다중 모달 AI를 지원하기 위한 이상적인 데이터베이스로 간주하며, 새롭게 등장하는 다양한 유형의 데이터를 지원하도록 설계되었습니다.

이번 리뷰에 감사드리며, 더 많은 정보를 원하는 독자는 타일DB를 방문하시기 바랍니다.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

作为 미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.