인터뷰

Frank Liu, Zilliz의 운영 책임자 – 인터뷰 시리즈

mm
Unite.AI를 Google의 선호 소스에 추가

Frank Liu는 Zilliz의 운영 책임자로, 벡터 데이터베이스 및 AI 기술을 제공하는 선도적인 회사입니다. 또한 LF AI Milvus®를 개발한 엔지니어와 과학자들입니다. Milvus는 세계에서 가장 인기 있는 오픈 소스 벡터 데이터베이스입니다.

당신이 기계 학습에 처음으로 관심을 갖게 된 계기는 무엇입니까?

저의 첫 기계 학습/인공지능 접촉은 스탠퍼드 대학교에서 전기 공학을 전공하는 동안이었는데, 이는 전기 공학의 복잡한 시스템을 수학적 근사로 축약하는 능력이 저에게 강력한 것으로 느껴졌습니다. 통계와 기계 학습도 마찬가지였습니다. 저는 대학원에서 컴퓨터 비전과 기계 학습 수업을 더 많이 들었고, 이미지의 미적 아름다움을 평가하는 기계 학습을 사용하여 석사 논문을 썼습니다. 모두가 저의 첫 번째 직장인 Yahoo의 컴퓨터 비전 및 기계 학습 팀에서 연구 및 소프트웨어 개발 역할을 수행하게 되었습니다. 우리는 아직 AlexNet 및 VGG의 전성기 이전 시대였습니다. 데이터 준비에서 대규모 병렬 모델 훈련 및 모델 프로덕션화까지 빠르게 발전하는 산업과 분야를 보는 것은 놀랍습니다. 어떤 면에서 10년 전이라고 말하는 것이有点 부자연스럽지만, 이 분야에서 이루어진 진보는 엄청납니다.

Yahoo 이후에, 저는 실내 위치화를 위한 기계 학습을 사용한 스타트업의 공동 창립자이자 기술 책임자였습니다. 우리는 매우 작은 마이크로 컨트롤러에 대한 순차적 모델을 최적화해야 했습니다. 이는 오늘날의 대규모 언어 모델 및 확산 모델과는 다소 다른 엔지니어링課題였습니다. 우리는 또한 하드웨어, 시각화 대시보드, 간단한 클라우드 네이티브 애플리케이션을 구축했지만, AI/ML은 우리가 수행하는 작업의 핵심 구성 요소였습니다.

저는 기계 학습에 거의 7년 또는 8년 동안 종사해 왔지만, 여전히 회로 설계와 디지털 논리 설계를 rất 좋아합니다. 전기 공학 배경은 저가 현재 수행하는 많은 작업에 매우 도움이 됩니다. 디지털 설계의 중요한 개념인 가상 메모리, 분기 예측, HDL의 동시 실행은 기계 학습 및 분산 시스템에 대한 전체적인 관점을 제공합니다. 저는 CS의 매력을 이해하지만, 다음 2년 내에 EE, MechE, ChemE 등 더 전통적인 엔지니어링 분야의 부흥을 기대합니다.

구조화되지 않은 데이터에 대해 설명해 주세요.

구조화되지 않은 데이터는 “복잡한” 데이터로, 이는 사전 정의된 형식이나 기존 데이터 모델에 맞지 않는 데이터입니다. 비교를 위해, 구조화된 데이터는 사전 정의된 구조를 갖는 모든 유형의 데이터입니다. 숫자 데이터, 문자열, 테이블, 객체 및 키/값 저장소는 모두 구조화된 데이터의 예입니다.

구조화되지 않은 데이터가 무엇인지 및 왜 전통적으로 계산적으로 처리하기 어려웠는지真正로 이해하기 위해서는, 구조화된 데이터와 비교하는 것이 도움이 됩니다. 가장 간단한 용어로, 전통적인 구조화된 데이터는 관계형 모델을 통해 저장할 수 있습니다. 예를 들어, 책 정보를 저장하는 관계형 데이터베이스의 테이블이 있습니다. 각 행은 특정 책을 ISBN 번호로 색인하고, 열은 해당 카테고리의 정보(제목, 저자, 발행일 등)를 나타냅니다. 요즘에는 더 유연한 데이터 모델(와이드 컬럼 저장소, 객체 데이터베이스, 그래프 데이터베이스 등)이 있습니다. 하지만 기본 아이디어는 동일합니다. 이러한 데이터베이스는 특정 데이터 모델 또는 데이터 형식을 갖는 데이터를 저장하기 위해 설계되었습니다.

구조화되지 않은 데이터는 본질적으로 이진 데이터의 유사한 무작위 블록으로 생각할 수 있습니다. 이는 무엇이든 될 수 있으며, 임의로 크거나 작을 수 있으며, 수많은 다른 방식으로 변환 및 읽을 수 있습니다. 이는 데이터 모델이나 관계형 데이터베이스의 테이블에 맞지 않습니다.

이러한 유형의 데이터의 예는 무엇입니까?

인간이 생성한 데이터(이미지, 비디오, 오디오, 자연어 등)는 구조화되지 않은 데이터의 훌륭한 예입니다. 하지만 더 평범하지 않은 구조화되지 않은 데이터의 예도 있습니다. 사용자 프로필, 단백질 구조, 유전체 시퀀스 및 인간이 읽을 수 있는 코드도 구조화되지 않은 데이터의 훌륭한 예입니다. 구조화되지 않은 데이터가 전통적으로 관리하기 어려운 주요 이유는 구조화되지 않은 데이터가 임의의 형식을 갖을 수 있으며, 처리를 위해 크게 다른 런타임이 필요할 수 있기 때문입니다.

이미지를 예로 들어 보면, 동일한 장면의 두 개의 사진은 매우 다른 픽셀 값을 갖지만, 전체 내용은 비슷합니다. 자연어도 구조화되지 않은 데이터의 또 다른 예입니다. “전기 공학”과 “컴퓨터 과학”은 매우密接한 관련이 있지만, 의미적 의미를 인코딩하는 방법이 없으면 컴퓨터는 “컴퓨터 과학”과 “사회 과학”이 더 관련이 있다고 생각할 수 있습니다.

벡터 데이터베이스란 무엇입니까?

벡터 데이터베이스를 이해하려면 먼저 임베딩이 무엇인지 이해해야 합니다. 잠시 후에 설명하겠습니다. 간단히 말해서, 임베딩은 구조화되지 않은 데이터의 의미를 나타낼 수 있는 고차원 벡터입니다. 일반적으로 두 개의 임베딩이 서로 가까우면, 매우 유사한 의미를 갖는 입력 데이터에 해당하는 것입니다. 현대의 기계 학습을 사용하면, 이미지 및 텍스트와 같은 다양한 유형의 구조화되지 않은 데이터를 의미적으로 강력한 임베딩 벡터로 변환할 수 있습니다.

조직의 관점에서, 구조화되지 않은 데이터는 특정 한계를 넘어서면 관리하기 매우 어려워집니다. 여기서 벡터 데이터베이스가 등장합니다. 벡터 데이터베이스는 임베딩을 기본 표현으로 사용하여 대량의 구조화되지 않은 데이터를 저장, 색인 및 검색하도록 설계되었습니다. 벡터 데이터베이스를 검색하는 것은 일반적으로 쿼리 벡터를 사용하여 수행되며, 쿼리의 결과는 거리 기준으로 가장 유사한 상위 N개 결과입니다.

가장 좋은 벡터 데이터베이스는 전통적인 관계형 데이터베이스의 사용 편의성 기능을 많이 갖추고 있습니다. 수평 확장, 캐싱, 복제, 장애 조치, 쿼리 실행 등이 있습니다. 카테고리 정의자로서, 우리는 학술 원에서 활발하게 활동하며, SIGMOD 2021 및 VLDB 2022와 같은 최고의 데이터베이스 회의에서 논문을 발표했습니다.

임베딩에 대해 설명해 주세요.

일반적으로 임베딩은 다층 신경망의 중간 레이어의 활성화에서 나온 고차원 벡터입니다. 많은 신경망은 임베딩 자체를 출력하도록 훈련되며, 일부 애플리케이션은 여러 중간 레이어의 연결된 벡터를 임베딩으로 사용합니다. 하지만 지금은 자세히 설명하지 않겠습니다. 임베딩을 생성하는 또 다른 방법은 수동으로 특징을 설계하는 것입니다. 기계 학습 모델이 자동으로 입력 데이터의 올바른 표현을 학습하는 대신, 좋은 오래된 특징 엔지니어링이 많은 애플리케이션에서 작동할 수 있습니다. 임베딩 방법에 관계없이, 의미적으로 유사한 객체의 임베딩은 거리 기준으로 가까우며, 이는 벡터 데이터베이스의 핵심입니다.

이 기술의 가장 인기 있는 사용 사례는 무엇입니까?

벡터 데이터베이스는 의미 검색이 필요한 모든 애플리케이션에 적합합니다. 제품 추천, 비디오 분석, 문서 검색, 위협 및 사기 탐지, AI 기반 챗봇 등이 벡터 데이터베이스의 가장 인기 있는 사용 사례입니다. Milvus는 Zilliz가 만든 오픈 소스 벡터 데이터베이스로, Zilliz Cloud의 핵심입니다. Milvus는 다양한 사용 사례에서 1,000개 이상의 기업 사용자에 의해 사용되었습니다.

저는 이러한 애플리케이션에 대해 이야기하고 작동 방식을 이해하는 것을 매우 좋아합니다. 하지만 저는 또한 벡터 데이터베이스의 덜 알려진 사용 사례에 대해 이야기하는 것을 좋아합니다. 새로운 약물 발견은 저의 가장 좋아하는 “니치” 벡터 데이터베이스 사용 사례 중 하나입니다. 이 애플리케이션의 도전은 8억 개의 화합물 데이터베이스에서 특정 질병 또는 증상을 치료할 수 있는 잠재적인 후보 약물을 검색하는 것입니다. Zilliz와 통신한 제약 회사는 Milvus와 화학 정보 라이브러리인 RDKit를 결합하여 약물 발견 프로세스를 크게 개선하고 하드웨어 리소스를 줄일 수 있었습니다.

클리블랜드 미술관의 AI ArtLens도 저의 또 다른 예입니다. AI ArtLens는 입력 이미지와 유사한 이미지를 미술관의 데이터베이스에서 검색하는 인터랙티브 도구입니다. 이것은 일반적으로 역방향 이미지 검색으로 알려져 있으며, 벡터 데이터베이스의 일반적인 사용 사례입니다. 하지만 Milvus가 CMA에 제공한 고유한 가치는 매우 작은 팀으로 일주일 내에 애플리케이션을 구축할 수 있는 능력입니다.

Towhee 오픈 소스 플랫폼에 대해 설명해 주세요.

Milvus 커뮤니티와의 대화에서, 많은 사람들이 Milvus에 대한 임베딩을 생성하는 통일된 방법을 원했습니다. 이는 특히 기계 학습 엔지니어가 많지 않은 회사에서 사실이었습니다. Towhee를 통해, 우리는 “벡터 데이터 ETL”를 통해 이 간격을 메우고자 합니다. 전통적인 ETL 파이프라인은 구조화된 데이터를 결합하고 변환하여 사용 가능한 형식으로 만드는 데 중점을 둡니다. Towhee는 구조화되지 않은 데이터와 명시적으로 ML을 결과 ETL 파이프라인에 포함하는 것을 목표로 합니다. Towhee는 모델, 알고리즘 및 변환의 빌딩 블록을 제공하여 벡터 데이터 ETL 파이프라인을 구축할 수 있습니다. 또한 Towhee는 개발자가 한 줄의 코드로 이러한 ETL 파이프라인을 구축하고 테스트할 수 있는 쉬운 사용자 인터페이스를 제공합니다.

Towhee는 독립적인 프로젝트이지만, Milvus를 중심으로 하는 더广い 벡터 데이터베이스 생태계의 일부입니다. 우리는 Milvus와 Towhee가 매우 보완적인 프로젝트라고 생각하며, 함께 사용하면 구조화되지 않은 데이터 처리를真正로 민주화할 수 있습니다.

Zilliz는 최근 6,000만 달러의 시리즈 B 라운드를 유치했습니다. 이는 Zilliz의 미션을 어떻게 가속화할 것입니까?

우선, Prosperity7 Ventures, Pavilion Capital, Hillhouse Capital, 5Y Capital, Yunqi Capital 등이 Zilliz의 미션을 믿고 지원해 주신 것에 대해 감사를 표합니다. 우리는 총 1억 1,300만 달러를 유치했습니다. 이 시리즈 B 라운드는 우리의 엔지니어링 및 마케팅 팀을 확대하는 데 도움이 될 것입니다. 특히, 우리는 현재 초기 액세스 중인 관리형 클라우드 오퍼링을 개선할 것입니다. 우리는 또한 앞으로 4년간처럼 최신 데이터베이스 및 AI 연구에 계속 투자할 것입니다.

Zilliz에 대해 더 공유하고 싶은 것이 있습니까?

우리는 빠르게 성장하는 회사지만, 우리 팀을 다른 데이터베이스 및 ML 회사와 구별하는 것은 우리가 구축하는 것에 대한 열정입니다. 우리는 구조화되지 않은 데이터 처리를 민주화하는 것을 목표로 하고 있으며, 많은 사람들이 Zilliz에서 일하고 있는 것을 보는 것은 정말 놀랍습니다. 우리가 하는 일에 관심이 있다면, 저희에게 연락해 주세요. 우리는 당신을 환영합니다.

저는 또한 개인적으로 Zilliz, 벡터 데이터베이스 또는 AI/ML의 임베딩 관련 발전에 대해 이야기하는 것을 좋아합니다. 제 (비유적인) 문은 항상 열려 있으므로, 트위터/링크드인으로 직접 저에게 연락해 주세요.

마지막으로, 읽어주셔서 감사합니다!

이번 인터뷰를 즐겨주셔서 감사합니다. 더 많은 정보를 원하시는 독자는 Zilliz를 방문해 주세요.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

作为 미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.