인터뷰

파인콘의 VP 엔지니어인 람 스리하르샤 박사 – 인터뷰 시리즈

mm
Unite.AI를 Google의 선호 소스에 추가

람 스리하르샤 박사는 파인콘의 엔지니어링 및 연구開発 담당 이사입니다.

파인콘에 합류하기 전에 람은 야후, 데이터브릭스, 스플렁크에서 VP 역할을 수행했습니다. 야후에서는 주요 소프트웨어 엔지니어 및 연구 과학자로 근무했으며, 데이터브릭스에서는 유니파이드 애널리틱스 플랫폼의 제품 및 엔지니어링 담당자로 근무했습니다. 스플렁크에서 3년 동안 근무하면서 여러 역할을 수행했으며, 시니어 프린시펄 사이언티스트, 엔지니어링 VP, 디스팅위시드 엔지니어 등을 역임했습니다.

파인콘은 벡터 검색을 프로덕션 애플리케이션에 쉽게 추가할 수 있는 완전 관리형 벡터 데이터베이스입니다. 벡터 검색 라이브러리, 필터링 기능, 분산 인프라를 결합하여 任意 규모에서 높은 성능과 신뢰성을 제공합니다.

머신 러닝에 처음 관심을 가지게 된 계기는 무엇인가요?

고차원 통계, 러닝 이론, 이러한 주제들이 저를 머신 러닝에 관심을 가지게 만들었습니다. 수학적으로 잘 정의되어 있으며, 학습이 무엇을 의미하는지에 대한 근본적인 통찰력을 제공하며, 효율적으로 학습할 수 있는 알고리즘을 설계하는 데 도움이 됩니다.

이전에 스플렁크의 엔지니어링 VP로 근무하셨는데, 그 경험에서 얻은 주요 교훈은 무엇인가요?

저는 스플렁크에 합류하기 전까지 기업 검색의 사용 사례가 얼마나 다양한지 깨닫지 못했습니다. 사람들은 스플렁크를 로그 분석, 관측 가능성, 보안 분석 등을 위해 사용합니다. 이러한 사용 사례의 공통점은 비정형 데이터에서 유사한 이벤트 또는 매우 다른 이벤트(이상치)를 감지하는 것입니다. 이는 어려운 문제이며, 전통적인 검색 방법은 이러한 데이터를 처리하는 데 확장성이 없습니다. 스플렁크에서 근무하는 동안 저는 이러한 분야에서 머신 러닝(및 딥 러닝)을 사용하여 로그 마이닝, 보안 분석 등을 연구하기 시작했습니다. 그 과정에서 벡터 임베딩과 벡터 검색이 이러한 도메인에 대한 새로운 접근 방식의 기본 원리가 될 것이라는 것을 깨달았습니다.

벡터 검색이란 무엇인가요?

전통적인 검색(키워드 검색이라고도 함)에서는 쿼리와 문서 사이의 키워드 일치를 찾습니다(이 문서는 트위터, 웹 문서, 법적 문서 등이 될 수 있음). 이를 위해 쿼리를 토큰으로 분할하고, 주어진 토큰을 포함하는 문서를 검색하고, 결합 및 랭킹을 통해 쿼리와 가장 관련성이 높은 문서를 결정합니다.

주된 문제는 관련된 결과를 얻으려면 쿼리와 문서 사이에 키워드 일치가 있어야 한다는 것입니다. 전통적인 검색의 고전적인 문제는 “pop”을 검색하면 “pop music”과 일치하지만 “soda”와는 일치하지 않는다는 것입니다. 많은 미국 지역에서 “pop”은 “soda”와 같은 의미로 사용되지만 키워드가 일치하지 않기 때문에 검색 결과에 나타나지 않습니다.

벡터 검색에서는 쿼리와 문서를 모두 고차원 공간의 벡터로 변환하여 시작합니다. 이는 일반적으로 OpenAI의 LLM 또는 다른 언어 모델을 통해 수행됩니다. 결과적으로 고차원 공간의浮動小数점 数组를 얻습니다.

중심 아이디어는 이 고차원 공간에서 근처에 있는 벡터는 의미적으로도 유사하다는 것입니다. “soda”와 “pop”의 예로 돌아가면, 모델이 올바른 코퍼스에서 훈련되었다면 “pop”과 “soda”를 의미적으로 유사하다고 간주할 것입니다. 따라서 해당 임베딩은 임베딩 공간에서 근처에 있을 것입니다. 그러한 경우 주어진 쿼리에 대한 근처 문서를 검색하는 문제는 해당 쿼리 벡터의 근처 이웃을 검색하는 문제가 됩니다.

벡터 데이터베이스란 무엇이며, 어떻게 하면 고성능 벡터 검색 애플리케이션을 구축할 수 있나요?

벡터 데이터베이스는 이러한 임베딩(또는 벡터)을 저장, 색인 및 관리합니다. 벡터 데이터베이스가 해결하는 주요 문제는 다음과 같습니다.

  • 벡터에 대한 효율적인 검색 인덱스를 구축하여 근처 이웃 쿼리를 해결
  • 쿼리 필터링을 지원하는 보조 인덱스 및 데이터 구조를 구축하는 것. 예를 들어, 코퍼스의 하위 집합만 검색하고 싶다면, 기존 검색 인덱스를 재구축하지 않고도 이를 활용할 수 있어야 합니다.

데이터와 검색 인덱스를 효율적으로 업데이트하고, 데이터와 검색 인덱스를 신선하고 일관되며, 지속 가능하게 유지하는 것.

파인콘에서 사용하는 다양한 머신 러닝 알고리즘은 무엇인가요?

일반적으로 근사最近 이웃 검색 알고리즘을 작업하며, 대규모 데이터를 효율적으로 업데이트하고, 쿼리하고, 처리하는 새로운 알고리즘을 개발합니다.

또한 검색 관련성을 개선하기 위해 밀도 및 희소 검색을 결합하는 알고리즘을 작업합니다.

검색을 확장하는 데 뒤따르는 도전은 무엇인가요?

근사最近 이웃 검색은 수십 년 동안 연구되어 왔지만, 여전히 많은 것이 남아 있습니다.

특히, 대규모最近 이웃 검색을 비용 효율적으로 설계하는 것, 대규모 필터링을 수행하는 것, 신선하고 일관된 인덱스를 지원하는 알고리즘을 설계하는 것 등은 모두 오늘날 도전적인 문제입니다.

이 기술을 사용할 수 있는 다양한 사용 사례는 무엇인가요?

벡터 데이터베이스의 사용 사례는 매일 증가하고 있습니다. 의미 검색 외에도 이미지 검색, 이미지 검색, 생성적 AI, 보안 분석 등에서 사용되고 있습니다.

검색의 미래에 대한 비전은 무엇인가요?

저는 검색의 미래가 AI 주도될 것이라고 생각하며, 이는 너무 멀지 않은 미래일 것입니다. 그 미래에는 벡터 데이터베이스가 핵심 원시 함수가 될 것이라고 예상합니다. 우리는 벡터 데이터베이스를 AI의 장기 기억 또는 외부 지식 베이스로 생각합니다.

멋진 인터뷰 감사합니다. 더 많은 정보를 원하는 독자는 파인콘을 방문할 수 있습니다.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

作为 미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.