인터뷰

아나이스 도티스-조르주, 인플럭스데이터 개발자 어드보킷 – 인터뷰 시리즈

mm
Unite.AI를 Google의 선호 소스에 추가

아나이스 도티스-조르주(Auais Dotis-Georgiou)는 인플럭스데이터(InfluxData)의 개발자 어드보킷(Developer Advocate)으로, 데이터 분석, AI, 기계 학습을 사용하여 데이터를 아름답게 만드는 것을 좋아합니다. 그녀는 수집한 데이터를 연구, 탐색, 엔지니어링하여 기능, 가치, 아름다움을 가진 무언가로 변환합니다. 화면 앞에 있지 않을 때, 그녀는 밖에서 그림을 그리거나, 스트레칭을 하거나, 보드를 타거나, 축구공을追いかけ고 있습니다.

인플럭스데이터인플럭스DB(InfluxDB)를 구축하는 회사로, 전 세계 100만 명이 넘는 개발자가 사용하는 오픈 소스 시계열 데이터베이스입니다. 그들의 목표는 개발자가 시간 시계열 데이터로 지능형 실시간 시스템을 구축하는 것을 도와주는 것입니다.

연구 보조원에서 인플럭스데이터의 리드 개발자 어드보킷이 되는 과정에 대해 조금 설명해 주시겠습니까? 데이터 분석과 기계 학습 배경이 현재 역할에 어떻게 영향을 미쳤는지 알려주세요.

저는 생물 의공학을 전공으로 화학 공학을 공부했습니다. 그리고 백신 개발과 자궁 내 자폐증 검출을 انجام하는 연구실에서 일했습니다. 그 후에 애플리케이션을 개발하고 데이터 과학자들이 이상 감지에 필요한 매개 변수를 이해하는 것을 도와주었습니다. 그때부터 프로그래밍에 더 관심을 가지게 되었습니다.

그 후에 오라클에서 영업 개발 대표로 일했습니다. 하지만 코딩에 더 집중해야겠다는 생각을 했습니다. 텍사스 대학교에서 데이터 분석을 공부하는 부트 캠프에参加했습니다. 그리고 기술 분야, 특히 개발자 관계 분야에서 일하게 되었습니다.

(ORCL )

저는 기술적인 배경을 가지고 있었습니다. 그래서 개발자 어드보킷으로서 개발자들이 이해하고 공감할 수 있는 콘텐츠를 만들 수 있었습니다. 기술적인 배경이 있는 사람들에게도 소프트웨어를 배우는 데 도움이 될 수 있는 콘텐츠를 만들었습니다.

您的 작업은 창의성과 기술 전문성을 결합합니다. 인플럭스데이터에서 데이터를 ‘아름답게’ 만드는您的 열정을 어떻게 일상적으로 반영하시나요?

최근에는 데이터 엔지니어링에 더 집중하고 있습니다. 데이터 분석에 그렇게 많이 집중하지는 않지만, 수학을 좋아합니다. 알고리즘의 수학적인 배경을 설명할 기회가 있으면 좋습니다.

인플럭스DB는 시간 시계열 데이터 분야에서 핵심적인 역할을 하고 있습니다. 오픈 소스 커뮤니티가 인플럭스DB의 개발과 진화에 어떻게 영향을 미치는지 알려주세요.

인플럭스데이터는 오픈 데이터 아키텍처와 아파치 생태계에 매우 헌신하고 있습니다. 지난 해에 인플럭스DB 3.0을 발표했습니다. 이것은 러스트로 작성되고 아파치 플라이트, 데이터 퓨전, 애로우, 파켓을 사용하여 구축된 새로운 인플럭스DB 코어입니다. 인플럭스데이터의 엔지니어들이 이러한 업스트림 프로젝트에 기여함에 따라 커뮤니티가 성장하고, 아파치 애로우 프로젝트 세트가 더 쉽게 사용할 수 있게 됩니다.

시간 시계열 데이터와 AI의 contexto에서 최근에 본 가장 흥미로운 오픈 소스 프로젝트나 기여는 무엇입니까?

제로샷 예측을 위해 시간 시계열에 LLM을 적용하는 것이 흥미롭습니다. Autolab에는 오픈 시간 시계열 언어 모델의 컬렉션이 있으며, TimeGPT도 좋은 예입니다.

또한 Hugging Face의 모델을 사용하여 스트림 처리 라이브러리를 사용할 수 있는 Bytewax와 Mage.ai 같은 오픈 소스 스트림 처리 라이브러리도 흥미롭습니다.

인플럭스데이터는 어떻게 오픈 소스 이니셔티브를 개발자 커뮤니티에 유용하고 관련性 있게 유지합니까? 특히 AI와 기계 학습의 빠른 발전에 어떻게 대응합니까?

인플럭스데이터는 AI 관련 회사도 사용하는 오픈 소스 프로젝트에 기여함으로써 이니셔티브를 유지합니다. 예를 들어, 인플럭스DB가 아파치 애로우, 파켓, 데이터 퓨전에 기여할 때마다, 이것은 아파치 스파크, 데이터 브릭스, 래피드.ai, 스노우플레이크, 빅쿼리, 허깅페이스 등 다른 AI 기술 회사에도ประโยชน을 줍니다.

시간 시계열 언어 모델은 예측 분석에서 점점 더 중요해지고 있습니다. 이러한 모델이 시간 시계열 예측과 이상 감지에 어떻게 변화를 가져오는지 설명해 주시겠습니까?

시간 시계열 언어 모델은 선형 및 통계적 모델을 초과하고 제로샷 예측을 제공합니다. 이것은 모델을 훈련시키지 않고도 사용할 수 있습니다. 또한 통계적 모델을 조정할 필요가 없습니다. 이것은 시간 시계열 통계에 대한 깊은 전문 지식을 필요로 합니다.

그러나 자연어 처리와 달리, 시간 시계열 분야에는 공개적으로 접근할 수 있는 대규모 데이터셋이 부족합니다. 대부분의 사전 훈련된 시간 시계열 모델은 작은 샘플 크기(수천 또는 수백 개의 샘플)에 대한 훈련으로 구성됩니다. 이러한 벤치마크 데이터셋은 시간 시계열 커뮤니티의 진행에 기여했지만, 샘플 크기가 작고 일반성이 부족하여 깊은 학습 모델을 사전 훈련하는 데에는課題를 제기합니다.

구글의 TimesFM과 IBM의 Tiny Time Mixers는 수십억 개의 데이터 포인트가 포함된 대규모 데이터셋으로 훈련되었습니다. 예를 들어, TimesFM은 구글 클라우드 TPU v3-256을 사용하여 사전 훈련되었습니다. 이것은 256개의 TPU 코어와 2테라바이트의 메모리를 갖습니다. 사전 훈련 과정은 약 10일이 걸리고, 12억 개의 매개 변수를 갖는 모델이 생성됩니다. 사전 훈련된 모델은 이후 특정 다운스트림 작업과 데이터셋에서 더 낮은 학습률과 더 적은 에포크를 사용하여 미세 조정됩니다.

(GOOGL )

이러한 모델을 사용하면 더 많은 사람들이 깊은 도메인 지식 없이도 정확한 예측을 할 수 있게 됩니다. 그러나 이러한 모델을 사용하는 데에는 많은 작업이 필요하며, финансов적 및 환경적 비용을 고려해야 합니다.

허깅페이스의 이 블로그 포스트는 시간 시계열 예측의 또 다른 좋은 예입니다.

전통적인 방법과 비교하여 시간 시계열 언어 모델을 사용하는 주요优势은 무엇입니까? 특히 복잡한 패턴과 제로샷 성능을 처리하는 경우에는 어떻습니까?

주된优势은 시간 시계열 데이터에 모델을 훈련시키고 재훈련시킬 필요가 없다는 것입니다. 이것은 온라인 머신 러닝 문제를 모니터링하고 모델의 드리프트를 트리거하는 것을 제거할 수 있습니다. 또한 복잡한 예측 파이프라인을 제거할 수 있습니다.

또한 다변량 통계 모델에서 교차 시리즈 상관관계 또는 관계를 추정할 필요가 없습니다. 추정에 의해 추가된 분산은 예측 결과를 해칠 수 있으며, 모델이 가짜 상관관계를 학습할 수 있습니다.

구글의 TimesFM, IBM의 TinyTimeMixer, AutoLab의 MOMENT와 같은 모델이 실제 시나리오에서 어떻게 구현되는지에 대한 몇 가지 실제 예를 제공해 주시겠습니까?

이것은 대답하기 어렵습니다. 이러한 모델은 상대적으로 초기 단계에 있으므로, 실제 시나리오에서 어떻게 사용되는지에 대한 정보가 많지 않습니다.

시간 시계열 언어 모델을 기존 데이터 인프라에 통합할 때 조직이 일반적으로 직면하는課題는 무엇입니까? 이러한課題를 어떻게 해결할 수 있습니까?

시간 시계열 언어 모델은 아직 매우 새로운 기술이므로, 조직이 직면하는課題는 정확하게 알 수 없습니다. 그러나 이러한 모델을 데이터 파이프라인에 통합할 때, 일반적인課題를 직면할 수 있습니다. 이러한課題에는 다음이 포함될 수 있습니다:

  • 데이터 호환성 및 통합 문제: 시간 시계열 언어 모델은 특정 데이터 형식, 일관된 타임스탬프, 정기적인 간격을 필요로 할 수 있습니다. 그러나 기존 데이터 인프라는 구조화되지 않은 또는 일관되지 않은 시간 시계열 데이터를 포함할 수 있습니다. 이러한 문제를 해결하기 위해, 팀은 데이터를 전처리, 정리, 및 정렬하기 위한 강력한 ETL 파이프라인을 구현해야 합니다.
  • 모델의 확장성 및 성능: 시간 시계열 언어 모델, 특히 트랜스포머와 같은 깊은 학습 모델은大量의 컴퓨팅 자원과 메모리를 필요로 할 수 있습니다. 팀은 모델을 확장 가능한 플랫폼에 배포하고, 필요에 따라 GPU 가속을 사용하며, 다스크 또는 레이와 같은 분산 처리 프레임워크를 사용하여 모델 추론을 병렬화해야 합니다.
  • 해석 가능성 및 신뢰성: 시간 시계열 모델, 특히 복잡한 언어 모델은 “블랙 박스”로 간주될 수 있습니다. 이것은 예측을 해석하기 어렵게 만들 수 있습니다. 특히 금융 또는 의료와 같은 규제 분야에서 이는 특히 문제가 될 수 있습니다.
  • 데이터 보안: 시간 시계열 데이터를 다루는 것은 종종 민감한 정보를 포함합니다. 따라서 데이터 보안과 규정 준수를 đảm보는 것이 중요합니다. 조직은 데이터 파이프라인과 모델이 보안最佳实践을 준수하는지 확인해야 합니다.

향후 시간 시계열 언어 모델의 역할이 예측 분석과 AI 분야에서 어떻게 진화할 것으로 보입니까? 특히 흥미로운 기술이나 트렌드는 무엇입니까?

시간 시계열 언어 모델의 다음 단계는 이러한 모델을 더 쉽게 배포, 접근, 및 사용할 수 있는 도구를 제공하는 것입니다. 저가 사용한 시간 시계열 언어 모델은 매우 특정한 환경을 필요로 하고, 튜토리얼이나 문서가 부족합니다. 그러나 이러한 프로젝트는 초기 단계에 있으며, 향후 몇 개월 및 년도에 어떻게 진화할지 흥미롭게 지켜볼 것입니다.

인터뷰 감사합니다. 더 많은 정보를 원하는 독자는 인플럭스데이터를 방문하십시오.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

作为 미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.