인터뷰
아스트로노머의 수석 부사장 스티븐 힐리온 – 인터뷰 시리즈

스티븐 힐리온은 아스트로노머의 수석 부사장으로서, 연구 수학 분야에서 학술적인 배경과 15년 이상의 실리콘 밸리의 기계 학습 플랫폼 개발 경험을 바탕으로 데이터와 인공지능 분야를 이끌고 있습니다. 아스트로노머에서 그는 ML과 AI 팀을 위한 아파치 에어플로우 기능을 개발하고 내부 데이터 과학 팀을 감독합니다. 그의 리더십 하에 아스트로노머는 현대적인 데이터 오케스트레이션 플랫폼을 발전시켜 다양한 데이터 소스와 작업을 지원하는 데이터 파이프라인 기능을 크게 향상시켰습니다.
데이터 과학 및 AI 분야에서您的 경험이 어떻게 귀하의 엔지니어링 및 분석 팀을 이끄는 접근 방식에 영향을 미쳤는지에 대해 알려주세요.
저는 버클리에서 연구 수학을 전공했습니다. 그 후 실리콘 밸리로 이동하여 여러 성공적인 스타트업에서 엔지니어로 일했습니다. 학계의 정치와 관료주의를 떠나서 기뻤지만, 몇 년 후에는 수학을 그리워하게 되었습니다. 그래서 기계 학습과 분석 플랫폼 개발로 전환했습니다. 그 때부터 지금까지 거의 동일한 일을 해왔습니다.
순수 수학을 전공한 덕분에 ‘파르시모니’라는 개념을 좋아하게 되었습니다. 즉, 작업에 적합한 올바른 도구를 사용하는 것입니다. 수학자들은 복잡한 기계보다 우아한 해결책을 선호하므로, 비즈니스 문제에 기계 학습을 적용할 때 단순성을 강조하려고 노력했습니다. 딥 러닝은 일부 응용 분야에 적합하지만, 때로는 단순한 회귀 모델이 더 적절하고 설명하기 쉽습니다.
데이터 과학자와 소프트웨어 엔지니어의 역할이 기계 학습이 널리 사용되기 시작한 지난 20년 동안 어떻게 변화했는지 보는 것이 흥미롭습니다. 두 역할을 모두 경험한 저는 기계 학습 프로젝트에 소프트웨어 개발 생명주기(특히 자동화와 테스트)의 중요성을 잘 알고 있습니다.
AI 및 대규모 언어 모델(LLM)을 위한 비정형 데이터를 이동, 처리, 분석하는 데 가장 큰 도전은 무엇입니까?
생성형 AI 세계에서 데이터는 가장贵重한 자산입니다. 모델은 점점 더 대중화되어 가므로, 귀하의 차별점은 하드 원데이트된 기관 지식이 캡처된 귀하의 독점적이고 큐레이션된 데이터 세트에 있습니다.
올바른 데이터를 올바른 시간에 제공하는 것은 데이터 파이프라인에 높은 요구를 가합니다. 이는 정형 데이터와 비정형 데이터 모두에 적용되며, 비정형 데이터의 경우에는 더 중요할 수 있습니다. 종종 다양한 소스에서 다양한 형식의 데이터를 수집해야 합니다. 데이터를 모델 추론 또는 모델 훈련에 사용할 준비를 하기 위해 데이터를 언패킹하고 준비하기 위한 다양한 방법에 액세스할 수 있어야 합니다. 또한 데이터의 출처를 이해하고 데이터가 어디에 끝나는지 보여주기 위해 “작업을 보여주기” 위해 데이터의 계보를 이해해야 합니다.
만약 모델을 훈련하기 위해 가끔 이렇게 하는 경우에는 괜찮습니다. 운영화할 필요는 없습니다. 그러나 모델을 일일이 사용하여 고객의 감정이나 서신을 요약하고 라우팅하는 경우에는, 이는 다른 운영 데이터 파이프라인과 마찬가지로 신뢰성과 재현성을 생각해야 합니다. 또는 모델을 정기적으로 미세 조정하는 경우에는 정확도와 비용을 모니터링해야 합니다.
좋은 소식은 데이터 엔지니어가 데이터 파이프라인을 관리하기 위한 훌륭한 플랫폼인 에어플로우를 개발했다는 것입니다. 이미 일부 세계에서 가장 정교한 ML 팀에 의해 모델 배포 및 모니터링을 관리하는 데 성공적으로 적용되었습니다. 따라서 모델은 새로운 것이지만, 오케스트레이션은 아닙니다.
합성 데이터를 사용하여 더 작은 모델을 미세 조정하여 정확도를 향상시키는 기술에 대해 자세히 설명해 주시겠습니까? 이것은 더 큰 모델을 훈련하는 것과 어떻게 비교되나요?
강력한 기술입니다. 가장 좋은 대규모 언어 모델을 생각해 볼 수 있습니다. 모델은 어떤 방식으로 세계에 대해 학습한 것을 캡처하고, 이를 더 작은 모델에 전달할 수 있습니다. 합성 데이터를 생성하여 더 작은 모델을 훈련하는 데 사용할 수 있습니다. 이는 지식 증류라고 하는 프로세스입니다. 이는 효율적인 더 작은 모델을 생성하는 데 도움이 되며, 특정 작업에서 잘 수행됩니다. 또한 개인 정보 문제를 피할 수 있으며, 훈련 데이터가 작거나 불완전한 경우 이를 채울 수 있습니다.
도메인 특정 생성형 AI 모델을 훈련하는 데 도움이 될 수 있으며, 때로는 더 큰 모델을 훈련하는 것보다 더 효과적일 수 있습니다.
데이터 과학자들은 오래전부터 합성 데이터를 생성해 왔으며, 데이터가 어지러진 경우에는 보간이 존재했습니다. 그러나 데이터에 편향을 도입하거나 데이터 분포에 대한 잘못된 가정하지 않도록 매우주의해야 했습니다. 이제 데이터를 합성하기가 훨씬 쉬워지고 강력해졌으므로, 오류를 크게 늘릴 수 있으므로 더주의해야 합니다.
생성된 데이터의 다양성이 부족하면 ‘모델 붕괴’를 일으킬 수 있습니다. 모델은 잘 작동하는 것으로 생각할 수 있지만, 전체 그림을 보지 못했기 때문입니다. 일반적으로 데이터 팀은 항상 훈련 데이터의 다양성이 부족한 것을 주의해야 합니다.
기본적으로, 합성 데이터 또는 유기적 데이터를 사용하는 경우, 모델을 훈련하거나 미세 조정하는 데 사용하는 경우, 계보와 품질이 중요합니다. 모델은 훈련 데이터만큼 좋은 것입니다. 합성 데이터는 민감한 데이터 세트를 노출하지 않고 나타내거나 대표적이지 않은 데이터 세트의 간격을 채우는 데 도움이 될 수 있는 훌륭한 도구일 수 있습니다. 그러나 데이터가 어디에서 왔는지 보여주는 문서화된 증거와 데이터의 품질 수준을 증명할 수 있어야 합니다.
아스트로노머의 귀하 팀은 데이터 파이프라인의 효율성과 신뢰성을 향상시키기 위해 어떤 혁신적인 기술을 구현하고 있습니까?
많습니다! 아스트로의 완전 관리형 에어플로우 인프라와 아스트로 하이퍼바이저는 동적 스케일링과 고급 헬스 메트릭을 통해 사전 모니터링을 지원합니다. 이는 리소스가 효율적으로 사용되고 시스템이 모든 규모에서 신뢰할 수 있음을 보장합니다. 아스트로는 데이터 중심 경고를 제공하며, 슬랙과 페이지 듀티와 같은 다양한 채널을 통해 사용자 정의 알림을 보낼 수 있습니다. 이는 문제가 확대되기 전에 적시에 개입할 수 있도록 합니다.
데이터 검증 테스트, 유닛 테스트 및 데이터 품질 확인은 데이터 파이프라인과 궁극적으로 비즈니스에 데이터를 제공하는 데 있어 신뢰성, 정확성 및 효율성을 보장하는 데 중요한 역할을 합니다. 이러한 확인은 데이터 파이프라인을 빠르게 구축하여 마감일을 đáp應하는 동안 오류를 잡고 개발 시간을 개선하며 배경에서 예기치 못한 오류를 줄이는 데 도움이 됩니다. 아스트로노머에서는 데이터 파이프라인 내에서 코드 기능을 확인하거나 통합 문제를 식별하기 위해 아스트로 CLI와 같은 도구를 구축했습니다.
생성형 AI 거버넌스의 진화는 어떻게 보시나요? 생성형 AI를 지원하기 위한 더 많은 도구를 만들기 위해 어떤 조치를 취해야 합니까?
거버넌스는 생성형 AI의 응용 프로그램이 성공적으로 사용되기 위해서는 필수적입니다. 이는 투명성과 재현성에 관한 것입니다. 결과가 어떻게 얻었는지, 어디에서 왔는지, 누구에 의해 왔는지 알고 있습니까? 에어플로우 자체는 이미 개별 데이터 파이프라인이 하는 일을 볼 수 있는 방법을 제공합니다. 사용자 인터페이스는 초기에 빠르게 채택된 이유 중 하나였으며, 아스트로노머에서는 팀과 배포 전체에 걸친 가시성을 추가했습니다. 또한 고객에게 플랫폼 사용, 성능 및 비용 할당에 대한 포괄적인 통찰력을 제공하는 보고서 대시보드를 제공합니다. 또한 아스트로 API를 통해 팀은 에어플로우 파이프라인을 프로그래매틱으로 배포, 자동화 및 관리할 수 있으며, 수동 프로세스와 관련된 위험을 완화하고 여러 에어플로우 환경을 관리할 때 무정지 작동을 보장합니다. 계보 기능은 플랫폼에 내장되어 있습니다.
이러한 모든 것이 데이터 거버넌스를 관리하는 데 도움이 되는 단계입니다. 저는 모든 규모의 회사에서 데이터 거버넌스가 AI 응용 프로그램에 대한 신뢰를 보장하기 위해 중요하다는 것을 인식하고 있다고 믿습니다. 이러한 인식과 인식은 데이터 거버넌스 도구에 대한 수요를 주도할 것이며, 생성형 AI가 普及됨에 따라 이러한 도구의 생성이 가속화될 것입니다. 그러나 이러한 도구는 더 큰 오케스트레이션 스택의 일부여야 하므로, 플랫폼을 구축하는 방식의 기본적인 부분으로 간주합니다.
아스트로노머의 솔루션이 클라이언트의 운영 효율성과 생산성을 어떻게 개선했는지에 대한 예를 제공해 주시겠습니까?
생성형 AI 프로세스는 복잡하고 리소스 집약적인 작업을 신중하게 최적화하고 반복적으로 실행해야 합니다. 아스트로, 아스트로노머의 관리형 아파치 에어플로우 플랫폼은 이러한 작업을 단순화하고 혁신을 신속하게 구현하는 데 도움이 되는 프레임워크를 제공합니다.
생성형 AI 작업을 오케스트레이션하여 비즈니스에서는 계산 리소스가 효율적으로 사용되고 워크플ロー가 최적화되고 실시간으로 조정됨을 보장할 수 있습니다. 이는 생성형 모델을 자주 업데이트하거나 재훈련해야 하는 환경에서 특히 중요합니다.
에어플로우의 워크플로우 관리와 아스트로노머의 배포 및 확장 기능을 활용하여 팀은 인프라 관리에 덜 시간을 할애하고 데이터 변환 및 모델 개발에 집중할 수 있습니다. 이는 생성형 AI 애플리케이션의 배포를 가속화하고 성능을 향상시킵니다.
이러한 방식으로 아스트로노머의 아스트로 플랫폼은 고객이 생성형 AI를 다양한 사용 사례에서 운영 효율성을 개선하는 데 도움을 주었습니다. 몇 가지 예를 들면, 전자 상거래 제품 검색, 고객 이탈 위험 분석, 지원 자동화, 법적 문서 분류 및 요약, 고객 리뷰에서 제품 통찰력을 얻기, 동적 클러스터 프로비저닝을 위한 제품 이미지 생성 등이 있습니다.
아스트로노머는 AI 및 ML 애플리케이션의 성능과 확장성을 향상시키는 데 어떤 역할을 합니까?
2024년에 생성형 AI를 사용하는 비즈니스에서는 확장성이 주요 도전입니다. 프로토 타입에서 생산까지 이동할 때, 사용자는 생성형 AI 앱이 신뢰할 수 있고 성능이 좋으며, 생성된 출력이 신뢰할 수 있기를 기대합니다. 이는 비용 효율적으로 수행되어야 하며, 모든 규모의 비즈니스에서 이를 활용할 수 있어야 합니다. 아스트로노머를 사용하면 작업을 수평으로 확장하여大量의 데이터 소스를 동적으로 처리할 수 있습니다. 아스트로는 배포와 호스팅 클러스터를 탄력적으로 확장할 수 있으며, 전용 기계 유형을 사용하는 큐 기반 작업 실행은 더 나은 신뢰성과 컴퓨팅 리소스의 효율적인 사용을 제공합니다. 비용 효율적인 부분을 도와주기 위해 아스트로는 스케일-투-제로 및 하이퍼네이션 기능을 제공하여 비용을 제어하고 클라우드 지출을 줄입니다. 또한 플랫폼의 비용에 대한 완전한 투명성을 제공합니다. 저의 데이터 팀은 사용량에 대한 보고서를 생성하여 매일 고객에게 제공합니다.
아스트로노머는 향후 AI 및 데이터 과학의 어떤 추세에 대해 흥미를 느끼고 있으며, 이러한 추세에 대비하여 어떻게 준비하고 있습니까?
설명 가능한 AI는 매우 중요한 개발 영역입니다. 매우 큰 모델의 내부 작동을 들여다보는 것은 거의 불가사의합니다. 또한 모델 훈련과 조정의 환경적 영향에 대한 커뮤니티의 노력에 관심이 있습니다. 아스트로노머에서는 최신 통합을 계속 업데이트하여 데이터 및 ML 팀이 모델 서비스와 효율적인 컴퓨팅 플랫폼에 연결할 수 있도록 합니다. 이는 데이터 및 ML 팀이 모델 서비스와 효율적인 컴퓨팅 플랫폼에 연결할 수 있도록 합니다.
고급 AI 도구와 전통적인 데이터 관리 시스템의 통합은 향후 몇 년 동안 어떻게 진화할 것으로 보십니까?
다atabricks와 Snowflake는 최근에 각기 다른 플랫폼에서 LLM의 사용과 개발을 통합하는 방법에 대한 발표를 했습니다. 다른 DBMS와 ML 플랫폼도 동일한 일을 할 것입니다. 데이터 엔지니어가 명령줄이나 SQL 프롬프트에서 이러한 강력한 방법에 쉽게 액세스할 수 있도록 하는 것은 훌륭합니다.
관계형 데이터베이스에서 기계 학습을 통합하는 것은 특히 흥미롭습니다. 기계 학습 방법이 SQL 표준에 통합되는 것을 기다렸지만, 두 분야가 결코 잘 맞지 않았습니다. 이번에는 다를 수도 있습니다.
대규모 언어 모델이 데이터 엔지니어의 작업을 지원하는 데에는 특히 성공적이었으며, 코드 생성에 성공했습니다. 초기에는 데이터 과학자에게 AI 주도 제안을 제공하는 것이 혼합되었습니다. 그러나 데이터 엔지니어에게는 훨씬 더 큰 잠재력이 있습니다. 왜냐하면 소프트웨어 엔지니어에게 프롬프트는 함수 이름이나 설명이지만, 데이터 엔지니어에게는 데이터도 있기 때문입니다. 모델이 유용하고 정확한 제안을 하기 위해 함께 작업할 수 있는 많은 컨텍스트가 있습니다.
데이터 과학자와 AI 엔지니어로서의 꿈을 꾸는 사람들에게 조언해 주시겠습니까?
실제로 해보세요. 애플리케이션을 구축하고 인공지능으로 보완하는 것이 매우 쉽습니다. 따라서 멋진 것을 구축하고, 감동받은 친구에게 보내거나, 저에게 보내주세요. 저는 그것을 확인해 보겠습니다!
열정을 가진 것을 찾고, 관련된 데이터를 좋은 소스로 찾는 것이 중요합니다. 저의 한 친구는 19세기부터 비정상적인 야구 시즌에 대한 분석을 수행하여 영화로 만들어질 만한 이야기를 발견했습니다. 또한 아스트로노머의 일부 엔지니어들은 일요일에 함께 모여 자가 치유 데이터 파이프라인을 위한 플랫폼을 구축했습니다. 몇 년 전에는 그렇게 하려고 시도하기조차 할 수 없었지만, 단 몇 일의 노력으로 코헤어의 해커톤에서 우승하고 플랫폼의 주요 새로운 기능을 구축할 수 있었습니다.
멋진 인터뷰에 감사드립니다. 더 많은 정보를 배우고 싶은 독자들은 아스트로노머를 방문하시기 바랍니다.












