인터뷰
에이미 스타이어, 그레텔.ai의 주요 머신 러닝 과학자 – 인터뷰 시리즈

에이미 스타이어는 세계에서 가장 고급적인 프라이버시 엔지니어링 플랫폼인 그레텔.ai의 주요 머신 러닝 과학자입니다. 그레텔은 데이터 주도 기술의 기본으로 프라이버시를 쉽게 통합할 수 있도록 합니다. 그레텔의 AI 기반, 오픈 소스 라이브러리는 민감한 정보를 변환, 익명화, 합성하기 위한 것입니다.
에이미는 20년 이상의 경험을 가진 매우 유능한 머신 러닝 및 데이터 과학자입니다. 그녀의 열정은 빅 데이터와 머신 러닝, 데이터 마이닝, 인공 지능, 통계학의 기술을 사용하여 숨겨진 지능을 표면화하는 것입니다. 그녀는 예측 모델링, 분류, 클러스터링, 이상값 감지, 데이터 시각화, 앙상블 방법, 정보 검색, 사이버 보안 분석, NLP, 추천 모델, 사용자 행동 분석 등에서 매우熟練합니다.
컴퓨터 과학 및 머신 러닝 분야에서 경력을 추구하기로 결정한 초기 동기는 무엇인가?
私の純粋한, 숨겨진, 지속적인 데이터에 대한 사랑입니다. 데이터의 힘, 신비, 매력, 잠재력은 항상 저를 매료시킵니다. 컴퓨터 과학 및 머신 러닝은 그 잠재력을 활용하기 위한 도구입니다. 연구와 제품의 교차점에서 일하는 것은 매우 재미있고 만족스럽습니다. 가장 앞선 아이디어를 조금 더 발전시키고, 이후에 구체적인 제품 요구에 맞게 변형하는 것은 매우 유익합니다.
초보자에게 합성 데이터가 무엇인지 설명해 주시겠습니까?
합성 데이터는 원본 데이터와 비슷하게 보이지만 원본 데이터와는 충분히 다른 데이터입니다. 가장 일반적인 사용 사례는 원본 데이터의 프라이버시를 보호하는 것입니다. 또 다른 사용 사례는 원본 데이터셋의 크기를 증가시키기 위한 추가 데이터를 생성하는 것입니다. 또 다른 사용 사례는 원본 데이터셋의 클래스 불균형이나 民族적 편향을 해결하는 데 도움이 됩니다.
합성 데이터를 사용하면 원래 데이터가 없거나 사용할 수 없는 경우에도 새로운 제품과 솔루션을 개발할 수 있습니다.
그레텔 플랫폼은 어떻게 합성 데이터를 생성하기 위한 API를 제공합니까?
그레텔의 프라이버시 엔지니어링 API를 사용하면 데이터를 그레텔에 입력하고 추출할 수 있는 데이터를 탐색할 수 있습니다. 이러한 API는 콘솔에서 사용하는 동일한 API입니다. API를 노출함으로써, 우리는 개발자와 데이터 과학자들이 그레텔을 중심으로 워크플ロー를 구축할 수 있도록 지원하고자 합니다.
콘솔을 사용하면 합성 데이터를 생성하기가 매우 쉽지만, API를 사용하면 워크플로에 합성 데이터 생성을 통합할 수 있습니다. 저는 특정 사용 사례에 맞게 합성 데이터 생성을 사용자 정의할 수 있기 때문에 API를 사용하는 것을 좋아합니다.
그레텔이 제공하는 합성 데이터의 품질을 평가하는 도구에 대해 설명해 주시겠습니까?
합성 데이터를 생성한 후, 그레텔은 합성 리포트를 생성합니다. 이 리포트에는 합성 데이터 품질 점수(SQS)와 프라이버시 보호 수준 등급(PPL)이 포함됩니다.
SQS 점수는 생성된 합성 데이터가 원본 데이터셋의 통계적 속성을 얼마나 잘 유지하는지에 대한 추정치입니다. 이 점수는 유틸리티 점수 또는 원본 데이터셋 대신 합성 데이터셋을 사용하여 얻은 과학적 결론이 동일한지에 대한 신뢰도 점수로 볼 수 있습니다.
합성 데이터 품질 점수는 필드 분포 안정성, 필드 상관관계 안정성, 및 심층 구조 안정성과 같은 개별 품질 지표를 결합하여 계산됩니다.
필드 분포 안정성은 합성 데이터가 원본 데이터의 필드 분포를 얼마나 잘 유지하는지 측정합니다. 필드 상관관계 안정성은 합성 데이터에서 필드 간의 상관관계가 얼마나 잘 유지되는지 측정합니다. 심층 구조 안정성은 합성 데이터의 통계적 무결성을 측정합니다. 이를 위해 그레텔은 원본 데이터와 합성 데이터에 대해 주성분 분석(PCA)을 수행합니다.
그레텔의 프라이버시 필터는 어떻게 작동합니까?
그레텔의 프라이버시 필터는 합성 데이터에 대한 적대적 공격의 특성을 연구한 결과입니다. 프라이버시 필터는 합성 데이터의 약점을 방지합니다. 우리는 두 가지 프라이버시 필터를 제공합니다. 첫 번째는 유사성 필터이고, 두 번째는 아웃라이어 필터입니다. 유사성 필터는 원본 데이터와 너무 유사한 합성 레코드를 생성하는 것을 방지합니다. 아웃라이어 필터는 합성 레코드가 원본 데이터의 아웃라이어로 간주되는 것을 방지합니다. 이러한 아웃라이어는 회원 추론 공격, 속성 추론, 및 기타 다양한 적대적 공격의 대상이 될 수 있습니다.
합성 데이터는 어떻게 인공 지능의 편향을 줄이는 데 도움이 될 수 있습니까?
가장 일반적인 방법은 데이터의 대표성 편향을 해결하는 것입니다. 예를 들어, 데이터에 강한 클래스 불균형이나 民族적 편향이 있는 경우, 그레텔은 편향을 측정하고 합성 데이터에서 이를 해결하는 도구를 제공합니다. 데이터의 편향을 제거하면 인공 지능 시스템의 편향도 종종 제거됩니다.
새로운 머신 러닝 기술에 대해 배우는 것을 즐기는데, 어떻게 최신 기술을 따라잡습니까?
읽기, 읽기, 그리고 또 읽기입니다! 저는 새로운 머신 러닝 기술에 대해 읽는 것을 즐기고, 하루를 시작하는 데 도움이 됩니다. 저는 Towards Data Science, Analytics Vidhya, The Sequence와 같은 블로그를 읽는 것을 좋아합니다. Facebook (META ) AI, Google (GOOGL ) AI, OpenMined와 같은 곳은 훌륭한 블로그를 가지고 있습니다. NeurIPS, ICML, ICLR, AISTATS와 같은 많은 좋은 컨퍼런스를 따라가고 있습니다.
저는 또한 논문 추적 도구, 관심사에 따라 논문을 찾는 도구, 및 저의 관심사에 따라 배경에서 논문을 감시하는 도구를 사용합니다. Zeta Alpha는 제가 자주 사용하는 도구입니다.
마지막으로, 관심사가 같은 동료를 가지면 큰 도움이 됩니다. 그레텔에서 머신 러닝 팀은 우리가 탐구하는 분야에 관련된 연구 논문을 추적하고, 관심 있는 논문에 대해 자주 논의합니다.
머신 러닝의 미래에 대한 비전은 무엇입니까?
데이터에 대한 접근성이 머신 러닝의 혁신을 가속화할 것입니다. 이는 의료, 금융, 제조, 생명과학 등 다양한 분야에서 혁신을 불러올 것입니다. 역사적으로, 많은 획기적인 머신 러닝의 발전은大量의 풍부한 데이터에 기인합니다. 그러나 역사적으로, 많은 연구는 데이터에 접근하거나 공유할 수 없는 이유로 제한되었습니다. 그레텔과 같은 도구가 이러한 장벽을 제거하면 데이터에 대한 접근성이 민주화될 것입니다. 머신 러닝 커뮤니티 전체가 풍부한 데이터에 접근할 수 있게 될 것입니다.
그레텔에 대해 더 공유하고 싶은 내용이 있습니까?
데이터를 사랑한다면, 그레텔을 사랑할 것입니다! 데이터에 대한 접근성이 데이터 과학자에게 있어 가장 큰 걸림돌입니다. 그레텔에서 우리는 프라이버시가 있는 공유 가능한 데이터를 생성하기 위한 콘솔과 API를 만들었다는 것을 자랑스럽게 생각합니다. 우리는 데이터가 공유될 때 더 가치가 있다고 믿습니다.
그레텔에 대해 더 배우고 싶은 독자들은 그레텔.ai를 방문하시기 바랍니다.












