인터뷰
로샨나크 후만파르, Integrate.ai의 머신러닝 제품 부사장 – 인터뷰 시리즈

로샨나크 (로) 후만파르(Roshanak (Ro) Houmanfar)는 Integrate.ai의 머신러닝 제품 부사장입니다. Integrate.ai는 개발자가 민감한 데이터를 위험에 빠뜨리지 않고 세계에서 가장 중요한 문제를 해결하도록 도와주는 회사입니다. 로는 복잡한 AI 개념을 단순화하고 사용자需求과 연결하는 새로운 방법을 찾는 특별한 재능을 가지고 있습니다. 이 전문성을 활용하여, 그녀는 Integrate.ai의 사명인 개인 정보 보호 기술에 대한 접근을 민주화하는 최전선에 서 있습니다.
데이터 과학 및 머신러닝에 처음 관심을 갖게 된 계기는 무엇인가?
저는 로봇공학을 공부하면서 시작했습니다. 로봇공학의 다양한 측면을 실험한 후, 용접 연구실을 불태워 버린 후, 저는 제 분야의 인공 지능 측면에 더 끌렸고, 그것이 저를 머신러닝의 멋진 세계로 이끌었습니다.
현재 역할과 평균적인 하루는 무엇인가?
저는 Integrate.ai의 제품 부사장입니다. Integrate.ai는 개발자가 민감한 데이터를 위험에 빠뜨리지 않고 세계에서 가장 중요한 문제를 해결하도록 도와주는 SaaS 회사입니다. 우리는 분산된 데이터의 미래를 위한 개인 정보 보호가 안전한 머신러닝과 분석을 위한 도구를 구축하고 있습니다.
제 일일 작업에서는 다음과 같은 세 가지 사항을 달성하기 위해 기능별 팀과 협력합니다:
지능의 미래가 무엇일 수 있는지 생각하고, 어떻게 그 미래를 형성할 수 있는지
고객의痛点을 이해하고, 어떻게 혁신하여 고객의 작업을 더 영향력 있게하고 효율적으로 만들 수 있는지
제품 개발에서 우리의 비전과 고객 피드백이 항상 고려되도록 팀과 협력하여 최고의 기능을 제공합니다.
합성 데이터는 현재 머신러닝에서 모든 화제입니다. 그러나 Integrate.ai는有点 다른 접근 방식을 취합니다. 합성 데이터가 바람직하지 않은 몇 가지 응용 분야는 무엇인가?
합성 데이터가 언제 가장 적합한지 이해하기 위해서는, 먼저 합성 데이터가 언제 사용되어야 하는지 이해해야 합니다. 합성 데이터는 모델링 대상에 실제 데이터가 거의 없거나 전혀 없을 때 사용됩니다. 예를 들어, 콜드 스타트 문제와 텍스트 및 이미지 기반 모델 훈련에서 합성 데이터를 사용합니다. 때때로, 모델을 훈련하는 데 필요한 데이터가 충분하지 않습니다. 이러한 경우에 합성 데이터가 해결책으로 떠오릅니다.
그러나 합성 데이터는 실제 데이터가 충분히 존재하지만, 개인 정보 보호 규정, 중앙화 비용 또는 기타 상호 운용성 장벽으로 인해 데이터가 분리된 상황에서 사용되고 있습니다. 이는 합성 데이터의 오남용입니다. 이러한 사용 사례에서, 합성 데이터 생성을 위한 적절한 추상화 수준을 결정하기가 어렵습니다. 이는 합성 데이터의 품질이 낮아지거나, 모델 훈련 중에 발생하는 문제를 디버깅하기 어렵습니다. 또한, 실제 데이터와 비교할 때 합성 데이터로 훈련된 모델의 성능이 낮습니다.
Integrate.ai는 연합 학습(federated learning) 솔루션을 제공합니다. 연합 학습이란 무엇인가?
전통적인 머신러닝에서는 모든 모델 훈련 데이터가 중앙 집중식 데이터베이스에 저장되어야 합니다. 그러나 연합 학습에서는 모델이 분산된 데이터セット에서 훈련될 수 있습니다. 즉, 데이터가 두 개 이상의 별도 데이터베이스에 저장되어 있고, 쉽게 이동할 수 없는 경우에 연합 학습을 사용할 수 있습니다. 연합 학습에서는 각 데이터셋에서 모델의 일부를 훈련하고, 모델 매개변수를 공유하여 개선된 전역 모델을 생성합니다. 또한, 데이터가 시스템 내에서 이동하지 않기 때문에, 개인 정보 보호 및 보안 규정, 비용 또는 중앙화 문제와 같은 장애물 없이 모델을 훈련할 수 있습니다.
일반적으로, 연합 학습에서 사용할 수 있는 훈련 데이터의 품질은 중앙 집중식 데이터에 비해 더 높습니다. 중앙 집중식 데이터는 한 곳에 쉽게 접근할 수 있지만, 그 과정에서 일부 세부 정보가 손실될 수 있습니다.
기업은 연합 학습의 최적 사용 사례를 어떻게 식별할 수 있나요?
연합 학습은 데이터에 접근하거나 전통적인 머신러닝 인프라에 중앙 집중식 데이터 레이크를 구축하는 것이 어려운 상황에서 사용되는 기술 스택입니다. 다음 증상 중 하나를 경험하고 있다면, 연합 학습이 적합합니다:
- 분석 및 머신러닝을 사용하는 스마트 제품을 제공하지만, 데이터가 고객이 소유하고 있기 때문에 네트워크 효과를 만들 수 없습니다.
- 데이터에 접근하기 위해 파트너와의 장기 서비스 계약 또는 데이터 공유 계약을 체결하는 데 시간이 걸리고 있습니다.
- 특히 데이터 파트너십의 결과가 불분명한 상황에서 파트너와의 협력 계약을 체결하는 데 많은 시간을 소요하고 있습니다.
- 데이터를 보유하고 있지만, 데이터를 공유하는 것에 대한 영향으로 인해 데이터를 수익화하는 것을 두려워하고 있습니다.
- 이미 데이터를 수익화하고 있지만, 데이터를 공유하기 전에 데이터를 안전하게 만드는 데 많은 시간과 노력, 비용을 투자하고 있습니다.
- 클라우드 이동 중에 인프라가 뒤처져서 분석 및 머신러닝이 필요한데, 아직 클라우드에 이동하지 못했습니다.
- 同じ 조직에 속하는 여러 자회사들이 있지만, 직접 데이터를 공유할 수 없습니다.
- 처리하는 데이터셋이 너무 크거나 이동하는 데 비용이 많이 들기 때문에, 데이터를 사용하지 않거나, ETL 파이프라인이 많은 비용을 소요합니다.
- 데이터가 없지만, 데이터를 사용하여 큰 영향을 미칠 수 있는 응용 프로그램이나 기회가 있습니다.
- 머신러닝 모델의 성능이 정체되어, 모델을进一步 개선하는 방법을 모릅니다.
연합 학습과 함께 사용되는 차등 개인 정보 보호(differential privacy)는 무엇인가?
차등 개인 정보 보호는 머신러닝의 힘을 활용하면서 동시에 개인 정보 보호를 보장하는 기술입니다. 표준 비식별화 기술과 다른 수학을 사용하여, 차등 개인 정보 보호는 로컬 모델 훈련 중에 노이즈를 추가하여, 데이터셋의 통계적 특성을 대부분 보존하면서, 개인 데이터가 식별될 위험을 제한합니다.
이상적인 구현에서는, 차등 개인 정보 보호가 위험을 거의 0으로 낮추면서, 머신러닝 모델의 성능을 유지합니다. 이는 데이터 비식별화에 필요한 모든 보안을 제공하면서, 모델 결과의 품질을 저하시키지 않습니다.
차등 개인 정보 보호는 Integrate.ai 플랫폼에 기본적으로 포함되어 있으므로, 개발자는 모델 매개변수에서 개인 데이터를 추론할 수 없도록 할 수 있습니다.
Integrate.ai의 연합 학습 플랫폼은 어떻게 작동하는가?
우리의 플랫폼은 연합 학습 및 차등 개인 정보 보호 기술을 활용하여, 개인 정보 보호 및 보안 문제로 인해 접근하기 어려운 데이터에서 머신러닝 및 분석 기능을 제공합니다. 모델 훈련 및 분석과 같은 작업은 로컬에서 수행되고, 최종 결과만 보안 및 기밀성 있는 방식으로 집계됩니다.
Integrate.ai는 개발자 도구로 패키지화되어 있으며, 쉽게 사용할 수 있는 소프트웨어 개발 키트(SDK)와 클라우드 서비스를 통해 거의 모든 솔루션에 이러한 기능을 통합할 수 있습니다. 플랫폼이 통합되면, 최종 사용자는 민감한 데이터 세트에서 협업할 수 있으며, 데이터 관리자는 전체 제어를 유지합니다. Integrate.ai를 통합한 솔루션은 실험 도구와 프로덕션 준비 솔루션 모두로 사용할 수 있습니다.
정밀 진단에서 이 플랫폼을 사용할 수 있는 몇 가지 예는 무엇인가?
우리가 협력하는 파트너 네트워크 중 하나인 자폐증 공유 이니셔티브(Autism Sharing Initiative)는 자폐증 진단과 관련된 정보 및 유전체 데이터 샘플을 수집하여, 다양한 유전형과 표현형을 자폐증 진단과 연결하는 것을 목표로 합니다. 각 개인 데이터 사이트에는 모델을 훈련하는 데 필요한 데이터가 충분하지 않지만, 집합적으로 의미 있는 샘플 크기를 생성할 수 있습니다. 그러나, 데이터를 이동하는 것은 보안 및 개인 정보 보호에 높은 위험을 초래하며, 규정 및 병원 정책으로 인해, 이러한 연구 기관은 데이터를 공유하지 않는 것을 기본적으로 선택했습니다.
다른 네트워크에서는, 연구자들은 더 전체적인 환자 역사 관점에서 임상 시험을 환자에게 할당하는 것을 개선하고자 합니다.
연구에 참여하는 다양한 기관은 각 환자에 대한 정보를 다르게 가지고 있습니다. 한 연구소는 환자의 의료 스캔에 접근할 수 있고, 다른 연구소는 환자의 유전 정보에 접근할 수 있으며, 또 다른 기관은 환자의 임상 시험 결과에 접근할 수 있습니다. 그러나, 이러한 기관은 직접 데이터를 공유할 수 없습니다.
Integrate.ai의 솔루션을 사용하면, 각 기관은 데이터를 이동시키지 않고, 데이터 관리자가 데이터를 제어하는 동시에, 각자의 목표를 위해 데이터에 접근할 수 있습니다.
개인 정보 보호를 이해하기 쉽게 만드는 것의 중요성과 Integrate.ai가 이를 어떻게 가능하게 하는지에 대해 논의해 주시겠습니까?
개인 정보 보호를 이해하기 쉽게 만드는 것은, 역사적으로 개인 정보 보호의 모호한 성격으로 인해 폐쇄되었던 비즈니스와 조직에 많은 문을 열어줍니다. GDPR, CCPA, HIPPA와 같은 개인 정보 보호 규정은行业, 지역 및 데이터 유형에 따라 매우 복잡할 수 있으며, 조직이 어떤 데이터 프로젝트가 개인 정보 보호에 안전한지 결정하기 어렵게 만듭니다. 규제 요구 사항의 모든 항목을 확인하는 데 시간과 인력을浪費하지 않고, Integrate.ai의 연합 학습 플랫폼은 기본적으로 차등 개인 정보 보호, 동형 암호화, 보안 다자간 계산을 제공하므로, 개발자와 데이터 관리자는 프로젝트가 규제 요구 사항을 자동으로 준수한다는 것을 안심할 수 있습니다.
Integrate.ai에 대해 더 공유하고 싶은 내용이 있습니까?
Integrate.ai의 솔루션은 개발자 친화적인 도구로, 민감한 데이터 소스 위에 개인 정보 보호를 보장하는 머신러닝 및 분석을 제공합니다. 간단한 API를 통해, 모든 규제 준수 및 민감한 데이터에 대한 계약의 복잡성이 추상화됩니다. Integrate.ai의 솔루션은 데이터 과학자와 소프트웨어 개발자가 현재 인프라 및 워크플로에 최소한의 영향을 미치면서 작업을 안전하게 관리할 수 있도록 합니다.
멋진 인터뷰 감사합니다. 더 많은 정보를 원하는 독자는 Integrate.ai를 방문하십시오.












