Интервью
Эми Стейер, главный ученый-машиностроитель в Gretel.ai – Интервью

Эми Стейер является главным ученым-машиностроителем в Gretel.ai, самой передовой платформе для инженерии конфиденциальности в мире. Gretel делает легко интегрировать конфиденциальность по умолчанию в основу технологий, ориентированных на данные. Ее библиотеки, основанные на искусственном интеллекте и открытом исходном коде, предназначены для преобразования, анонимизации и синтеза конфиденциальной информации.
Эми – высококвалифицированный ученый-машиностроитель и специалист по данным с более чем 20-летним опытом. Ее страсть – большие данные и выявление скрытых интеллекта с помощью методов машинного обучения,)data mining, искусственного интеллекта и статистики. Она высококвалифицирована в прогностическом моделировании, классификации, кластеризации, обнаружении аномалий, визуализации данных, ансамблевых методах, информационном поиске, кибербезопасности, NLP, моделях рекомендаций и анализе поведения пользователей.
Что изначально привлекло вас к карьере в области компьютерных наук и машинного обучения?
Моя чистая, неограниченная, постоянная любовь к данным. Возможности, загадки, интриги и потенциал данных всегда меня fascинировали. Компьютерные науки и машинное обучение – это инструменты для использования этого потенциала. Также очень весело работать в области, где состояние искусства развивается так быстро. Мне нравится пересечение исследований и продукта. Очень приятно взять передовые идеи, немного их доработать и затем преобразовать их в существующие, осязаемые потребности продукта.
Для читателей, которые не знакомы, могли бы вы объяснить, что такое синтетические данные?
Синтетические данные – это данные, которые выглядят и ведут себя как исходные данные, но также достаточно khácны, чтобы удовлетворять некоторому случаю использования. Самый распространенный случай использования – необходимость защиты конфиденциальности информации в исходных данных. Другой случай использования – необходимость создания дополнительных данных для увеличения размера исходного набора данных. Еще один случай использования – помощь в решении проблемы несбалансированности классов или демографических предубеждений в исходном наборе данных.
Синтетические данные позволяют нам продолжать разрабатывать новые и инновационные продукты и решения, когда данные, необходимые для этого, в противном случае не были бы доступны.
Как работает платформа Gretel для создания синтетических данных через API?
API инженерии конфиденциальности Gretel позволяют вам загрузить данные в Gretel и изучить данные, которые мы можем извлечь. Это те же API, которые используются нашей консолью. Открывая API через интуитивно понятный интерфейс, мы надеемся дать возможность разработчикам и специалистам по данным создавать свои собственные рабочие процессы вокруг Gretel.
Хотя консоль делает создание синтетических данных очень простым, API позволяют вам интегрировать создание синтетических данных в ваш рабочий процесс. Мне нравится использовать API, поскольку они позволяют мне настроить создание синтетических данных для очень конкретного случая использования.
Могли бы вы обсудить некоторые инструменты, которые предлагает Gretel для оценки качества синтетических данных?
После создания синтетических данных Gretel генерирует отчет о синтетических данных. В этом отчете вы можете увидеть балл качества синтетических данных (SQS), а также оценку уровня защиты конфиденциальности (PPL).
Балл SQS – это оценка того, насколько хорошо сгенерированные синтетические данные сохраняют статистические свойства исходного набора данных. В этом смысле балл SQS можно рассматривать как оценку полезности или доверия к тому, что научные выводы, сделанные на основе синтетического набора данных, будут одинаковыми, если бы вы использовали исходный набор данных.
Балл качества синтетических данных рассчитывается путем объединения отдельных метрик качества: стабильности распределения полей, стабильности корреляции полей и стабильности глубокой структуры.
Стабильность распределения полей – это мера того, насколько хорошо синтетические данные сохраняют те же распределения полей, что и в исходных данных. Стабильность корреляции полей – это мера того, насколько хорошо корреляции между полями сохраняются в синтетических данных. Стабильность глубокой структуры измеряет статистическую целостность более глубоких, многофакторных распределений и корреляций. Для оценки этого Gretel сравнивает анализ главных компонентов (PCA), вычисленный сначала на исходных данных, а затем на синтетических данных.
Как работают фильтры конфиденциальности Gretel?
Фильтры конфиденциальности Gretel были результатом обширных исследований по природе атак на синтетические данные. Фильтры конфиденциальности предотвращают создание синтетических данных с уязвимостями, которые часто используются атаками. У нас есть два фильтра конфиденциальности: фильтр подобия и фильтр аномалий. Фильтр подобия предотвращает создание синтетических записей, которые слишком похожи на записи обучения. Эти записи являются основными целями атак, которые пытаются получить информацию об исходных данных. Второй фильтр конфиденциальности – фильтр аномалий. Он предотвращает создание синтетических записей, которые будут считаться аномалиями в пространстве, определённом обучающими данными. Аномалии, выявленные в синтетическом наборе данных, могут быть использованы атаками на определение принадлежности и атрибутов, а также другими видами атак. Они представляют серьезный риск для конфиденциальности.
Как синтетические данные могут помочь в снижении предубеждений в ИИ?
Самый распространенный метод – решение проблемы представительного предубеждения данных, которые поступают в систему ИИ. Например, если в ваших данных есть сильный дисбаланс классов или демографические предубеждения, Gretel предлагает инструменты для измерения и решения этих проблем в синтетических данных. Удаляя предубеждения из данных, вы часто удаляете предубеждения и из системы ИИ, построенной на этих данных.
Вы явно любите узнавать о новых технологиях машинного обучения, как вы лично следите за всеми изменениями?
Читаю, читаю и еще раз читаю, lol! Мне нравится начинать свой день с чтения о новых технологиях машинного обучения. Мне нравится читать статьи в Towards Data Science, Analytics Vidhya и новостные рассылки, такие как The Sequence. Facebook (META ) AI, Google (GOOGL ) AI и OpenMined имеют отличные блоги. Есть множество хороших конференций, за которыми стоит следить, таких как NeurIPS, ICML, ICLR, AISTATS.
Мне также нравятся инструменты, которые отслеживают цитаты, помогают найти статьи, подобные тем, которые вам нравятся, и которые узнают ваши конкретные интересы и всегда следят за статьями, которые могут вас заинтересовать. Zeta Alpha – один из таких инструментов, который я часто использую.
Наконец, вы не можете переоценить пользу от того, что у вас есть коллеги с подобными интересами. В Gretel команда машинного обучения отслеживает исследовательские статьи, связанные с областями, которые мы исследуем, и часто собирается, чтобы обсудить интересные статьи.
Каково ваше видение будущего машинного обучения?
Легкий доступ к данным запустит великую эру инноваций в машинном обучении, которое затем ускорит инновации в широком спектре областей, таких как здравоохранение, финансы, производство и биологические науки. Исторически многие прорывные достижения в машинном обучении можно отнести к большому объему богатых данных. Однако исторически многие исследования были затруднены из-за невозможности доступа или обмена данными из-за проблем с конфиденциальностью. Когда инструменты, такие как Gretel, удаляют этот барьер, доступ к данным будет демократизирован. Всему сообществу машинного обучения будет полезно иметь доступ к богатым, большим наборам данных, а не только нескольким элитным мегакомпаниям.
Есть ли что-то еще, что вы хотели бы поделиться о Gretel?
Если вы любите данные, вы полюбите Gretel (так что rõчно, что я люблю Gretel!). Легкий доступ к данным был шипом в боку каждого специалиста по данным, которого я когда-либо знал. В Gretel мы гордимся тем, что создали консоль и набор API, которые делают создание частных, обменяемых данных таким простым, как это только возможно. Мы глубоко убеждены, что данные более ценны, когда они обмениваются.
Спасибо за отличное интервью и за то, что поделились своими идеями. Читателям, которые хотят узнать больше, следует посетить Gretel.ai.












