Интервью
Патриция Тейн, генеральный директор Private AI – Интервью

Патриция Тейн является сооснователем и генеральным директором Private AI, кандидатом на степень PhD по компьютерным наукам в Университете Торонто и постдокторантом в Институте Вектора, где она занимается исследованиями по сохранению конфиденциальности в обработке естественного языка, с упором на прикладную криптографию. Она также занимается исследованиями по вычислительным методам для дешифровки потерянных языков.
Патриция является получателем стипендии NSERC для аспирантов, стипендии RBC для аспирантов, стипендии Беатрис “Трикси” Уорсли для аспирантов по компьютерным наукам и стипендии правительства Онтарио для аспирантов. У нее есть восемь лет опыта исследований и разработки программного обеспечения, включая работу в лаборатории развития языка Макгилла, лаборатории компьютерной лингвистики Университета Торонто, департаменте лингвистики Университета Торонто и Публичном агентстве здравоохранения Канады.
Что изначально привлекло вас к информатике?
Способность решать проблемы и быть креативной одновременно. Это как ремесло. Вы можете увидеть, как ваши идеи продукта оживляют, как и мастер-столяр строит мебель. Как я однажды услышала, программирование – это самый лучший инструмент для творчества. Тот факт, что продукты, которые вы создаете, могут масштабироваться и использоваться людьми по всему миру, – это вишенка на торте.
Можете ли вы рассказать о истории создания Private AI и о том, как она возникла из вашего наблюдения, что не хватает инструментов, которые легко интегрируются для сохранения конфиденциальности?
Через речь и письмо мы производим и передаем некоторые из наших самых конфиденциальных данных компаниям, услугами которых мы пользуемся. Когда мы рассматривали, какие продукты NLP мы должны создать, мы поняли, что необходимо интегрировать уровень конфиденциальности, которого просто не существует на рынке. Чтобы использовать решения по конфиденциальности, компании должны были передать данные своих пользователей третьей стороне, использовать плохие открытые решения, которые просто не могут обеспечить надлежащую защиту конфиденциальности пользователей, или создать решение внутри компании с очень небольшим опытом в области конфиденциальности. Итак, мы решили сосредоточиться на создании лучших продуктов для разработчиков и команд ИИ, которым необходимо, чтобы результаты технологий, сохраняющих конфиденциальность, легко работали для их потребностей.
Почему сохранение конфиденциальности ИИ важно?
Примерно 80 процентов информации, которую мы производим, является неструктурированной, и ИИ – это единственный способ понять все эти данные. Его можно использовать для добра, например, для помощи в обнаружении падений среди пожилого населения, или для зла, например, для профилирования и отслеживания людей из недостаточно представленных групп населения. Обеспечение того, чтобы конфиденциальность была встроена в программное обеспечение, которое мы создаем, делает его намного более сложным для использования ИИ во вредном ключе.
Как конфиденциальность является конкурентным преимуществом?
Есть много причин, но вот несколько:
- Все больше и больше пользователей заботятся о конфиденциальности, и по мере того, как потребители становятся более образованными, эта проблема растет: 70 процентов потребителей обеспокоены конфиденциальностью своих данных.
- Это намного проще вести бизнес с другими компаниями, если у вас есть надлежащие протоколы и технологии защиты и конфиденциальности данных.
- Когда вы создаете продукты, сохраняющие конфиденциальность, вы лучше отслеживаете, где находятся уязвимости в вашей службе, и, особенно посредством минимизации данных, вы избавляетесь от данных, которые вам не нужны и которые могут вызвать проблемы при кибератаке.
Можете ли вы рассказать о важности конфиденциальности обучающих данных и почему она подвержена обратному инжинирингу?
Это отличный вопрос, и на эту тему необходимо провести больше образовательной работы. Упрощенно, модели машинного обучения запоминают информацию. Чем больше модели, тем больше они запоминают исключительные случаи. Это означает, что информация, на которой были обучены эти модели, может быть воспроизведена в производстве. Это было показано в нескольких исследовательских работах, включая The Secret Sharer: Evaluating and Testing Unintended Memorization in Neural Networks и Extracting Training Data from Large Language Models.
Было также показано, что личную информацию можно извлечь из word embeddings и, для тех, кто сомневается в том, что это реальная проблема, был скандал в этом году, когда корейский чат-бот писал пользовательские данные в чатах с другими пользователями.
Каково ваше мнение о федеративном обучении и конфиденциальности пользователей?
Федеративное обучение – это отличный шаг, когда это позволяет использовать случай. Однако все еще возможно извлечь информацию об входных данных пользователя из обновлений весов, отправляемых в облако с устройства конкретного пользователя, поэтому важно сочетать федеративное обучение с другими технологиями, сохраняющими конфиденциальность (дифференциальная конфиденциальность и гомоморфное шифрование/безопасное многопартийное вычисление). Каждая технология, сохраняющая конфиденциальность, должна быть выбрана в зависимости от случая – ни одна из них не может быть использована как молоток, чтобы решить все проблемы. Мы рассматриваем это решение здесь. Одним из больших преимуществ является то, что вы никогда не отправляете свои сырые данные вне своего устройства. Одним из больших недостатков является то, что если вам нужно получить данные, чтобы отладить систему или увидеть, правильно ли она обучается, становится намного более сложным получить эти данные. Федеративное обучение – это отличный старт с множеством нерешенных проблем, над которыми работают исследования и промышленность.
Private AI позволяет разработчикам интегрировать анализ конфиденциальности с помощью нескольких строк кода, чтобы обеспечить конфиденциальность, как это работает?
Наша технология работает как REST API, которому наши пользователи отправляют POST-запросы с текстом, который они хотят редактировать, деидентифицировать или псевдонимизировать/аугментировать реальными данными. Некоторые из наших клиентов отправляют через транскрипты звонков, которые необходимо редактировать, чтобы соответствовать требованиям PCI, в то время как другие отправляют через весь чат, чтобы затем использовать эту информацию для обучения чат-ботов, анализаторов настроений или других моделей NLP. Наши пользователи также могут выбрать, какие сущности они хотят сохранить или даже использовать в качестве метаданных для отслеживания, где хранятся личные данные. Мы удаляем боль, связанную с обучением точной системы для обнаружения и замены личной информации в действительно грязных данных.
Почему конфиденциальность для устройств IoT является текущей проблемой, и каково ваше мнение о ее решении?
В конечном итоге, лучший способ решить проблему конфиденциальности сильно зависит от конкретного случая, и устройства IoT не являются исключением. Хотя некоторые случаи могут полагаться на развертывание на краю, вывод на краю и сохраняющее конфиденциальность федеративное обучение (например, crowd sensing в умных городах), другие случаи могут потребовать агрегации данных и анонимизации (например, информация об энергопотреблении). С учетом этого, устройства IoT – это идеальный пример того, как конфиденциальность и безопасность должны идти рука об руку. Эти устройства известны своей уязвимостью к кибератакам, поэтому существует только столько, что технологии, сохраняющие конфиденциальность, могут сделать без исправления основных уязвимостей устройств. С другой стороны, без размышлений о способах улучшения конфиденциальности пользователей информация, собранная внутри наших домов, может быть передана, неограниченно, неизвестным сторонам, что делает чрезвычайно сложным гарантировать безопасность информации. У нас есть два фронта для улучшения здесь, и проект законодательства, который в настоящее время разрабатывается Европейской комиссией по безопасности устройств IoT, может оказаться тем, что заставит производителей устройств серьезно отнестись к своей ответственности за безопасность и конфиденциальность потребителей.
Есть ли что-то еще, что вы хотели бы поделиться о Private AI?
Мы – группа экспертов в области конфиденциальности, естественного языка, устной речи, обработки изображений, развертывания моделей машинного обучения в средах с ограниченными ресурсами, поддерживаемая фондом M12, венчурным фондом Microsoft (MSFT ).
Мы гарантируем, что продукты, которые мы создаем, наряду с тем, что они очень точны, также являются вычислительно эффективными, поэтому у вас не будет огромного счета за облако в конце месяца. Кроме того, данные наших клиентов никогда не передаются нам – все обрабатывается в их собственной среде.
Спасибо за отличное интервью, чтобы узнать больше, посетите Private AI.












