Интервью

Ананд Каннаппан, генеральный директор и сооснователь Patronus AI – Интервью

mm
Добавьте Unite.AI в избранные источники в Google

Ананд Каннаппан является сооснователем и генеральным директором Patronus AI, первой в отрасли автоматической платформы оценки и безопасности ИИ, которая помогает предприятиям обнаруживать ошибки моделей машинного обучения в крупном масштабе. Ранее Ананд возглавлял усилия по объяснению моделей машинного обучения и продвинутому экспериментированию в Meta Reality Labs.

Что изначально привлекло вас к информатике?

В детстве я всегда был увлечен технологиями и их возможностью решать реальные проблемы. Идея создания чего-то с нуля, используя только компьютер и код, меня интриговала. Когда я глубже погрузился в информатику, я понял, какой огромный потенциал она имеет для инноваций и трансформации различных отраслей. Эта тяга к инновациям и желание сделать разницу изначально привлекли меня к информатике.

Не могли бы вы рассказать историю создания Patronus AI?

История создания Patronus AI довольно интересна. Когда OpenAI запустила ChatGPT, это стало самым быстрорастущим потребительским продуктом, собравшим более 100 миллионов пользователей всего за два месяца. Такой массовый прием подчеркнул потенциал генеративного ИИ, но также выявил осторожность предприятий при развертывании ИИ в таком быстром темпе. Многие компании были обеспокоены потенциальными ошибками и непредсказуемым поведением крупномасштабных языковых моделей (LLM).

Ребекка и я знаем друг друга много лет, изучая информатику вместе в Университете Чикаго. В Meta мы оба столкнулись с проблемами оценки и интерпретации выводов моделей машинного обучения – Ребекка с точки зрения исследования, а я – с точки зрения применения. Когда был объявлен ChatGPT, мы оба увидели трансформационный потенциал LLM, но также поняли осторожность, которую проявляли предприятия.

Переломный момент наступил, когда инвестиционный банк моего брата, Piper Sandler, решил запретить доступ к OpenAI внутри компании. Это заставило нас осознать, что хотя ИИ продвинулся значительно, все еще существует разрыв в принятии предприятиями из-за проблем с надежностью и безопасностью. Мы основали Patronus AI, чтобы устранить этот разрыв и повысить уверенность предприятий в генеративном ИИ, предоставив слой оценки и безопасности для LLM.

Можете ли вы описать основную функциональность платформы Patronus AI для оценки и обеспечения безопасности LLM?

Наша миссия – повысить уверенность предприятий в генеративном ИИ. Мы разработали первую в отрасли автоматическую платформу оценки и безопасности специально для LLM. Наша платформа помогает предприятиям обнаруживать ошибки в выводах LLM в крупном масштабе, что позволяет им развертывать продукты ИИ безопасно и уверенно.

Наша платформа автоматизирует несколько ключевых процессов:

  • Оценка: Мы оцениваем производительность модели в реальных сценариях, фокусируясь на важных критериях, таких как галлюцинации и безопасность.
  • Генерация тестов: Мы автоматически генерируем наборы тестов для проверки возможностей модели.
  • Бенчмаркинг: Мы сравниваем разные модели, чтобы помочь клиентам определить лучшее решение для своих конкретных случаев использования.

Предприятия предпочитают частые оценки, чтобы адаптироваться к эволюционирующим моделям, данным и потребностям пользователей. Наша платформа действует как доверенный第三ий оценщик, предоставляя объективную точку зрения, подобную Moody’s в области ИИ. Наши первые партнеры включают ведущие компании ИИ, такие как MongoDB (MDB ), Databricks, Cohere и Nomic AI, и мы ведем переговоры с несколькими известными компаниями традиционных отраслей, чтобы протестировать нашу платформу.

Какие типы ошибок или “галлюцинаций” обнаруживает модель Lynx Patronus AI в выводах LLM, и как она решает эти проблемы для предприятий?

LLM действительно являются мощными инструментами, но их вероятностная природа делает их склонными к “галлюцинациям” или ошибкам, когда модель генерирует неточную или нерелевантную информацию. Эти галлюцинации проблематичны, особенно в бизнес-среде, где точность имеет решающее значение.

Традиционно предприятия полагались на ручную проверку для оценки выводов LLM, процесс, который не только耗ет время, но и не масштабируем. Чтобы упростить это, Patronus AI разработала Lynx, специализированную модель, которая повышает возможности нашей платформы, автоматизируя обнаружение галлюцинаций. Lynx, интегрированная в нашу платформу, обеспечивает полное тестовое покрытие и гарантии производительности, фокусируясь на выявлении критических ошибок, которые могут существенно повлиять на бизнес-операции, такие как неправильные финансовые расчеты или ошибки в проверке юридических документов.

С помощью Lynx мы смягчаем ограничения ручной оценки через автоматическое тестирование и обеспечиваем обнаружение проблем, которые могут ускользнуть от человеческих оценщиков, предлагая предприятиям повышенную надежность и уверенность в развертывании LLM в критических приложениях.

FinanceBench описывается как первая в отрасли оценка производительности LLM на финансовых вопросах. Какие проблемы в финансовом секторе привели к разработке FinanceBench?

FinanceBench была разработана в ответ на уникальные проблемы, с которыми сталкивается финансовый сектор при принятии LLM. Финансовые приложения требуют высокого уровня точности и надежности, поскольку ошибки могут привести к значительным финансовым потерям или проблемам с регулированием. Несмотря на обещания LLM в обработке больших объемов финансовых данных, наши исследования показали, что передовые модели, такие как GPT-4 и Llama 2, испытывают трудности с финансовыми вопросами, часто не в состоянии извлечь точную информацию.

FinanceBench была создана как комплексная оценка для оценки производительности LLM в финансовых контекстах. Она включает 10 000 пар вопросов и ответов на основе публично доступных финансовых документов, охватывающих области, такие как числовые рассуждения, извлечение информации, логические рассуждения и мировые знания. Предоставляя эту оценку, мы стремимся помочь предприятиям лучше понять ограничения текущих моделей и выявить области для улучшения.

Наш первоначальный анализ показал, что многие LLM не соответствуют высоким стандартам, необходимым для финансовых приложений, подчеркивая необходимость дальнейшего совершенствования и целенаправленной оценки. С FinanceBench мы предоставляем ценный инструмент для предприятий, чтобы оценить и повысить производительность LLM в финансовом секторе.

Ваши исследования подчеркнули, что ведущие модели ИИ, особенно GPT-4, генерируют защищенный авторским правом контент на значительных уровнях при запросе отрывков из популярных книг. Что, по вашему мнению, являются долгосрочными последствиями этих результатов для разработки ИИ и более широкой технологической отрасли, особенно учитывая продолжающиеся дебаты вокруг ИИ и авторского права?

Проблема ИИ-моделей, генерирующих защищенный авторским правом контент, является сложной и насущной проблемой в отрасли ИИ. Наши исследования показали, что модели, такие как GPT-4, когда их запрашивают отрывки из популярных книг, часто воспроизводят защищенный авторским правом материал. Это вызывает важные вопросы об интеллектуальной собственности и юридических последствиях использования контента, сгенерированного ИИ.

В долгосрочной перспективе эти результаты подчеркивают необходимость более четких руководств и правил вокруг ИИ и авторского права. Отрасль должна работать над разработкой моделей ИИ, которые уважают права интеллектуальной собственности, сохраняя при этом свои творческие возможности. Это может включать совершенствование наборов данных для обучения, чтобы исключить защищенный авторским правом материал, или реализацию механизмов, которые обнаруживают и предотвращают воспроизведение защищенного контента.

Более широкая технологическая отрасль должна участвовать в постоянных обсуждениях с юридическими экспертами, политиками и заинтересованными сторонами, чтобы установить основу, которая сбалансирует инновации с уважением к существующим законам. По мере того, как ИИ продолжает развиваться, важно решать эти проблемы активно, чтобы обеспечить ответственное и этическое развитие ИИ.

Учитывая тревожную скорость, с которой передовые LLM воспроизводят защищенный авторским правом контент, как показано в вашем исследовании, какие шаги, по вашему мнению, разработчики ИИ и отрасль в целом должны предпринять, чтобы решить эти проблемы? Кроме того, как Patronus AI планирует внести свой вклад в создание более ответственных и правовых моделей ИИ в свете этих результатов?

Решение проблемы ИИ-моделей, воспроизводящих защищенный авторским правом контент, требует многогранного подхода. Разработчики ИИ и отрасль в целом должны уделять приоритетное внимание прозрачности и подотчетности в разработке моделей ИИ. Это включает в себя:

  • Улучшение отбора данных: Обеспечение того, чтобы наборы данных для обучения были тщательно отобраны, чтобы избежать защищенного авторским правом материала, если не получены соответствующие лицензии.
  • Разработка механизмов обнаружения: Реализация систем, которые могут выявить, когда модель ИИ генерирует потенциально защищенный авторским правом контент, и предоставление пользователям вариантов для изменения или удаления такого контента.
  • Установление отраслевых стандартов: Сотрудничество с юридическими экспертами и заинтересованными сторонами отрасли, чтобы создать руководства и стандарты для разработки ИИ, которые уважают права интеллектуальной собственности.

В Patronus AI мы привержены вкладу в ответственное развитие ИИ, фокусируясь на оценке и соблюдении требований. Наша платформа включает продукты, такие как EnterprisePII, которые помогают предприятиям обнаруживать и управлять потенциальными проблемами конфиденциальности в выводах ИИ. Предоставляя эти решения, мы стремимся дать предприятиям возможность использовать ИИ ответственно и этично, минимизируя при этом юридические риски.

С инструментами, такими как EnterprisePII и FinanceBench, какие сдвиги вы ожидаете в том, как предприятия развертывают ИИ, особенно в чувствительных областях, таких как финансы и личные данные?

Эти инструменты предоставляют предприятиям возможность оценить и управлять выводами ИИ более эффективно, особенно в чувствительных областях, таких как финансы и личные данные.

В финансовом секторе FinanceBench позволяет предприятиям оценить производительность LLM с высокой точностью, гарантируя, что модели соответствуют строгим требованиям финансовых приложений. Это позволяет предприятиям использовать ИИ для задач, таких как анализ данных и принятие решений, с большей уверенностью и надежностью.

Аналогично, инструменты, такие как EnterprisePII, помогают предприятиям ориентироваться в сложностях защиты данных. Предоставляя информацию о потенциальных рисках и предлагая решения для их смягчения, эти инструменты позволяют предприятиям развертывать ИИ более безопасно и ответственно.

В целом эти инструменты открывают путь к более информированному и стратегическому подходу к принятию ИИ, помогая предприятиям использовать преимущества ИИ, минимизируя при этом связанные с этим риски.

Как Patronus AI работает с компаниями, чтобы интегрировать эти инструменты в существующие развертывания и рабочие процессы LLM?

В Patronus AI мы понимаем важность бесшовной интеграции при принятии ИИ. Мы тесно сотрудничаем с нашими клиентами, чтобы обеспечить, что наши инструменты легко интегрируются в их существующие развертывания и рабочие процессы LLM. Это включает в себя предоставление клиентам:

  • Планы индивидуальной интеграции: Мы сотрудничаем с каждым клиентом, чтобы разработать индивидуальные планы интеграции, соответствующие их конкретным потребностям и целям.
  • Комплексную поддержку: Наша команда предоставляет постоянную поддержку на протяжении всего процесса интеграции, предлагая руководство и помощь, чтобы обеспечить плавный переход.
  • Обучение и образование: Мы предлагаем сессии обучения и образовательные ресурсы, чтобы помочь клиентам полностью понять и использовать наши инструменты, давая им возможность максимально использовать свои инвестиции в ИИ.

Учитывая сложности обеспечения того, чтобы выводы ИИ были безопасными, точными и соответствовали различным законам, какие советы вы дадите как разработчикам LLM, так и компаниям, желающим использовать их?

Приоритизируя сотрудничество и поддержку, мы стремимся сделать процесс интеграции как можно более простым и эффективным, позволяя предприятиям раскрыть полный потенциал наших решений ИИ.

Сложности обеспечения того, чтобы выводы ИИ были безопасными, точными и соответствовали различным законам, представляют значительные проблемы. Для разработчиков крупномасштабных моделей ИИ ключевым моментом является приоритет прозрачности и подотчетности на протяжении всего процесса разработки.

Одним из фундаментальных аспектов является качество данных. Разработчики должны обеспечить, чтобы наборы данных для обучения были хорошо отобраны и свободны от защищенного авторским правом материала, если не получены соответствующие лицензии. Это не только помогает предотвратить потенциальные юридические проблемы, но и гарантирует, что ИИ генерирует надежные выводы. Кроме того, решение проблемы предвзятости и справедливости имеет решающее значение. Активно работая над выявлением и смягчением предвзятости, и разрабатывая разнообразные и представительные наборы данных для обучения, разработчики могут уменьшить предвзятость и обеспечить справедливые результаты для всех пользователей.

Робустные процедуры оценки имеют важное значение. Реализация строгого тестирования и использование оценок, таких как FinanceBench, может помочь оценить производительность и надежность моделей ИИ, гарантируя, что они соответствуют требованиям конкретных случаев использования. Кроме того, этические соображения должны быть на переднем плане. Взаимодействие с этическими руководствами и рамками гарантирует, что системы ИИ разрабатываются ответственно и соответствуют ценностям общества.

Для компаний, желающих использовать LLM, понимание возможностей ИИ имеет решающее значение. Важно установить реалистичные ожидания и обеспечить, чтобы ИИ использовался эффективно внутри организации. Бесшовная интеграция и поддержка также имеют важное значение. Работая с доверенными партнерами, компании могут интегрировать решения ИИ в существующие рабочие процессы и обеспечить, чтобы их команды были обучены и поддержаны для эффективного использования ИИ.

Соблюдение требований и безопасность должны быть приоритизированы, с фокусом на соблюдении соответствующих правил и законов о защите данных. Инструменты, такие как EnterprisePII, могут помочь отслеживать и управлять потенциальными рисками. Постоянный мониторинг и регулярная оценка производительности ИИ также необходимы для поддержания точности и надежности, позволяя вносить необходимые корректировки.

Спасибо за отличное интервью, читатели, которые хотят узнать больше, могут посетить Patronus AI.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.