Інтерв’ю
Ананд Каннаппан, генеральний директор та співзасновник Patronus AI – Інтерв’ю Серія

Ананд Каннаппан є співзасновником і генеральним директором Patronus AI, першої в галузі автоматизованої платформи оцінки та безпеки штучного інтелекту для допомоги підприємствам виявляти помилки великомасштабних мовних моделей.. Раніше Ананд очолював зусилля з пояснення машинного навчання та просунутого експериментування в Meta Reality Labs.
Що спочатку привернуло вас до комп’ютерних наук?
Виростаючи, я завжди був зацікавлений у технологіях і тому, як їх можна використовувати для вирішення реальних проблем. Ідея створення чогось з нуля лише за допомогою комп’ютера та коду здавалася мені привабливою. Коли я глибше занурився у комп’ютерні науки, я зрозумів, який величезний потенціал вони мають для інновацій та трансформації у різних галузях. Ця тяга до інновацій та бажання зробити різницю спочатку привернуло мене до комп’ютерних наук.
Чи можете ви розповісти історію створення Patronus AI?
Історія створення Patronus AI є досить цікавою. Коли OpenAI запустила ChatGPT, це стало найшвидше зростаючим споживчим продуктом, набравши понад 100 мільйонів користувачів лише за два місяці. Таке масове прийняття підкреслило потенціал генерації штучного інтелекту, але також показало, яку обережність підприємства мали при розгортанні штучного інтелекту такого швидкого темпу. Багато підприємств були стурбовані потенційними помилками та непередбачуваним поведінкою великомасштабних мовних моделей (LLM).
Ребекка та я знали один одного протягом років, вивчаючи комп’ютерні науки разом університеті Чикаго. У Meta ми обоє стикалися з проблемами оцінки та інтерпретації виводів машинного навчання—Ребекка з точки зору дослідження, а я з точки зору застосування. Коли було оголошено про ChatGPT, ми обоє побачили трансформаційний потенціал LLM, але також зрозуміли обережність, яку підприємства здійснювали.
Переломний момент настав, коли інвестиційний банк мого брата, Piper Sandler, вирішив заборонити внутрішній доступ до OpenAI. Це змусило нас зрозуміти, що хоча штучний інтелект значно просунувся, все ще існував розрив у прийнятті підприємств через проблеми з надійністю та безпекою. Ми заснували Patronus AI, щоб усунути цей розрив та підвищити довіру підприємств до генерації штучного інтелекту, забезпечуючи оцінку та безпеку великомасштабних мовних моделей.
Чи можете ви описати основну функціональність платформи Patronus AI для оцінки та забезпечення безпеки LLM?
Наша місія полягає у посиленні довіри підприємств до генерації штучного інтелекту. Ми розробили першу в галузі автоматизовану платформу оцінки та безпеки спеціально для LLM. Наша платформа допомагає підприємствам виявляти помилки у виводах LLM у великомасштабному режимі, дозволяючи їм розгортати продукти штучного інтелекту безпечно та з впевненістю.
Наша платформа автоматизує кілька ключових процесів:
- Оцінювання: Ми оцінюємо продуктивність моделі у реальних сценаріях, зосереджуючись на важливих критеріях, таких як галюцинації та безпека.
- Генерація тестів: Ми автоматично генеруємо набори тестів у великомасштабному режимі для суворої оцінки можливостей моделі.
- Бенчмаркінг: Ми порівнюємо різні моделі, щоб допомогти клієнтам визначити найкращий варіант для їхніх конкретних випадків використання.
Підприємства віддають перевагу частим оцінкам, щоб адаптуватися до розвитку моделей, даних та потреб користувачів. Наша платформа діє як довірений третій оцінювач, забезпечуючи необмежений погляд, подібний до Moody’s у сфері штучного інтелекту. Наші перші партнери включають провідні компанії з штучного інтелекту, такі як MongoDB (MDB ), Databricks, Cohere та Nomic AI, і ми ведемо переговори з кількома відомими компаніями традиційних галузей щодо пілотного запуску нашої платформи.
Які типи помилок або “галюцинацій” виявляє модель Lynx Patronus AI у виводах LLM, і як вона вирішує ці питання для підприємств?
Великомасштабні мовні моделі indeed є потужними інструментами, проте їхній вероятністський характер робить їх схильними до “галюцинацій”, або помилок, при яких модель генерує неточну або нерелевантну інформацію. Ці галюцинації є проблематичними, особливо у високоризикових бізнес-середовищах, де точність є критичною.
Традиційно підприємства покладалися на ручну перевірку для оцінки виводів LLM, процес, який не тільки тривалий, але й не масштабований. Для оптимізації цього процесу Patronus AI розробила Lynx, спеціалізовану модель, яка підвищує здатність нашої платформи автоматизувати виявлення галюцинацій. Lynx, інтегрована у нашу платформу, забезпечує повне тестування та надійні гарантії продуктивності, зосереджуючись на виявленні критичних помилок, які можуть суттєво вплинути на бізнес-операції, такі як неправильні фінансові розрахунки або помилки у перевірці юридичних документів.
З Lynx ми пом’якшуємо обмеження ручної оцінки за допомогою автоматизованого протидії тестування, досліджуючи широкий спектр потенційних сценаріїв відмов. Це дозволяє виявляти питання, які можуть ухилятися від людських оцінювачів, надаючи підприємствам підвищену надійність та впевненість у розгортанні LLM у критичних застосуваннях.
FinanceBench описується як перша в галузі оцінка для оцінки продуктивності LLM на фінансових питаннях. Які проблеми у фінансовому секторі спонукали розробку FinanceBench?
FinanceBench була розроблена у відповідь на унікальні проблеми, з якими стикається фінансовий сектор при прийнятті LLM. Фінансові застосування вимагають високого рівня точності та надійності, оскільки помилки можуть привести до суттєвих фінансових втрат або проблем з регулюванням. Незважаючи на перспективи LLM у обробці великих обсягів фінансових даних, наші дослідження показали, що передові моделі, такі як GPT-4 і Llama 2, боролися з фінансовими питаннями, часто не能够ючи отримати точну інформацію.
FinanceBench була створена як комплексна оцінка для оцінки продуктивності LLM у фінансовому контексті. Вона включає 10 000 пар питань та відповідей на основі публічно доступних фінансових документів, охоплюючи такі галузі, як числовий розрахунок, отримання інформації, логічний розрахунок та світові знання. Надавши цю оцінку, ми сподіваємося допомогти підприємствам краще зрозуміти обмеження поточних моделей та визначити області для покращення.
Наш початковий аналіз показав, що багато LLM не відповідають високим стандартам, необхідним для фінансових застосувань, підкресливши необхідність подальшого вдосконалення та цільової оцінки. З FinanceBench ми надаємо цінний інструмент підприємствам для оцінки та покращення продуктивності LLM у фінансовому секторі.
Ваша дослідження підкреслило, що провідні моделі штучного інтелекту, особливо GPT-4, генерують авторські права на суттєві рівні при використанні уривків з популярних книг. Які довгострокові наслідки цих висновків для розвитку штучного інтелекту та ширшої технологічної галузі, особливо з огляду на триваючі дебати щодо штучного інтелекту та законодавства про авторські права?
Проблема генерації моделями штучного інтелекту авторських прав є складною та нагальною проблемою у галузі штучного інтелекту. Наше дослідження показало, що моделі, такі як GPT-4, при використанні уривків з популярних книг, часто відтворюють авторські матеріали. Це піднімає важливі питання щодо прав інтелектуальної власності та юридичних наслідків використання змісту, згенерованого штучним інтелектом.
У довгостроковій перспективі ці висновки підкреслюють необхідність ясних керівних принципів та правил щодо штучного інтелекту та законодавства про авторські права. Галузь повинна працювати над розробкою моделей штучного інтелекту, які поважають права інтелектуальної власності, зберігаючи при цьому свої творчі можливості. Це може включати вдосконалення навчальних наборів даних для виключення авторських матеріалів або впровадження механізмів, які виявляють та запобігають відтворенню захищеного змісту.
Ширша технологічна галузь повинна займатися триваючими дискусіями з юридичними експертами, законодавцями та зацікавленими сторонами для встановлення рамок, які балансують інновації з повагою до існуючих законів. По мірі розвитку штучного інтелекту важливо адресувати ці проблеми проактивно, щоб забезпечити відповідальне та етичне розвиток штучного інтелекту.
Враховуючи тривожну швидкість, з якою провідні LLM відтворюють авторські права, як показало ваше дослідження, які кроки, на вашу думку, розробники штучного інтелекту та галузь у цілому повинні зробити для вирішення цих проблем? Крім того, як Patronus AI планує внесок у створення більш відповідальних та юридично відповідних моделей штучного інтелекту у світлі цих висновків?
Для вирішення проблеми генерації моделями штучного інтелекту авторських прав потрібен багатогранний підхід. Розробники штучного інтелекту та галузь у цілому повинні пріоритезувати прозорість та підзвітність у розвитку моделей штучного інтелекту. Це включає:
- Покращення відбору даних: Забезпечення того, щоб навчальні набори даних були ретельно відібрані для уникнення авторських матеріалів, якщо не отримано відповідних ліцензій.
- Розробка механізмів виявлення: Впровадження систем, які можуть виявляти, коли модель штучного інтелекту генерує потенційно авторські матеріали, та надавати користувачам варіанти модифікації або видалення такого змісту.
- Встановлення галузевих стандартів: Співпраця з юридичними експертами та галузевими учасниками для створення керівних принципів та стандартів розвитку штучного інтелекту, які поважають права інтелектуальної власності.
У Patronus AI ми зобов’язуємося внести свій внесок у розвиток відповідального штучного інтелекту, зосереджуючись на оцінці та відповідності. Наша платформа включає продукти, такі як EnterprisePII, які допомагають підприємствам виявляти та керувати потенційними проблемами конфіденційності у виводах штучного інтелекту. Надавши ці рішення, ми сподіваємося наділити підприємства можливістю використовувати штучний інтелект відповідально та етично, мінімізуючи при цьому юридичні ризики.
З інструментами, такими як EnterprisePII та FinanceBench, які зміни ви очікуєте у способі розгортання підприємств штучного інтелекту, особливо у чутливих галузях, таких як фінанси та особисті дані?
Ці інструменти забезпечують підприємства можливістю оцінювати та керувати виводами штучного інтелекту більш ефективно, особливо у чутливих галузях, таких як фінанси та особисті дані.
У фінансовому секторі FinanceBench дозволяє підприємствам оцінювати продуктивність LLM з високим рівнем точності, забезпечуючи, щоб моделі відповідали суворим вимогам фінансових застосувань. Це надає підприємствам можливість використовувати штучний інтелект для завдань, таких як аналіз даних та прийняття рішень, з більшою впевненістю та надійністю.
Аналогічно, інструменти, такі як EnterprisePII, допомагають підприємствам орієнтуватися у складностях захисту даних. Надавши уявлення про потенційні ризики та запропонувавши рішення для їх мінімізації, ці інструменти дозволяють підприємствам розгортати штучний інтелект більш безпечно та відповідально.
Загалом ці інструменти відкривають шлях до більш інформованого та стратегічного підходу до прийняття штучного інтелекту, допомагаючи підприємствам використовувати переваги штучного інтелекту, мінімізуючи при цьому пов’язані з ним ризики.
Як Patronus AI працює з компаніями для інтеграції цих інструментів у їхні існуючі розгортання та робочі процеси LLM?
У Patronus AI ми розуміємо важливість безшовної інтеграції при прийнятті штучного інтелекту. Ми тісно співпрацюємо з нашими клієнтами, щоб забезпечити, що наші інструменти легко інтегруються у їхні існуючі розгортання та робочі процеси LLM. Це включає надання клієнтам:
- Планів індивідуальної інтеграції: Ми співпрацюємо з кожним клієнтом для розробки індивідуальних планів інтеграції, які відповідають їхнім конкретним потребам та цілям.
- Комплексної підтримки: Наша команда забезпечує тривалу підтримку протягом процесу інтеграції, надавши керівництво та допомогу для забезпечення безшовного переходу.
- Навчання та освіти: Ми пропонуємо сесії навчання та освітні ресурси, щоб допомогти клієнтам повністю зрозуміти та використовувати наші інструменти, наділяючи їх можливістю зробити最大 з їхніх інвестицій у штучний інтелект.
Враховуючи складності забезпечення того, щоб виводи штучного інтелекту були безпечними, точними та відповідали різним законам, яка порада ви дали б розробникам LLM та компаніям, які хочуть використовувати їх?
Приоритизуючи співпрацю та підтримку, ми прагнемо зробити процес інтеграції якнайпростішим та ефективним, дозволяючи підприємствам розблокувати весь потенціал наших рішень штучного інтелекту.
Складності забезпечення того, щоб виводи штучного інтелекту були безпечними, точними та відповідали різним законам, представляють суттєві виклики. Для розробників великомасштабних мовних моделей ключем є пріоритет прозорості та підзвітності протягом всього процесу розробки.
Одним із фундаментальних аспектів є якість даних. Розробники повинні забезпечити, щоб навчальні набори даних були добре кураторами та вільні від авторських матеріалів, якщо не отримано відповідних ліцензій. Це не тільки допомагає запобігти потенційним юридичним проблемам, але й забезпечує, що штучний інтелект генерує надійні виводи. Крім того, адресування упередженості та справедливості є важливим. Активно працюючи над ідентифікацією та пом’якшенням упередженості та розробкою різноманітних та представницьких навчальних даних, розробники можуть зменшити упередженість та забезпечити справедливі результати для всіх користувачів.
Надійні процедури оцінки також є суттєвими. Впровадження суворих тестів та використання бенчмарків, таких як FinanceBench, може допомогти оцінити продуктивність та надійність моделей штучного інтелекту, забезпечуючи, щоб вони відповідали вимогам конкретних випадків використання. Крім того, етичні розгляди повинні бути на передньому плані. Залучення до етичних керівних принципів та рамок забезпечує, що системи штучного інтелекту розробляються відповідально та відповідають суспільним цінностям.
Для підприємств, які хочуть використовувати великомасштабні мовні моделі, розуміння можливостей штучного інтелекту є важливим. Встановлення реалістичних очікувань та забезпечення того, щоб штучний інтелект використовувався ефективно у організації, також є суттєвим. Безшовна інтеграція та підтримка є важливими. Працюючи з довіреними партнерами, підприємства можуть інтегрувати рішення штучного інтелекту у свої робочі процеси та забезпечити, щоб їхні команди були навчені та підтримані для ефективного використання штучного інтелекту.
Пріоритезація відповідності та безпеки, з фокусом на дотриманні відповідних правил та законів про захист даних, також є важливою. Інструменти, такі як EnterprisePII, можуть допомогти моніторити та керувати потенційними ризиками. Постійний моніторинг та регулярна оцінка продуктивності штучного інтелекту також необхідні для підтримання точності та надійності, дозволяючи здійснювати коригування за необхідності.
Дякуємо за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати Patronus AI.












