Моделі та платформи ШІ

Нітін Маднані, старший науковий співробітник ETS – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Нітін Маднані є старшим науковим співробітником групи досліджень природної мови (NLP) в Освітній тестувальній службі (ETS). ETS була заснована в 1947 році і є найбільшою приватною некомерційною освітньою тестувальною та оціночною організацією у світі.

Чи можете ви почати з пояснення місії ETS?

Місія ETS полягає в просуванні якості та рівності в освіті для всіх учнів у світі. Ця місія лежить в основі наших продуктів, послуг, досліджень та зусиль з метою просування навчання, підтримки освіти, професійного розвитку та вимірювання знань та навичок для всіх.

Ми вважаємо, що кожен, будь-де може зробити різницю у своєму житті через навчання, і робота ETS у сфері досліджень, оцінки, вимірювання та політики може відіграти важливу роль у здійсненні цього навчання.

Що таке в NLP, що вас так приваблює?

Всі людські мови настільки красиво складні та заплутані. Вони дозволяють нам виражати широкий спектр емоцій у нашій мові та навіть у нашому письмі, і вони еволюціонують з часом. З іншого боку, комп’ютер настільки детермінований і клінічний у обробці своїх входів. NLP – це область штучного інтелекту, яка намагається зробити цей надзвичайно нелюдський пристрій зрозуміти красиві складності людської мови шляхом поєднання технік з комп’ютерних наук, лінгвістики та статистики. Як ви не можете знайти це цікавим?

Учені NLP та мовлення ETS недавно розробили RSMTool. Чи можете ви розповісти нам, що робить RSMTool?

Як ми бачили за останні кілька років, всі моделі машинного навчання потенційно можуть виявляти упереджене поведінку, незалежно від галузі, в якій вони застосовуються, освіта не є винятком. Автоматичні системи оцінювання, які використовуються для призначення балів або оцінок учнів за мовлення або есе в тестах або у класі, часто використовують моделі машинного навчання. Тому цілком можливо, що такі системи будуть виявляти упереджену поведінку. Така упередженість може мати серйозні наслідки, особливо якщо бали з таких систем використовуються для прийняття високоризикових рішень.

RSMTool – це відкритий інструмент, який моя колега Анастасія Лукіна (раніше представлена на Unite.AI) і я розробили в ETS, щоб допомогти забезпечити, щоб будь-які систематичні, шкідливі упередженості в автоматичних системах оцінювання були визначені якомога раніше, надією, навіть до того, як ці системи будуть розгорнуті у реальному світі. RSMTool призначений для надання комплексної оцінки двигунів оцінювання штучного інтелекту, включаючи не тільки стандартні метрики точності прогнозування, але також міри справедливості моделі та метрики, засновані на теорії тестування, які допомагають розробникам таких двигунів визначити можливі упередженості або інші проблеми у своїх системах.

Від чого походить назва RSMTool?

У сфері освітньої оцінки людина, яка призначає бал (або “оцінює”) есе, часто називається “оцінювачем”. Є людські оцінювачі, а також автоматичні оцінювачі. RSMTool – це скорочення від Rater Scoring Modeling Tool, призначений для допомоги у створенні (та оцінці) моделей оцінювання, використовуваних автоматичними оцінювачами.

Як цей інструмент може допомогти розробникам визначити можливі упередженості або інші проблеми у їхніх двигунах оцінювання штучного інтелекту?

За останні п’ять десятиліть вчені освітньої міри – включаючи багатьох наших колег в ETS – проводили цінні дослідження того, що робить автоматичне (та людське) оцінювання справедливим. Як частина цього дослідження, вони розробили багато статистичних та психометричних аналізів для розрахунку індикаторів систематичної упередженості. Однак, оскільки психометричні та NLP-спільноти рідко взаємодіють, існує мало можливостей для обміну ідеями. Наслідком цього є те, що дослідники та розробники NLP, які будують фактичні автоматичні системи оцінювання – особливо окремі дослідники та ті, хто працює в малих компаніях – не мають легкого доступу до психометричних аналізів, які вони повинні використовувати для перевірки своїх систем на упередженість. RSMTool намагається вирішити цю проблему, надаючи велику, різноманітну збірку психометричних аналізів у одному, легкому у використанні Python-пакеті, який може бути легко включений будь-яким дослідником NLP у свій дослідницький або оперативний процес.

У типовому випадку використання дослідник надає у вигляді входу файл або кадр даних з числовими системними бали, золотими стандартними (людськими) бали та метаданими, якщо це застосовується. RSMTool обробляє ці дані та генерує HTML-звіт, який містить комплексну оцінку, включаючи описові статистики, а також декілька мір продуктивності системи та справедливості серед інших. Зразок звіту RSMTool можна знайти за посиланням https://bit.ly/fair-tool. RSMTool може працювати з традиційними моделями машинного навчання, керованими функціями (наприклад, з бібліотеки scikit-learn), та з моделями глибокого навчання. Хоча основним виходом RSMTool є HTML-звіт, який полегшує обмін, він також генерує табличні файли даних (у форматах CSV, TSV або XLSX) як проміжні виходи для більш просунутих користувачів. Нарешті, щоб зробити все дуже налаштовуваним, RSMTool реалізує кожну секцію свого звіту як блокнот Jupyter, так що користувачі можуть не тільки вибирати, які секції актуальні для їхніх конкретних моделей оцінювання, але й легко реалізовувати власні аналізи та включати їх у звіт з мінімальними зусиллями.

Є багато останніх досліджень про автоматичне оцінювання, які використали RSMTool для оцінки своїх запропонованих моделей оцінювання.

Які найпоширеніші типи упередженості, які можуть вплинути на автоматичні системи оцінювання?

Найпоширеніший тип упередженості, який впливає на автоматичну систему оцінювання, – це диференційна продуктивність підгруп, тобто коли автоматична система працює по-різному для різних підгруп населення. Наприклад, упереджена система оцінювання могла б виробляти систематично нижчі бали для есе, написаних, наприклад, чорними жінками порівняно з тими, які написані білими чоловіками, навіть якщо немає систематичних відмінностей у фактичних навичках письма, продемонстрованих цими двома підгрупами в їхніх есех, наскільки це стосується людини.

ETS має багату історію проведення досліджень щодо справедливості для автоматичних двигунів оцінювання. Наприклад, ми дослідили, чи виявляє e-rater – наш двигун автоматичного оцінювання штучного інтелекту – будь-яку диференційну продуктивність для підгруп, визначених за етнічною приналежністю, статтю та країною (вони виявили деякі незначні відмінності, які були вирішені наступними змінами політики). Дослідження також дослідили, чи ставиться e-rater до відповідей, написаних тестируваними GRE, які мають порушення навчання чи СДУГ, систематично по-різному в середньому (він не робить цього). Найостанніше вчасне дослідження досліджує, чи виявляє автоматична система оцінювання мовлення систематичну упередженість щодо тестируваних, яким було потрібно носити маски для обличчя, порівняно з тими, хто не носив масок (вона не робить цього). RSMTool містить кілька психометричних аналізів, які намагаються кількісно оцінити диференційну продуктивність підгруп над підгрупами, які користувач може визначити за своїми даними.

ETS вирішила зробити RSMTool відкритим, чи можете ви пояснити причини та важливість цього?

Так, RSMTool доступний на GitHub з ліцензією Apache 2.0. Ми вважаємо, що таке інструмент повинно бути відкритим та некомерційним, щоб спільнота могла (а) перевірити джерельний код вже наявних аналізів на відповідність стандартам справедливості та (б) внесла нові аналізи, оскільки стандарти еволюціонують та змінюються. Ми також хочемо зробити його легким для дослідників та розробників NLP використовувати RSMTool у своїй роботі та допомогти нам у його вдосконаленні. Відкриття RSMTool є явним прикладом продовженої присвяти ETS відповідному використанню штучного інтелекту в освіті.

Які уроки ви вивчили під час розробки та підтримки RSMTool?

За останні п’ять років, протягом яких Анастасія та я розробили та підтримували RSMTool – при допомозі багатьох колег ETS та зовнішніх учасників GitHub – ми вивчили два основні уроки. Перший полягає в тому, що різні користувачі мають різні потреби, і підхід “один розмір для всіх” не працює для міжгалузевих програмного забезпечення, таких як RSMTool. Другий урок, який ми вивчили, полягає в тому, що для підвищення ймовірності прийняття відкритого програмного забезпечення потрібно йти на додаткові зусилля, щоб зробити його якомога більш надійним.

Під час нашого терміну як підтримувачів RSMTool ми визначили багато типів користувачів RSMTool. Деякі з них – “потужні користувачі” (наприклад, дослідники та розробники NLP), які хочуть вибирати конкретну функціональність RSMTool, щоб включити її у свій власний процес машинного навчання, а також використовувати інші пакети Python. Для задоволення таких користувачів ми створили досить повний API для відкриття різних функцій перед- та після обробки, а також миттєвих метрик, що містяться в RSMTool. Інша група користувачів – це те, що ми називаємо “мінімізаторами”: аналітики даних та інженери, яким може бракувати статистичної чи програмної підготовки для взаємодії з API та які віддають перевагу готовому процесу. Для задоволення таких користувачів ми створили інструменти командної строки, які можуть бути легко викликані у оболонках-обгортках, наприклад. Ми також виявили, що користувачі-мінімізатори часто неохоче читають (адмітьте великий) список варіантів конфігурації RSMTool. Тому ми побудували інтерактивний генератор конфігурації з автозаповненням, який може допомогти таким користувачам створювати файли конфігурації на основі їхніх конкретних потреб.

Для задоволення потреб усіх наших груп користувачів нам довелося прийняти практики, які, на нашу думку, були необхідні для того, щоб зробити RSMTool надійним. Що ми маємо на увазі під надійним програмним забезпеченням? Надійне програмне забезпечення повинно відповідати наступним критеріям: вплив будь-якої зміни коду на його точність та продуктивність може бути виміряний (хорошо протестований), його документація завжди актуальна (хорошо задокументований), і програмне забезпечення (разом з його залежностями) легко встановлюється користувачами. Для RSMTool ми використали кілька відкритих інструментів та сервісів, щоб зробити його відповідним нашому визначення. У нас є комплексний набір тестів (>90% покриття коду), який ми автоматично запускаємо через безперервну інтеграцію для будь-яких змін, наданих до коду. Ми підтримуємо розширені документи (включаючи кілька реальних навчальних посібників) та будь-яка нова функціональність, запропонована для RSMTool, повинна включати компонент документації, який також переглядається як частина кодового огляду. Нарешті, ми випускаємо RSMTool у вигляді пакетів, які можуть бути легко встановлені (за допомогою pip або conda), і всі залежності, необхідні для цього, також автоматично встановлюються.

Що ETS сподівається досягти, випустивши RSMTool?

Освітній сектор побачив одне з найбільших розширень штучного інтелекту за останні кілька років, з автоматичним оцінюванням тексту та мовлення, яке стає дедалі більш поширеним застосуванням NLP. ETS давно є лідером у сфері автоматичного оцінювання та, починаючи з його заснування, була присвячена створенню справедливих продуктів та оцінок, призначених для служіння учням усьому світі. Випустивши RSMTool, розроблений у тісній співпраці між вченими NLP та психометристами, ETS хоче продовжувати свою адвокатуру щодо відповідального використання штучного інтелекту в освіті дуже конкретним чином; зокрема, ми хочемо зробити ясним, що коли дослідники штучного інтелекту думають про “продуктивність” автоматичної системи оцінювання, вони повинні враховувати не тільки стандартні метрики точності прогнозування (наприклад, кореляцію Пірсона), але також міри справедливості моделі. Ширше, ми також хотіли б, щоб RSMTool послужив прикладом того, як дослідники NLP та психометристи можуть і повинні працювати разом.

Чи є щось інше, що ви хотіли б поділитися про RSMTool?

Ми хочемо заохотити читачів допомогти нам покращити RSMTool! їм не потрібно бути психометристом чи експертом NLP. У нас є багато відкритих питань, пов’язаних з документацією та програмуванням на Python, які були б ідеальними для будь-якого початківця чи проміжного програміста Python. Ми також запрошуємо внески до SKLL (Scikit-Learn Laboratory), – іншого відкритого пакету ETS для ефективного виконання користувальницьких, пакетних експериментів з машинним навчанням, який використовується RSMTool.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.