Моделі та платформи ШІ
Модель машинного навчання вимірює результати гравців MLB

Команда дослідників з Коледжу інформаційних наук і технологій Університету штату Пенсільванія розробила модель машинного навчання, яка може краще вимірювати короткострокові та довгострокові результати гравців у бейсбол та команд. Новий метод був порівняний з існуючими статистичними методами аналізу, званими саберметрікою.
Дослідження було представлено у статті під назвою “Використання машинного навчання для опису того, як гравці впливають на гру в MLB”.
Розбудова на основі NLP і комп’ютерного зору
Підхід команди ґрунтувався на останніх досягненнях у галузі обробки природної мови та комп’ютерного зору, і він може мати великі наслідки для того, яким чином вимірюється вплив гравця на гру.
Коннор Хітон – аспірант Коледжу IST.
Хітон каже, що існуюча родина методів ґрунтується на кількості разів, коли гравець або команда досягає певної події, наприклад, відбиває хоум-ран. Ці методи не враховують контекст кожної дії.
“Подіумся про сценарій, у якому гравець записав сингл у своєму останньому виході на биту”, – сказав Хітон. “Він міг відбити м’яч у напрямку третьої бази, просунувши бігунів з першої на другу базу, і перебігнув кидок на першій базі, або відбити м’яч у глибину лівого поля і дійти до першої бази комфортно, але не мав швидкості, щоб поборотися за дабл. Опис обидвох ситуацій як “сингл” є точним, але не розповідає всю історію”.
Нова модель
Модель Хітона ґрунтується на вивченні значення подій у грі, яке ґрунтується на їхньому впливі на гру та контексті. Потім модель розглядає гру як послідовність подій, щоб вивести числові представлення того, як гравці впливають на гру.
“Ми часто говоримо про бейсбол у термінах “цей гравець мав два сингли і дабл вчора” або “він вийшов на биту один раз з чотирьох”, – сказав Хітон. “Багато способів, якими ми говоримо про гру, просто підсумовують події одним статистичним показником. “Наша робота спрямована на отримання більш цілісної картини гри та отримання більш нюансованого, обчислювального опису того, як гравці впливають на гру”.
Новий метод використовує послідовні моделювання у галузі обробки природної мови, щоб дозволити комп’ютерам вивчити значення різних слів. Хітон використовував це, щоб навчити свою модель значення подій у грі в бейсбол, наприклад, коли бігун відбиває сингл. Гра була потім змодельована як послідовність подій.
“Вплив цієї роботи полягає у тому, що ми пропонуємо рамкову основу для того, що я називаю “допитуванням гри”, – сказав Хітон. “Ми розглядаємо її як послідовність у цілій обчислювальній основі для моделювання гри”.
Модель здатна описати вплив гравця на гру у короткостроковій перспективі, а коли її поєднують з традиційними методами, вона може передбачити переможця гри з точністю понад 59%.
Навчання моделі
Дослідники навчали свою модель, використовуючи дані, раніше зібрані з систем, встановлених на стадіонах бейсболу вищої ліги. Ці системи відстежують детальну інформацію про кожну подачу, включаючи позицію гравців, зайняті бази та швидкість подачі. Було використано два типи даних. Перший – це дані про кожну подачу, які допомогли проаналізувати інформацію, таку як тип подачі. Другий – це дані за сезон, які використовувалися для вивчення інформації, специфічної для позиції.
Кожна подача у зібраному наборі даних мала три основні характеристики, які були конкретною грою, номером виходу на биту у грі та номером подачі у виході на биту. Ці дані дозволили дослідникам реконструювати послідовність подій, які складають гру в MLB.
Щоб описати події, які відбулися, як вони відбулися, і хто був залучений до кожної гри, команда ідентифікувала 325 можливих змін у грі, які можуть відбутися, коли подається м’яч. Це було потім поєднано з існуючими даними, і записи гравців були доповнені.
Прасенджит Мітра – професор інформаційних наук і технологій, а також співавтор статті.
“Ця робота має потенціал суттєво просунути стан мистецтва у сфері саберметрії”, – сказав проф. Мітра. “На нашу думку, ми перші, хто захоплює і представляє нюансований стан гри та використовує цю інформацію як контекст для оцінки окремих подій, які нараховуються традиційними статистиками – наприклад, автоматично будуючи модель, яка розуміє ключові моменти та клучові події”.












