AI-modeller och plattformar
Maskinlärningsmodell mäter MLB-spelares prestationer

Ett team av forskare vid Penn State College of Information Sciences and Technology har utvecklat en maskinlärningsmodell som kan bättre mäta baseballspelares och lagets kort- och långsiktiga prestation. Den nya metoden mättes mot befintliga statistiska analysmetoder som kallas sabermetrics.
Forskningen presenterades i en rapport med titeln “Användning av maskinlärning för att beskriva hur spelare påverkar spelet i MLB.”
Bygger på NLP och datorseende
Teamets tillvägagångssätt byggde på senaste framstegen inom naturlig språkbehandling och datorseende, och det kan ha stora implikationer för hur spelarnas påverkan på spelet mäts.
Connor Heaton är en doktorand vid College of IST.
Heaton säger att den befintliga familjen av metoder bygger på antalet gånger en spelare eller lag uppnår ett diskret händelse, såsom att slå en hemmarun. Dessa metoder misslyckas med att överväga sammanhanget för varje handling.
“Tänk på en scenario där en spelare spelade en singel i sin sista plate-appearance”, sa Heaton. “Han kunde ha slagit en dribbeldown till tredje baslinjen, avancerat en löpare från första till andra och slagit ut till första, eller slagit en boll till djup vänsterfält och nått första basen bekvämt men inte haft tillräcklig hastighet för att sträva efter en dubbel. Att beskriva båda situationerna som resulterade i ‘en singel’ är korrekt men berättar inte hela historien.”
Den nya modellen
Heatons modell bygger på att lära sig betydelsen av händelser i spelet, som baseras på deras påverkan på spelet och deras sammanhang. Modellen ser sedan på spelet som en sekvens av händelser för att producera numeriska representationer av hur spelare påverkar spelet.
“Vi pratar ofta om baseball i termer av ‘den här spelaren hade två singlar och en dubbel igår’ eller ‘han gick en för fyra’”, sa Heaton. “Många av de sätt som vi pratar om spelet summerar bara händelserna med en sammanfattningsstatistik. Vårt arbete försöker ta en mer helhetsbild av spelet och att få en mer nyanserad, beräkningsmässig beskrivning av hur spelare påverkar spelet.”
Den nya metoden utnyttjar sekventiella modelleringstekniker i NLP för att möjliggöra för datorer att lära sig betydelsen av olika ord. Heaton använde detta för att lära sin modell betydelsen av händelser i baseballspelet, såsom en slagman som slår en singel. Spelet modellerades sedan som en sekvens av händelser.
“Påverkan av detta arbete är ramverket som föreslås för vad jag gillar att kalla ‘att förhöra spelet’”, sa Heaton. “Vi ser på det som en sekvens i denna hela beräkningsstruktur för att modellera ett spel.”
Modellen kan beskriva en spelares inflytande på spelet över kort tid, och när den kombineras med traditionella metoder, kan den förutsäga vinnaren av ett spel med över 59 procents noggrannhet.
Träning av modellen
Forskarna tränade sin modell genom att använda data som tidigare samlats in från system installerade på major league-baseballstadion. Dessa system spårar detaljerad information för varje kast, inklusive spelarposition, basbesättning och kasthastighet. Två typer av data användes. Den första var kast-för-kast-data, som hjälpte till att analysera information som kasttyp. Den andra var säsong-för-säsong-data, som användes för att undersöka positionsspecifik information.
Varje kast inom den insamlade datamängden hade tre stora funktioner, som var det specifika spelet, kastnumret inom spelet och kastnumret inom kastet. Denna data möjliggjorde för forskarna att rekonstruera sekvensen av händelser som utgör ett MLB-spel.
För att beskriva de händelser som inträffade, hur de inträffade och vem som var inblandad i varje spel, identifierade teamet 325 möjliga speleförändringar som kunde inträffa när ett kast kastades. Detta kombinerades sedan med befintlig data, och spelarrekord imputerades.
Prasenjit Mitra är professor i informationsvetenskap och teknik, samt medförfattare till rapporten.
“Detta arbete har potentialen att avsevärt förbättra tillståndet för sabermetrics”, sa professor Mitra. “Till vår kännedom är vår den första som fångar och representerar en nyanserad tillstånd av spelet och använder denna information som sammanhang för att utvärdera de enskilda händelser som räknas av traditionella statistik – till exempel genom att automatiskt bygga en modell som förstår nyckelmoment och klämsituationer.”












