AI-modeller och plattformar

OpenAI:s ChatGPT tar sig an universitetets redovisningsprov

mm
Lägg till Unite.AI bland dina föredragna källor på Google

OpenAI lanserade nyligen sin banbrytande AI-chattbot, GPT-4, som har skapat rubriker inom olika områden. Med en 90:e percentilpoäng på advokatexamen, godkänt på 13 av 15 AP-prov och nära perfekt poäng på GRE Verbal-testet har GPT-4:s prestation varit ingenting annat än extraordinär.

Forskare vid Brigham Young University (BYU) och 186 andra universitet var nyfikna på hur OpenAI:s teknik skulle prestera på redovisningsprov. De testade den ursprungliga versionen, ChatGPT, och fann att även om det fortfarande finns utrymme för förbättring inom redovisningsområdet, är tekniken en spelväxlare som kommer att påverka utbildningen på ett positivt sätt.

Sedan dess debut i november 2022 har ChatGPT blivit den snabbast växande teknologiplattformen någonsin, med 100 miljoner användare på under två månader. I ljuset av den pågående debatten om AI-modellers roll i utbildning, beslutade studiens huvudförfattare, David Wood, en professor i redovisning vid BYU, att rekrytera så många professorer som möjligt för att utvärdera AI:s prestation mot riktiga universitetsstudenter i redovisning.

ChatGPT vs. studenter på redovisningsprov

Forskningen involverade 327 medförfattare från 186 utbildningsinstitutioner i 14 länder, som bidrog med 25 181 klassrumsredovisningsproven. BYU-studenter tillhandahöll också 2 268 lärobokstestbankfrågor. Frågorna täckte olika redovisningsunderområden, såsom redovisningssystem (AIS), revision, finansiell redovisning, ledningsredovisning och skatt. De varierade också i svårighetsgrad och typ.

Även om ChatGPT:s prestation var imponerande, presterade studenterna bättre, med en genomsnittspoäng på 76,7 % jämfört med ChatGPT:s 47,4 %. På 11,3 % av frågorna fick ChatGPT högre poäng än studenternas genomsnitt, särskilt inom AIS och revision. Men det hade svårt med skatte-, finansiella och ledningsbedömningar, möjligen på grund av svårigheter med matematiska processer.

ChatGPT presterade bättre på sant/falskt-frågor (68,7 % rätt) och flervalsfrågor (59,5 %) men hade svårt med korta svarfrågor (28,7 % till 39,1 %). Det hade generellt svårt med högre ordningsfrågor, ibland gav det auktoritativa skriftliga beskrivningar för felaktiga svar eller svarade på samma fråga på olika sätt.

ChatGPT:s framtid i utbildning

Trots dess begränsningar förväntar sig forskarna att GPT-4 kommer att förbättra sig på redovisningsfrågor och åtgärda de problem de upptäckte. Det mest lovande är chattbotens potential att förbättra undervisning och lärande, till exempel genom att hjälpa till att utforma och testa uppgifter eller utkast till delar av ett projekt.

“Detta är en disruption, och vi måste utvärdera var vi ska gå från här,” sa studiens medförfattare och kollega till BYU:s redovisningsprofessor Melissa Larson. “Jag kommer fortfarande att ha TA, men detta kommer att tvinga oss att använda dem på olika sätt.”

Så länge AI fortsätter att utvecklas, måste utbildare anpassa sig och hitta nya sätt att inkorporera dessa teknologier i sina undervisningsmetoder.

Alex McFarland är en AI-journalist och författare som utforskar de senaste utvecklingarna inom artificiell intelligens. Han har samarbetat med många AI-startups och publikationer över hela världen.