AI-modeller och plattformar

Bortom benchmarking: Varför AI-utvärdering behöver en verklighetscheck

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Om du har följt AI på senare tid har du förmodligen sett rubriker som rapporterar om de banbrytande prestationerna av AI-modeller som uppnår benchmarkrekord. Från ImageNet-bilderkänning till att uppnå övermänskliga poäng i översättning och medicinsk bildanalys, har benchmarking länge varit standarden för att mäta AI-prestanda. Men även om dessa siffror kan vara imponerande, fångar de inte alltid den komplexitet som finns i verkliga tillämpningar. En modell som fungerar perfekt på en benchmark kan fortfarande vara undermålig när den testas i verkliga miljöer. I den här artikeln kommer vi att undersöka varför traditionell benchmarking inte fångar den verkliga värdet av AI och utforska alternativa utvärderingsmetoder som bättre återspeglar de dynamiska, etiska och praktiska utmaningarna med att distribuera AI i den verkliga världen.

Benchmarkingens attraktionskraft

Under många år har benchmarking varit grunden för AI-utvärdering. De erbjuder statiska datamängder som är utformade för att mäta specifika uppgifter som objekterkänning eller maskinöversättning. ImageNet är till exempel en allmänt använd benchmark för att testa objektklassificering, medan BLEU och ROUGE mäter kvaliteten på maskingenererad text genom att jämföra den med mänskligt skrivna referenstexter. Dessa standardiserade tester tillåter forskare att jämföra framsteg och skapa en sund konkurrens inom området. Benchmarking har spelat en nyckelroll i att driva fram stora framsteg inom området. ImageNet-tävlingen, till exempel, spelade en avgörande roll i den djupa inlärningsrevolutionen genom att visa betydande förbättringar av noggrannheten.

Men benchmarking förenklar ofta verkligheten. Eftersom AI-modeller vanligtvis tränas för att förbättra en enda väldefinierad uppgift under fasta förhållanden, kan detta leda till överoptimisering. För att uppnå höga poäng kan modellerna förlita sig på datamönster som inte gäller utanför benchmarken. Ett berömt exempel är en visionmodell som tränats för att skilja på vargar och huskyer. Istället för att lära sig att skilja på djurkännetecken, förlitade sig modellen på närvaron av snöiga bakgrunder som vanligtvis är associerade med vargar i träningsdata. Som ett resultat, när modellen presenterades med en husky i snön, misstog den det för en varg. Detta visar hur överanpassning till en benchmark kan leda till felaktiga modeller. Som Goodharts lag säger, “När en måttstock blir ett mål, upphör den att vara en bra måttstock.” Så när benchmarkpoäng blir målet, illustrerar AI-modellerna Goodharts lag: de producerar imponerande poäng på ledartavlor, men kämpar med att hantera verkliga utmaningar.

Mänskliga förväntningar vs. metricspoäng

En av de största begränsningarna med benchmarking är att det ofta inte fångar det som verkligen är viktigt för människor. Överväg maskinöversättning. En modell kan få höga poäng på BLEU-mätningen, som mäter överlappningen mellan maskingenererad och referenstext. Medan mätningen kan bedöma hur trovärdig en översättning är i termer av ordnivåöverlapp, tar den inte hänsyn till flyt eller betydelse. En översättning kan få låga poäng trots att den är mer naturlig eller till och med mer korrekt, enbart för att den använde olika ordval än referenstexten. Mänskliga användare bryr sig om betydelsen och flyten i översättningar, inte bara den exakta överensstämmelsen med en referens. Samma problem gäller för textsammanfattning: en hög ROUGE-poäng garanterar inte att en sammanfattning är sammanhängande eller fångar de viktigaste punkterna som en mänsklig läsare skulle förvänta sig.

För generativa AI-modeller blir problemet ännu mer utmanande. Till exempel utvärderas stora språkmodeller (LLM) vanligtvis på en benchmark MMLU för att testa deras förmåga att svara på frågor inom flera domäner. Medan benchmarken kan hjälpa till att testa prestandan hos LLM för att svara på frågor, garanterar den inte tillförlitlighet. Dessa modeller kan fortfarande “hallucinera“, presentera falska men trovärdiga fakta. Detta gap är inte lätt att upptäcka med benchmarking som fokuserar på korrekta svar utan att bedöma sanningen, sammanhanget eller sammanhängigheten. I ett välkänt fall användes en AI-assistent för att utarbeta en juridisk handling som citerade helt falska rättsfall. AI kan se övertygande ut på papper, men misslyckades med att uppfylla grundläggande mänskliga förväntningar på sanningen.

Utmaningarna med statisk benchmarking i dynamiska sammanhang

  • Anpassning till förändrade miljöer

Statisk benchmarking utvärderar AI-prestanda under kontrollerade förhållanden, men verkliga scenarier är oförutsägbara. Till exempel kan en konversations-AI excellerera på skriptade, enkla frågor i en benchmark, men kämpa i en multi-stegsdialog som inkluderar uppföljande frågor, slang eller stavfel. På samma sätt kan självkörande bilar utföra bra på objektidentifieringstester under ideala förhållanden, men misslyckas i ovanliga omständigheter, såsom dålig belysning, ogynnsamt väder eller oväntade hinder. Till exempel kan en stoppskylt som ändrats med klistermärken förvirra en bilens visionsystem, vilket leder till feltolkning. Dessa exempel visar att statisk benchmarking inte tillförlitligt mäter verkliga komplexiteter.

  • Etiska och sociala överväganden

Traditionell benchmarking misslyckas ofta med att utvärdera AI:s etiska prestanda. En bildigenkänningsmodell kan uppnå hög noggrannhet, men missidentifiera individer från vissa etniska grupper på grund av fördomar i träningsdata. På samma sätt kan språkmodeller få höga poäng på grammatik och flyt, men producera fördomsfull eller skadlig innehåll. Dessa problem, som inte återspeglas i benchmark-mått, har betydande konsekvenser i verkliga tillämpningar.

  • Oförmåga att fånga nyanserade aspekter

Benchmarking är bra på att kontrollera ytnivåförmågor, som om en modell kan generera grammatiskt korrekt text eller en realistisk bild. Men den kämpar ofta med djupare kvaliteter, som sunt förnuft eller kontextuell lämplighet. Till exempel kan en modell excellerera på en benchmark genom att producera en perfekt mening, men om den meningen är faktamässigt fel, är den värdelös. AI behöver förstå när och hur man ska säga något, inte bara vad man ska säga. Benchmarking testar sällan denna nivå av intelligens, som är avgörande för tillämpningar som chatbots eller innehållsskapande.

  • Kontextuell anpassning

AI-modeller kämpar ofta för att anpassa sig till nya sammanhang, särskilt när de möter data utanför sin träningsmängd. Benchmarking är vanligtvis utformad med data som liknar den som modellen tränades på. Detta betyder att den inte fullt ut testar hur väl en modell kan hantera ny eller oväntad inmatning — en avgörande krav i verkliga tillämpningar. Till exempel kan en chatbot excellerera på benchmarkfrågor, men kämpa när användare frågar irrelevanta saker, som slang eller nischämnen.

  • Resonemang och inferens

Medan benchmarking kan mäta mönsterigenkänning eller innehållsgenerering, misslyckas den ofta med att testa högre nivåers resonemang och inferens. AI behöver göra mer än att imitera mönster. Den ska förstå implikationer, göra logiska kopplingar och dra slutsatser. Till exempel kan en modell generera ett faktamässigt korrekt svar, men misslyckas med att koppla det logiskt till en bredare konversation. Nuvarande benchmarking fångar inte fullt ut dessa avancerade kognitiva färdigheter, vilket lämnar oss med en ofullständig bild av AI-förmågor.

Bortom benchmarking: En ny ansats för AI-utvärdering

För att överbrygga gapet mellan benchmarkprestanda och verklig framgång, utvecklas en ny ansats för AI-utvärdering. Här är några strategier som får allt mer uppmärksamhet:

  • Mänsklig återkoppling: Istället för att enbart förlita sig på automatiserade mått, involvera mänskliga utvärderare i processen. Detta kan innebära att experter eller slutanvändare bedömer AI:s utdata för kvalitet, användbarhet och lämplighet. Människor kan bättre bedöma aspekter som ton, relevans och etiska överväganden i jämförelse med benchmarking.
  • Verklig deployeringstestning: AI-system bör testas i miljöer som är så nära verkliga förhållanden som möjligt. Till exempel kan självkörande bilar genomgå tester på simulerade vägar med oförutsägbara trafikscenarier, medan chatbots kan deployeras i live-miljöer för att hantera olika konversationer. Detta säkerställer att modeller utvärderas under de förhållanden de faktiskt kommer att möta.
  • Robusthet och stress-testning: Det är avgörande att testa AI-system under ovanliga eller fientliga förhållanden. Detta kan innebära att testa en bildigenkänningsmodell med förvrängda eller bullriga bilder eller att utvärdera en språkmodell med långa, komplicerade dialoger. Genom att förstå hur AI beter sig under stress, kan vi bättre förbereda den för verkliga utmaningar.
  • Multidimensionella utvärderingsmått: Istället för att enbart förlita sig på en enda benchmarkpoäng, utvärdera AI över ett spektrum av mått, inklusive noggrannhet, rättvisa, robusthet och etiska överväganden. Denna holistiska ansats ger en mer omfattande förståelse av en AI-modells styrkor och svagheter.
  • Domänspecifika tester: Utvärderingen bör anpassas till den specifika domän där AI kommer att deployeras. Medicinsk AI, till exempel, bör testas på fallstudier utformade av medicinska experter, medan en AI för finansiella marknader bör utvärderas för sin stabilitet under ekonomiska fluktuationer.

Slutsatsen

Medan benchmarking har drivit AI-forskningen framåt, misslyckas det med att fånga den verkliga prestandan i verkliga tillämpningar. När AI flyttar från laboratorier till praktiska tillämpningar, bör AI-utvärdering vara mänskligt centrerad och holistisk. Testning i verkliga förhållanden, mänsklig återkoppling och prioritering av rättvisa och robusthet är avgörande. Målet är inte att toppa ledartavlor, utan att utveckla AI som är tillförlitlig, anpassningsbar och värdefull i den dynamiska, komplexa världen.

Dr. Tehseen Zia är en fast anställd biträdande professor vid COMSATS University Islamabad, med en doktorsexamen i AI från Vienna University of Technology, Österrike. Specialiserad på artificiell intelligens, maskinlärning, datavetenskap och datorseende, har han gjort betydande bidrag med publikationer i ansedda vetenskapliga tidskrifter. Dr. Tehseen har också lett olika industriprojekt som huvudutredare och tjänstgjort som AI-konsult.