Tankeledare

VarfÃķr den mest kapabla AI-modellen sÃĪllan ÃĪr rÃĪtt val fÃķr din app

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google
Hand selecting a glowing AI model cube from multiple options in a modern tech office, symbolizing strategic AI model selection.

Det finns en viss trygghet i att vÃĪlja den kraftfullaste modellen. NÃĪr du bygger en AI-driven produkt kÃĪnns det ansvarsfullt (nÃĪstan logiskt) att vÃĪlja den kraftfullaste modellen som finns tillgÃĪnglig. GPT-4o. Claude Opus. Gemini Ultra. Dessa ÃĪr imponerande teknologier, och ingen har nÃĨgonsin blivit avskedad fÃķr att ha valt det smartaste verktyget i rummet.

UtÃķver detta finns det en viktig detalj. Projekt svÃĪller. Kostnader skenar. Latens smyger sig in. Och runt mÃĨnad tre bÃķrjar teamet stÃĪlla obekvÃĪma frÃĨgor om varfÃķr en enkel autocomplete-funktion fÃķrbrukar API-krediter som en startup med riskkapital och ingen ansvarighet.

HÃĪr ÃĪr saken: “mest kapabel” och “mest lÃĪmplig” ÃĪr tvÃĨ olika standarder. LeverantÃķrer av AI-apputvecklingstjÃĪnster vÃĪljer modeller baserat pÃĨ utvÃĪrderingar, inte leaderboard-rankningar.

StÃķrre ÃĪr inte automatiskt bÃĪttre

En frontier-modell fungerar exceptionellt bra under ideala fÃķrhÃĨllanden men kostar mycket att driva, hanterar ofullstÃĪndiga indata dÃĨligt och Ãķverstiger kraven fÃķr enkla uppgifter.

GPT-4o kan skriva poesi, resonera genom juridiska kontrakt, felsÃķka kod och fÃķrklara kvantmekanik fÃķr en tioÃĨring, ibland i samma svar. Det ÃĪr verkligen imponerande. Men om din app sammanfattar kundsupportbiljetter eller extraherar strukturerad data frÃĨn fakturor, betalar du fÃķr funktioner som inte anvÃĪnds.

Mindre, specialiserade modeller hanterar fokuserade uppgifter med imponerande noggrannhet:

  • GPT-4o mini tÃĪcker de flesta sprÃĨkuppgifter till en kostnad som ÃĪr cirka 15 gÃĨnger lÃĪgre ÃĪn GPT-4o
  • Claude Haiku ÃĪr byggd fÃķr hastighet och effektivitet pÃĨ hÃķgvolym, strukturerade arbetsbelastningar
  • Mistral 7B och Llama 3.1 8B ÃĪr Ãķppen kÃĪllkodsalternativ som kÃķrs snabbt och finjusteras vÃĪl

Klyftan mellan dessa och frontier-modellerna minskar avsevÃĪrt nÃĪr uppgiften ÃĪr smal och prompten ÃĪr vÃĪlutformad.

Kostnadsmatematik som ingen pratar om pÃĨ planeringsmÃķten

API-prissÃĪttning fÃķr frontier-modeller kan kosta 10 till 30 gÃĨnger mer per token ÃĪn deras lÃĪttare motsvarigheter. Den klyftan lÃĨter abstrakt tills du modellerar den i skala.

SÃĪg att din app gÃķr 500 000 API-samtal per mÃĨnad:

Modell Uppskattad mÃĨnadskostnad
GPT-4o $1 500 – $3 000
GPT-4o mini $150 – $300
Claude Haiku $125 – $250

Samma funktion. Mycket olika marginalhistoria.

Vissa team kÃķr hybridarkitekturer, dirigerar enkla klassificeringsuppgifter till lÃĪtta modeller medan de reserverar de tyngre modellerna fÃķr komplex generering eller resonemangssteg. FÃķretag som Martian och RouteLLM har byggt verktyg specifikt fÃķr denna typ av modelldirigering. Det ÃĪr inte glamourÃķst ingenjÃķrsarbete, men det ÃĪr den typen av sak som gÃķr CFO:er mÃĪrkbart mer avslappnade.

Latens ÃĪr ett anvÃĪndarupplevelseproblem

Det finns en anledning till att snabbmat finns. MÃĪnniskor vill inte alltid ha den femrÃĪttersmÃĨltiden. Ibland vill de ha svaret nu.

Frontier-modeller ÃĪr lÃĨngsammare. Inte alltid med mycket, men tillrÃĪckligt fÃķr att det ska spela roll i realtidsapplikationer. Om dina anvÃĪndare vÃĪntar pÃĨ AI-svar i en konversationsgrÃĪnssnitt, en chattgrÃĪnssnitt eller en livekodhjÃĪlpare, formas svarlatensen direkt hur produkten kÃĪnns. En modell som tar 4-6 sekunder att svara bÃķrjar kÃĪnnas otillfÃķrlitlig, ÃĪven om utmatningen ÃĪr tekniskt sett ÃķverlÃĪgsen.

Regeln ÃĪr: Om en anvÃĪndare ser en laddningsikon, minskar varje extra sekund fÃķrtroendet.

Haiku, Mistral och Llama 3.1 8B kÃķrs avsevÃĪrt snabbare (ibland 3 till 5 gÃĨnger snabbare) under liknande belastningsfÃķrhÃĨllanden. FÃķr anvÃĪndarorienterade funktioner dÃĪr upplevd hastighet spelar roll, ÃĪr detta inte en mindre ÃķvervÃĪgning. Det ÃĪr ett produktsbeslut.

Promptteknikvariabeln (som fÃķrÃĪndrar allt)

HÃĪr ÃĪr nÃĨgot som glÃķms bort i modelljÃĪmfÃķrelsetrÃĨdar: en vÃĪlkonstruerad prompt pÃĨ en mindre modell slÃĨr ofta en lat prompt pÃĨ en frontier-modell.

Utmatningskvalitet ÃĪr en produkt av modellkapacitet OCH promptkvalitet. NÃĪr team investerar i promptteknik (tydliga instruktioner, strukturerad utmatningsformat, fÃĨskottsexempel, vÃĪldefinierade begrÃĪnsningar) presterar mindre modeller lÃĨngt Ãķver sin uppenbara takthÃķjd.

Ett par verktyg som ÃĪr vÃĪrda att kÃĪnna till hÃĪr:

  • LangChain och DSPy fÃķr att komponera och optimera promptpipeliner
  • Guidance fÃķr begrÃĪnsad generering och strukturerad utmatning
  • PromptFoo fÃķr att kÃķra systematiska promptutvÃĪrderingar Ãķver modeller

NÃĨgra av de mest imponerande AI-funktionerna i produktion idag kÃķrs pÃĨ modeller som inte skulle nÃĨ topp fem pÃĨ nÃĨgon kapacitetsledare. De kÃķrs bara pÃĨ riktigt bra promptrar.

Finjustering fÃķrÃĪndrar ekvationen

JÃĪmfÃķrelsen mellan en allmÃĪn frontier-modell och en mindre Ãķppen kÃĪllkodsmodell ser mycket annorlunda ut nÃĪr finjustering kommer in i bilden. En Llama 3.1 8B-modell som finjusterats pÃĨ din specifika domÃĪndata (din terminologi, dina kanter, din fÃķredragna utmatningsformat) kan prestera bÃĪttre ÃĪn GPT-4o pÃĨ din specifika uppgift.

Detta ÃĪr inte hypotetiskt. FÃķretag inom hÃĪlsovÃĨrd, juridisk teknik och e-handel har demonstrerat det upprepat.

Var du ska bÃķrja med finjustering:

  • Hugging Face fÃķr Ãķppen kÃĪllkodsmodellvÃĪrd, datamÃĪngder och utbildningsinfrastruktur
  • Together AI fÃķr snabba, prisvÃĪrda finjusteringskÃķrningar pÃĨ populÃĪra Ãķppna modeller
  • Replicate fÃķr att distribuera anpassade modeller utan att hantera din egen GPU-infrastruktur

Finjustering krÃĪver en initial investering: datakurering, berÃĪkningstid och utvÃĪrderingsarbete. Men fÃķr hÃķgvolym, domÃĪnspecifika uppgifter fungerar ekonomin ofta avsevÃĪrt till dess fÃķrdel.

SÃĪkerhet och dataresidens ÃĪr inte eftertankar

Vissa applikationer kan inte skicka data till tredjeparts-API:er alls. ÖvervÃĪg:

  • HÃĪlsovÃĨrdsplattformar som opererar under HIPAA
  • Finansiella verktyg som hanterar PII eller reglerad transaktionsdata
  • FÃķretagsprogramvara med strÃĪnga dataresidenskrav

Dessa miljÃķer har begrÃĪnsningar som ingen frontier-modell-API kan arbeta runt, oavsett kapacitet. SjÃĪlvvÃĪrd modeller, antingen pÃĨ plats eller i en privat moln, ÃĪr den enda vÃĪgen framÃĨt. Det betyder Ãķppen kÃĪllkodsmodeller som Llama 3, Mistral eller Phi-3 som kÃķrs pÃĨ din egen infrastruktur. En frontier-modell som du inte kan anvÃĪnda i produktion ÃĪr inte rÃĪtt val, punkt slut.

UtvÃĪrderingssteget som team hoppade Ãķver

De flesta team vÃĪljer en modell genom att anta att den dyraste ÃĪr den bÃĪsta utan att testa den. Vad de borde gÃķra ÃĪr att kÃķra strukturerade utvÃĪrderingar pÃĨ representativa prover av deras faktiska anvÃĪndningsfall.

HÃĪr ÃĪr en process som fungerar:

  1. Bygg en utvÃĪrderingsuppsÃĪttning pÃĨ 100 till 200 representativa indata med fÃķrvÃĪntade utdata
  2. KÃķr dem genom tvÃĨ eller tre kandidatmodeller under realistiska fÃķrhÃĨllanden
  3. PoÃĪngsÃĪtt mot dina riktiga kriterier: noggrannhet, formatÃķverensstÃĪmmelse, ton, latens, kostnad per samtal
  4. Besluta baserat pÃĨ data, inte magkÃĪnsla eller leaderboard-rankningar

Verktyg som Braintrust, PromptFoo och Weights & Biases Prompts gÃķr denna typ av systematisk utvÃĪrdering tillgÃĪnglig utan en forskningsbakgrund. Det tar nÃĨgra timmar att stÃĪlla in. Utbetald ÃĪr inte att vÃĪlja fel modell i sex mÃĨnader.

NÃĪr frontier-modellen faktiskt ÃĪr rÃĪtt val

FÃķr att vara rÃĪttvis: det finns uppgifter dÃĪr frontier-modeller verkligen fÃķrtjÃĪnar sin prislapp.

AnvÃĪnd en frontier-modell nÃĪr:

  • Uppgiften krÃĪver komplex, multi-stegsresonemang med ingen tydlig mall
  • Utmatningskvalitetsvariation ÃĪr kostsam och volymen ÃĪr relativt lÃĨg
  • Du behÃķver bred vÃĪrldskunskap eller nyanserad bedÃķmning som inte kan promptas runt
  • Du prototypar och har inte ÃĪnnu definierat uppgiftsgrÃĪnserna

Stanna med en lÃĪttare modell nÃĪr:

  • Uppgiften ÃĪr vÃĪldefinierad och upprepad
  • Hastighet och kostnad spelar roll vid den volym du kÃķr
  • Du kan investera i promptteknik eller finjustering
  • Dataresidens- eller regelefterlevnadsregler utesluter tredjeparts-API:er

PoÃĪngen ÃĪr inte att undvika kraftfulla modeller. PoÃĪngen ÃĪr att vÃĪlja medvetet, med bevis, snarare ÃĪn att som standard vÃĪlja den stÃķrsta namnet pÃĨ leaderboarden fÃķr att det kÃĪndes som ett sÃĪkert val.

Sammanfattning

Att vÃĪlja en AI-modell fÃķr din applikation bÃķr inte kÃĪnnas som en prestige-tÃĪvling. Den mest kapabla modellen pÃĨ papper ÃĪr inte alltid rÃĪtt modell fÃķr ditt problem, eller ens vanligtvis.

Matcha modellen till uppgiften. KÃķr utvÃĪrderingar pÃĨ riktiga data. Faktor in latens, kostnad, sÃĪkerhetskrav och ditt teams fÃķrmÃĨga att konstruera promptrar eller finjustera. De bÃĪsta AI-produktbesluten grundas i dessa specifika, inte i vilket fÃķretag som publicerade de mest imponerande siffrorna fÃķrra kvartalet.

Teamen som levererar fantastiska AI-produkter kÃķr inte nÃķdvÃĪndigtvis de kraftfullaste modellerna. De kÃķr de mest lÃĪmpliga.

David Balaban ÃĪr en datorsÃĪkerhetsforskare med Ãķver 17 ÃĨrs erfarenhet av malwareanalys och utvÃĪrdering av antivirusprogram. David driver MacSecurity.net och Privacy-PC.com projekt som presenterar expertrÃĨd om samtida informations sÃĪkerhetsfrÃĨgor, inklusive social ingenjÃķrskonst, malware, penetrationstestning, hotintelligens, online integritet och white hat-hacking. David har en stark bakgrund inom felsÃķkning av malware, med ett nyligt fokus pÃĨ motÃĨtgÃĪrder mot ransomware.