Tankeledere

Hvorfor det mest kapable AI-modellen sjÃĶldent er det rette valg til din app

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google
Hand selecting a glowing AI model cube from multiple options in a modern tech office, symbolizing strategic AI model selection.

Der er en vis tryghed i at vÃĶlge den mest kraftfulde model. NÃĨr du bygger et AI-drevet produkt, fÃļles det ansvarligt (nÃĶsten logisk) at vÃĶlge den mest kraftfulde model, der er tilgÃĶngelig. GPT-4o. Claude Opus. Gemini Ultra. Disse er imponerende teknologier, og ingen har nogensinde fÃĨet sparken for at vÃĶlge det smarteste vÃĶrktÃļj i rummet.

Undtagen, nu, der er en klausul. Projekter svulmer op. Omkostningerne stiger. Latence sniger sig ind. Og et sted omkring mÃĨned tre begynder holdet at stille ubehagelige spÃļrgsmÃĨl om, hvorfor en simpel autocomplete-funktion brÃĶnder gennem API-kreditter som en startup med venturekapital og ingen ansvarlighed.

Her er sagen: “mest kapabel” og “mest passende” er to meget forskellige standarder. LeverandÃļrer af AI-app-udviklingstjenester vÃĶlger modeller baseret pÃĨ evalueringer, ikke pÃĨ rangeringslister.

StÃļrre er ikke automatisk bedre

En frontier-model udfÃļrer ekstraordinÃĶrt godt i ideelle forhold, men koster meget at operere, hÃĨndterer imperfekte indgange dÃĨrligt og overstiger kravene for simple opgaver.

GPT-4o kan skrive digte, forklare juridiske kontrakter, fejlfinde kode og forklare kvantefysik til en 10-ÃĨrig, nogle gange i samme svar. Det er virkelig imponerende. Men hvis din app sammenfatter kundesupport-billetter eller udtrÃĶkker struktureret data fra fakturaer, betaler du for evner, der ikke bliver brugt.

Mindre, specialiserede modeller hÃĨndterer fokuserede opgaver med imponerende nÃļjagtighed:

  • GPT-4o mini dÃĶkker de fleste sprogopgaver til omkring 15 gange lavere omkostning end GPT-4o
  • Claude Haiku er bygget til hastighed og effektivitet pÃĨ hÃļjvolumen, struktureret arbejde
  • Mistral 7B og Llama 3.1 8B er open-source-muligheder, der kÃļrer hurtigt og tilpasning godt

Gapet mellem disse og frontier-modellerne mindskes betydeligt, nÃĨr opgaven er snÃĶver og prompterne er veludviklede.

Omkostningsmatematikken, som ingen taler om pÃĨ planmÃļder

API-priser for frontier-modeller kan lÃļbe 10 til 30 gange hÃļjere pr. token end deres lettere modstykke. Denne forskel lyder abstrakt, indtil du modellerer den ud pÃĨ stÃļrrelse.

SÃĶt, at din app laver 500.000 API-kald om mÃĨneden:

Model Estimeret mÃĨnedlig omkostning
GPT-4o $1.500 – $3.000
GPT-4o mini $150 – $300
Claude Haiku $125 – $250

Samme funktion. Meget forskellige margener.

Nogle hold kÃļrer hybridarkitekturer, der routerer simple klassificeringsopgaver til lette modeller, mens de reserverer de tungere modeller til komplekse genererings- eller resonemingssteg. Virksomheder som Martian og RouteLLM har bygget vÃĶrktÃļj specifikt til denne type model-routing. Det er ikke glamourÃļs ingeniÃļrarbejde, men det er den slags, der gÃļr CFO’er mÃĶrkbart mere afslappede.

Latence er et brugeroplevelsesproblem

Der er en grund til, at hurtigmad eksisterer. Folk Ãļnsker ikke altid den femretters mÃĨltid. Nogle gange Ãļnsker de deres svar nu.

Frontier-modeller er langsommere. Ikke altid med meget, men nok til at vÃĶre vÃĶsentligt i realtidsapplikationer. Hvis dine brugere venter pÃĨ AI-svar i en konversationsbrugerflade, en chat-grÃĶnseflade eller en live-kodningsassistent, pÃĨvirker svar-latence direkte, hvordan produktet fÃļles. En model, der tager 4-6 sekunder til at svare, begynder at fÃļles upÃĨlidelig, selvom outputtet teknisk set er overlegent.

Reglen er: Hvis en bruger ser en loader-spinner, reducerer hver ekstra sekund tilliden.

Haiku, Mistral og Llama 3.1 8B kÃļrer betydeligt hurtigere (nogle gange 3 til 5 gange hurtigere) under lignende belastningsforhold. For brugerorienterede funktioner, hvor opfattet hastighed er vigtig, er dette ikke en mindre overvejelse. Det er en produktbeslutning.

Prompt-ingeniÃļrvariablen, der ÃĶndrer alt

Her er noget, der ofte bliver overset i model-sammenligninger: en veludviklet prompt pÃĨ en mindre model slÃĨr ofte en dovne prompt pÃĨ en frontier-model.

Outputkvalitet er et produkt af modelkapacitet OG promptkvalitet. NÃĨr hold investerer i prompt-ingeniÃļrarbejde (klare instruktioner, strukturerede outputformater, fÃĨ-skud-eksempler, veldefinerede begrÃĶnsninger) udfÃļrer mindre modeller langt over deres ÃĨbenlyse loft.

Nogle vÃĶrktÃļjer, der er vÃĶrd at kende her:

  • LangChain og DSPy til at komponere og optimere prompt-rÃļrledninger
  • Guidance til begrÃĶnset generering og struktureret output
  • PromptFoo til at kÃļre systematisk prompt-evalueringer pÃĨ tvÃĶrs af modeller

Nogle af de mest imponerende AI-funktioner i produktion i dag kÃļrer pÃĨ modeller, der ikke ville vÃĶre i top 5 pÃĨ nogen kapacitetsrangliste. De kÃļrer bare pÃĨ rigtig gode prompts.

Fine-tuning ÃĶndrer ligningen

Sammenligningen mellem en generel frontier-model og en mindre open-source-model ser meget forskellig ud, nÃĨr fine-tuning kommer ind i billedet. En Llama 3.1 8B-model, der er fine-tuned pÃĨ dine specifikke domÃĶne-data (din terminologi, dine kanttilfÃĶlde, din foretrukne outputformat), kan overgÃĨ GPT-4o pÃĨ din specifikke opgave.

Dette er ikke en hypotese. Virksomheder i sundhedssektoren, jurateknologi og e-handel har demonstreret det gentagne gange.

Hvor at starte med fine-tuning:

  • Hugging Face til open-source-model-vÃĶrt, datasÃĶt og trÃĶningsinfrastruktur
  • Together AI til hurtige, billige fine-tuning-kÃļrsler pÃĨ populÃĶre open-modeller
  • Replicate til at installere brugerdefinerede modeller uden at skulle hÃĨndtere egen GPU-infrastruktur

Fine-tuning krÃĶver forhÃĨndsinvestering: datakurering, beregnings tid, og evaluering. Men for hÃļjvolumen, domÃĶnespecifikke opgaver er Ãļkonomien ofte vÃĶsentligt i dens favÃļr.

Sikkerhed og data-residens er ikke eftertanke

Nogle applikationer kan ikke sende data til tredjeparts-API’er overhovedet. Overvej:

  • Sundhedsplatforme, der opererer under HIPAA
  • FinansvÃĶrktÃļjer, der hÃĨndterer PII eller reguleret transaktionsdata
  • Enterprise-software med stramme data-residenskrav

Disse miljÃļer har begrÃĶnsninger, som ingen frontier-model-API kan arbejde omkring, uanset kapacitet. Selv-vÃĶrtsmodeller, enten pÃĨ stedet eller i en privat sky, er den eneste vej frem. Det betyder open-source-modeller som Llama 3, Mistral eller Phi-3, der kÃļrer pÃĨ din egen infrastruktur. En frontier-model, du ikke kan bruge i produktion, er ikke det rette valg, punktum.

Evalueringstrinnet, som holdene konstant springer over

De fleste hold vÃĶlger en model ved at antage, at den dyre er den bedste, uden at teste den. Det, de burde gÃļre, er at kÃļre strukturerede evalueringer pÃĨ reprÃĶsentative eksempler pÃĨ deres faktiske brugstilfÃĶlde.

Her er en proces, der virker:

  1. Byg en evalueringssÃĶt pÃĨ 100 til 200 reprÃĶsentative input med forventede output
  2. KÃļr dem gennem to eller tre kandidatmodeller under realistiske forhold
  3. Score mod dine virkelige kriterier: nÃļjagtighed, format-overensstemmelse, tone, latence, omkostning pr. kald
  4. Beslut pÃĨ baggrund af data, ikke intuition eller rangeringslister

VÃĶrktÃļjer som Braintrust, PromptFoo og Weights & Biases Prompts gÃļr denne type systematisk evaluering tilgÃĶngelig uden en forskningsbaggrund. Det tager et par timer at sÃĶtte op. Afkastet er ikke at vÃĶlge den forkerte model i seks mÃĨneder.

NÃĨr frontier-modellen faktisk er det rette valg

For at vÃĶre retfÃĶrdig: Der er opgaver, hvor frontier-modeller virkelig fortjener deres pris.

Brug en frontier-model, nÃĨr:

  • Opgaven krÃĶver kompleks, multi-trins-reasonering med ingen klar skabelon
  • Outputkvalitetsvariation er kostbar og volumen er relativt lav
  • Du har brug for bred viden eller nuanceret dÃļmmekraft, der ikke kan promptes rundt
  • Du er i prototypen og har ikke endnu defineret opgavens grÃĶnser

Hold fast ved en lettere model, nÃĨr:

  • Opgaven er veldefineret og repetitiv
  • Hastighed og omkostning er vigtig pÃĨ det volumen, du kÃļrer
  • Du kan investere i prompt-ingeniÃļrarbejde eller fine-tuning
  • Data-residens- eller overholdelsesregler udelukker tredjeparts-API’er

Pointen er ikke at undgÃĨ kraftfulde modeller. Pointen er at vÃĶlge bevidst, med bevis, snarere end at falde tilbage til det stÃļrste navn pÃĨ rangeringslisten, fordi det fÃļltes som det sikre valg.

Sammenfatning

At vÃĶlge en AI-model til din applikation burde ikke fÃļles som en prestige-konkurrence. Den mest kapable model pÃĨ papir er ikke altid den rette model for dit problem, eller normalt.

Match modellen til opgaven. KÃļr evalueringer pÃĨ virkelige data. Medregne latence, omkostning, sikkerhedskrav og dit holds kapacitet for prompt-ingeniÃļrarbejde eller fine-tuning. De bedste AI-produktbeslutninger er baseret pÃĨ disse specifikke detaljer, ikke pÃĨ hvilket firma offentliggjorde de mest imponerende tal sidste kvartal.

Holdene, der sender fantastiske AI-produkter, kÃļrer ikke nÃļdvendigvis de mest kraftfulde modeller. De kÃļrer de mest passende.

David Balaban er en computer sikkerhedsforsker med over 17 ÃĨrs erfaring i malwareanalyse og antivirus software evaluering. David driver MacSecurity.net og Privacy-PC.com projekter, der prÃĶsenterer ekspertrÃĨd pÃĨ moderne informations sikkerhedsspÃļrgsmÃĨl, herunder social engineering, malware, penetrationstest, trusselsintelligens, online privatliv og white hat hacking. David har en stÃĶrk baggrund i malware fejlfinding, med en seneste fokus pÃĨ ransomware modforanstaltninger.