Ajatusjohtajat

Miksi kaikkein kyvykkÃĪin tekoÃĪlymalli ei vÃĪlttÃĪmÃĪttÃĪ ole oikea valinta sovelluksellesi

mm
LisÃĪÃĪ Unite.AI suosikkilÃĪhteisiisi Google-palvelussa
Hand selecting a glowing AI model cube from multiple options in a modern tech office, symbolizing strategic AI model selection.

On tietynlainen turvallisuuden tunne valitaessa voimakkain malli. Kun rakennat tekoÃĪlykÃĪyttÃķistÃĪ tuotetta, tuntuu vastuulliselta (melkein loogiselta) valita voimakkain saatavilla oleva malli. GPT-4o. Claude Opus. Gemini Ultra. NÃĪmÃĪ ovat vaikuttavia teknologioita, ja kukaan ei koskaan menettÃĪnyt tyÃķtÃĪÃĪn valitsemalla viisaan tyÃķkalun huoneessa.

Poikkeuksena on kuitenkin se, ettÃĪâ€Ķ Projektit laajenevat. Kustannukset kasvavat. Viiveet alkavat vaivata. Ja noin kuukauden kolmen paikkeilla tiimi alkaa esittÃĪÃĪ epÃĪmukavia kysymyksiÃĪ siitÃĪ, miksi yksinkertainen automaattisen tÃĪydennysominaisuus polttaa API-luottokortteja kuin startup-yritys, jolla on venture-rahastot ja ei vastuuta.

Asia on se, ettÃĪ â€œkyvykkÃĪin” ja “soveltuvin” ovat kaksi eri standardia. TekoÃĪlysovelluskehityspalvelujen tarjoajat valitsevat malleja arvioinnin perusteella, ei johtajan sijoitusten perusteella.

Suurempi ei vÃĪlttÃĪmÃĪttÃĪ ole parempi

Rajamalli toimii poikkeuksellisen hyvin ihanteellisissa olosuhteissa, mutta se on kallista kÃĪyttÃĪÃĪ, kÃĪsittelee virheellisiÃĪ syÃķtteitÃĪ huonosti ja ylittÃĪÃĪ vaatimukset yksinkertaisissa tehtÃĪvissÃĪ.

GPT-4o voi kirjoittaa runoja, perustella oikeudellisia sopimuksia, korjata koodia ja selittÃĪÃĪ kvantti-sideyhteyden kymmenenvuotiaalle, joskus samassa vastauksessa. Se on aidosti merkittÃĪvÃĪ. Mutta jos sovelluksesi tiivistÃĪÃĪ asiakastukipyyntÃķjÃĪ tai poistaa rakenteellista tietoa laskuista, maksat kyvyistÃĪ, joita ei kÃĪytetÃĪ.

PienemmÃĪt, erikoistuneet mallit kÃĪsittelevÃĪt kohdennettuja tehtÃĪviÃĪ vaikuttavalla tarkkuudella:

  • GPT-4o mini kattaa useimmat kielitehtÃĪvÃĪt noin 15-kertaisella alhaisemmalla kustannuksella kuin GPT-4o
  • Claude Haiku on rakennettu nopeuteen ja tehokkuuteen suurivolyymisissÃĪ, rakenteellisissa tyÃķkuormissa
  • Mistral 7B ja Llama 3.1 8B ovat avoimen lÃĪhdekoodin vaihtoehtoja, jotka suorittavat nopeasti ja hienosÃĪÃĪtÃķÃĪ hyvin

Ero nÃĪiden ja rajamallien vÃĪlillÃĪ pienenee huomattavasti, kun tehtÃĪvÃĪ on kapea ja ohjaukset on suunniteltu hyvin.

Kustannuslaskelma, josta kukaan ei puhu suunnittelukokouksissa

Rajamallien API-hinnat voivat olla 10-30-kertaisia korkeammat kuin kevyempien vastineiden per tokeni. Se ero kuulostaa abstraktilla, kunnes mallinnat sen mittakaavassa.

Oletetaan, ettÃĪ sovelluksesi tekee 500 000 API-kutsua kuukaudessa:

Malli Arvioitu kuukausikustannus
GPT-4o 1 500 – 3 000 dollaria
GPT-4o mini 150 – 300 dollaria
Claude Haiku 125 – 250 dollaria

Sama ominaisuus. Hyvin erilainen voittojen tarina.

Jotkut tiimit suorittavat hybridi-arkkitehtuureja, jossa yksinkertaiset luokittelutehtÃĪvÃĪt ohjataan kevyempiin malleihin, kun taas raskaammat mallit pidetÃĪÃĪn kompleksisemmille generointi- tai pÃĪÃĪttelyvaiheille. Yritykset kuten Martian ja RouteLLM ovat kehittÃĪneet tyÃķkaluja tÃĪllaisen mallin reititykseen. Se ei ole glamouria, mutta se on sellaista, joka tekee CFO:iden merkittÃĪvÃĪsti rentoutuneemmaksi.

Viive on kÃĪyttÃķkokemusongelma

On syy, miksi nopea ruoka on olemassa. Ihmiset eivÃĪt aina halua viiden ruokalajin ateriaa. Joskus he haluavat vastauksensa nyt.

Rajamallit ovat hitaampia. Ei aina paljon, mutta riittÃĪvÃĪsti, jotta se merkitsee reaaliaikaisissa sovelluksissa. Jos kÃĪyttÃĪjÃĪt odottavat tekoÃĪlyvastauksia keskusteluliittymÃĪssÃĪ, chat-rajapinnassa tai live-koodin apulaisessa, vastausviive muotoilee suoraan, miten tuote tuntuu. Malli, joka vie 4-6 sekuntia vastata, alkaa tuntua epÃĪluotettavalta, vaikka tuloste on teknisesti ylempÃĪÃĪ tasoa.

SÃĪÃĪntÃķ: Jos kÃĪyttÃĪjÃĪ nÃĪkee latauspyÃķrÃĪÃĪ, jokainen ylimÃĪÃĪrÃĪinen sekunti vÃĪhentÃĪÃĪ luottamusta.

Haiku, Mistral ja Llama 3.1 8B suorittavat huomattavasti nopeammin (joskus 3-5 kertaa nopeammin) samanlainen kuormitusolosuhteissa. KÃĪyttÃĪjÃĪn nÃĪkÃķkulmasta tÃĪrkeissÃĪ ominaisuuksissa, joissa havaittu nopeus on merkittÃĪvÃĪ, se ei ole vÃĪhÃĪpÃĪtÃķinen asia. Se on tuotepÃĪÃĪtÃķs.

Ohjausmuuttuja, joka muuttaa kaiken

TÃĪssÃĪ on jotain, jota yleensÃĪ ohitetaan mallin vertailuketjuissa: hyvin suunniteltu ohjaus kevyemmÃĪssÃĪ mallissa usein voittaa laiskan ohjauksen rajamallissa.

Tulosteen laatu on tuote mallin kyvystÃĪ JA ohjauslaadusta. Kun tiimit panostavat ohjaussuunnitteluun (selkeÃĪt ohjeet, rakenteelliset tulostemuodot, vÃĪhÃĪisiÃĪ esimerkkejÃĪ, hyvin mÃĪÃĪritellyt rajoitukset), kevyemmÃĪt mallit suorittavat paljon ylÃĪpuolellaan olevaa ilmoitettua katossa.

Muutamia tyÃķkaluja, joita kannattaa tietÃĪÃĪ tÃĪssÃĪ:

  • LangChain ja DSPy ohjausputkien koostamiseen ja optimointiin
  • Guidance rajoitettuun generointiin ja rakenteellisiin tulosteisiin
  • PromptFoo jÃĪrjestelmÃĪllisiin ohjaustestauksiin malleissa

Jotkut vaikuttavimmat tekoÃĪlyominaisuudet tuotannossa tÃĪnÃĪÃĪn suorittavat malleilla, jotka eivÃĪt rikkoneet kÃĪrkipaikkaa minkÃĪÃĪn kyvyn johtajan listalla. Ne suorittavat vain todella hyvillÃĪ ohjauksilla.

HienosÃĪÃĪtÃķ muuttaa yhtÃĪlÃķn

Vertailu rajamallin ja pienemmÃĪn avoimen lÃĪhdekoodin mallin vÃĪlillÃĪ nÃĪyttÃĪÃĪ erilaiselta, kun hienosÃĪÃĪtÃķ tulee kuvaan. Llama 3.1 8B-malli, joka on hienosÃĪÃĪtelty tietyllÃĪ alueella (terminologiasi, reunatapauksesi, tulostemuodosi), voi suorittaa GPT-4o:ta paremmin tietyssÃĪ tehtÃĪvÃĪssÃĪ.

Se ei ole hypoteettinen. Yritykset terveydenhuollossa, lakitekniikassa ja e-commerce-toimialalla ovat osoittaneet sen useasti.

MissÃĪ aloittaa hienosÃĪÃĪtÃķ:

  • Hugging Face avoimen lÃĪhdekoodin mallin isÃĪntÃĪ, tietokantoja ja koulutusinfrastruktuuria varten
  • Together AI nopeisiin, edullisiin hienosÃĪÃĪtÃķÃķn suosituilla avoimilla malleilla
  • Replicate mukautettujen mallien kÃĪyttÃķÃķnotto ilman oman GPU-infrastruktuurin hallintaa

HienosÃĪÃĪtÃķ vaatii etukÃĪteen investoinnin: datan kuratointi, laskentaaika, arviointityÃķ. Mutta suurivolyymisissÃĪ, aluekohtaisissa tehtÃĪvissÃĪ taloudelliset seikat usein ovat huomattavasti sen edullisia.

Turva ja tietoresidenssi eivÃĪt ole jÃĪlkijunia

Jotkut sovellukset eivÃĪt voi lÃĪhettÃĪÃĪ tietoja kolmannen osapuolen API:lle lainkaan. Tarkastele:

  • Terveydenhuollon alustoja, jotka toimivat HIPAA:n alaisuudessa
  • RahoitusvÃĪlineitÃĪ, jotka kÃĪsittelevÃĪt henkilÃķtietoja tai sÃĪÃĪnneltyjÃĪ transaktiotietoja
  • Yrityssovelluksia, joilla on tiukat tietoresidenssivaatimukset

NÃĪmÃĪ ympÃĪristÃķt ovat rajoituksia, joita mikÃĪÃĪn rajamalli-API ei voi kiertÃĪÃĪ, riippumatta kyvystÃĪ. ItseisÃĪnnitettyjÃĪ malleja, olipa se sitten paikallinen tai yksityinen pilvi, on ainoa eteenpÃĪin vievÃĪ polku. Se tarkoittaa avoimen lÃĪhdekoodin malleja, kuten Llama 3, Mistral tai Phi-3, joita suoritetaan oman infrastruktuurin ympÃĪrillÃĪ. Rajamalli, jota et voi laillisesti kÃĪyttÃĪÃĪ tuotannossa, ei ole oikea valinta, piste.

Arviointivaihe, jonka tiimit jatkuvasti ohittavat

Useimmat tiimit valitsevat mallin olettamalla, ettÃĪ kallis on paras ilman testausta. MitÃĪ heidÃĪn pitÃĪisi tehdÃĪ, on suorittaa jÃĪrjestelmÃĪllisiÃĪ arviointeja edustavista nÃĪytteistÃĪ heidÃĪn todellisesta kÃĪyttÃķtarkoituksestaan.

TÃĪssÃĪ on prosessi, joka toimii:

  1. Rakenna arviointijoukko 100-200 edustavaa syÃķtettÃĪ odotettavilla tulosteilla
  2. Suorita ne kaksi tai kolme ehdokasmallia realistisissa olosuhteissa
  3. PisteytÃĪ todellisia kriteerejÃĪsi: tarkkuus, muodon mukaisuus, sÃĪvy, viive, kustannus per kutsu
  4. PÃĪÃĪtÃĪ perustuvasti, ei vÃĪkisin tai johtajan sijoituksiin

TyÃķkalut kuten Braintrust, PromptFoo ja Weights & Biases Prompts tekevÃĪt tÃĪmÃĪnkaltaisen jÃĪrjestelmÃĪllisen arvioinnin helpoksi ilman tutkimustausta. Se vie muutaman tunnin asettaa. HyÃķty on, ettei valitse vÃĪÃĪrÃĪÃĪ mallia kuuden kuukauden ajaksi.

Kun rajamalli on todella oikea valinta

Reilusti: on tehtÃĪviÃĪ, joissa rajamallit ansaitsevat hinnastonsa.

KÃĪytÃĪ rajamallia, kun:

  • TehtÃĪvÃĪ vaatii monimutkaisia, usean askeleen pÃĪÃĪttelyÃĪ ilman selkeÃĪÃĪ mallia
  • Tulosteen laadun vaihtelu on kallista ja tilavuus on suhteellisen alhainen
  • Tarvitset laajaa maailmantietoa tai hienostunutta arviointia, jota ei voi ohjata
  • Olet prototyyppi ja et ole mÃĪÃĪritellyt tehtÃĪvÃĪn rajoja

Pysy kevyemmÃĪssÃĪ mallissa, kun:

  • TehtÃĪvÃĪ on mÃĪÃĪritelty ja toistuva
  • Nopeus ja kustannus merkitsevÃĪt tilavuudessa, jota suoritat
  • Voit panostaa ohjaussuunnitteluun tai hienosÃĪÃĪtÃķÃķn
  • Tietoresidenssi- tai vaatimussÃĪÃĪnnÃķt estÃĪvÃĪt kolmannen osapuolen API:t

Asia ei ole vÃĪlttÃĪÃĪ voimakkaita malleja. Asia on valita tietoisesti, nÃĪyttÃķÃķn perustuen, ei olettaa suurimman nimen johtajan listalla, koska se tuntui turvalliselta valintlta.

Yhteenveto

TekoÃĪlymallin valinta sovelluksellesi ei pitÃĪisi tuntua prestiisikilpailulta. KyvykkÃĪin malli paperilla ei vÃĪlttÃĪmÃĪttÃĪ ole oikea malli ongelmaasi, tai yleensÃĪ.

Sovella mallia tehtÃĪvÃĪÃĪn. Suorita arviointeja todellisilla tiedoilla. Ottaa huomioon viiveen, kustannukset, turvavaatimukset ja tiimisi kyky ohjaussuunnitteluun tai hienosÃĪÃĪtÃķÃķn. Parhaat tekoÃĪlytuote pÃĪÃĪtÃķkset perustuvat niihin yksityiskohtiin, ei siihen, mikÃĪ yritys julkaisi loistavimmat numerot viime kuussa.

Tiimit, jotka toimittavat suuria tekoÃĪlytuotteita, eivÃĪt vÃĪlttÃĪmÃĪttÃĪ suorita voimakkaimpia malleja. He suorittavat soveltuvin malleja.

David Balaban on tietoturvatutkija, jolla on yli 17 vuoden kokemus haittaohjelmien analyysistÃĪ ja virustorjuntaohjelmistojen arvioinnista. David johtaa MacSecurity.net ja Privacy-PC.com -projekteja, jotka esittÃĪvÃĪt asiantuntijalausuntoja nykyisistÃĪ tietoturva-asioista, mukaan lukien sosiaalinen insinÃķÃķritaito, haittaohjelmat, penetraatiotestaus, uhkien tunnistaminen, verkkoyksityisyys ja valkoinen hattuhakkerointi. Davidilla on vankka tausta haittaohjelmien vianmÃĪÃĪrityksessÃĪ, ja viimeaikaisessa keskittyminen on ollut kiristyssalkkujen vastaisissa toimissa.