Lideri de opinie

De ce modelul de IA cel mai capabil nu este întotdeauna alegerea potrivită pentru aplicația dvs.

mm
Adaugă Unite.AI la sursele tale preferate pe Google
Hand selecting a glowing AI model cube from multiple options in a modern tech office, symbolizing strategic AI model selection.

Există un anumit confort în alegerea modelului cel mai puternic. Când construiți un produs alimentat de IA, pare logic să alegeți modelul cel mai puternic disponibil. GPT-4o. Claude Opus. Gemini Ultra. Acestea sunt tehnologii impresionante, și nimeni nu a fost dat afară pentru că a ales cel mai inteligent instrument din cameră.

Exceptând faptul că există o excepție. Proiectele se umflă. Costurile se înmulțesc. Latența se instalează. Și undeva în jurul lunii a treia, echipa începe să pună întrebări incomode despre de ce o funcție simplă de autocompletare arde prin creditele API ca o companie cu finanțare de venture și fără răspundere.

Aici este problema: “cel mai capabil” și “cel mai potrivit” sunt două standarde foarte diferite. Furnizorii de servicii de dezvoltare de aplicații IA selectează modele pe baza evaluărilor, nu pe baza clasamentelor.

Mai mare nu este întotdeauna mai bine

Un model de frontieră funcționează extraordinar de bine în condiții ideale, dar costă mult să fie operat, nu se descurcă bine cu intrările imperfecte și depășește cerințele pentru sarcini simple.

GPT-4o poate scrie poezii, poate raționa prin contracte legale, poate deborda cod și poate explica încurcătura cuantică unui copil de zece ani, uneori în aceeași răspuns. Acesta este cu adevărat remarcabil. Dar dacă aplicația dvs. rezumă biletele de suport ale clienților sau extrage date structurate din facturi, plătiți pentru capacități care nu sunt utilizate.

Modelele mai mici și specializate gestionează sarcini focalizate cu o precizie impresionantă:

  • GPT-4o mini acoperă cele mai multe sarcini de limbaj la un cost de aproximativ 15 ori mai mic decât GPT-4o
  • Claude Haiku este construit pentru viteză și eficiență pe sarcini structurate de volum ridicat
  • Mistral 7B și Llama 3.1 8B sunt opțiuni open-source care rulează rapid și se adaptează bine

Diferența dintre acestea și modelele de frontieră se micșorează considerabil atunci când sarcina este îngustă și prompturile sunt bine inginerizate.

Matematica costurilor despre care nimeni nu vorbește în ședințele de planificare

Prețurile API pentru modelele de frontieră pot fi de 10 până la 30 de ori mai mari pe token decât cele mai ușoare contrapartide. Această diferență pare abstractă până când o modelați la scară.

Să presupunem că aplicația dvs. face 500.000 de apeluri API pe lună:

Model Cost lunar estimat
GPT-4o $1.500 – $3.000
GPT-4o mini $150 – $300
Claude Haiku $125 – $250

Aceeași funcție. O poveste de marjă foarte diferită.

Unele echipe rulează arhitecturi hibride, dirijând sarcini simple de clasificare către modele ușoare, în timp ce rezervă modelele mai grele pentru pașii de generare sau raționament complex. Companii precum Martian și RouteLLM au construit instrumente special pentru acest tip de dirijare a modelului. Nu este o inginerie glamuroasă, dar este genul de lucru care face CFO-ii mult mai relaxați.

Latența este o problemă de experiență a utilizatorului

Există un motiv pentru care există mâncare rapidă. Oamenii nu vor întotdeauna un meniu de cinci feluri. Uneori vor răspunsul acum.

Modelele de frontieră sunt mai lente. Nu întotdeauna cu mult, dar suficient de mult pentru a conta în aplicațiile în timp real. Dacă utilizatorii dvs. așteaptă răspunsuri IA într-un UI conversațional, o interfață de chat sau un asistent de codare live, latența răspunsului influențează direct modul în care se simte produsul. Un model care necesită 4-6 secunde pentru a răspunde începe să pară nefiabil, chiar dacă ieșirea este tehnic superioră.

Regula de bază: Dacă un utilizator vede un indicator de încărcare, fiecare secundă suplimentară reduce încrederea.

Haiku, Mistral și Llama 3.1 8B rulează considerabil mai rapid (uneori de 3 până la 5 ori mai rapid) în condiții de încărcare similare. Pentru funcțiile cu față către utilizator unde viteza percepută contează, acesta nu este un considerent minor. Este o decizie de produs.

Variabila de inginerie a promptului (care schimbă totul)

Aici este ceva care este trecut cu vederea în firele de discuție despre modele: un prompt bine conceput pe un model mai mic poate bate un prompt leneș pe un model de frontieră.

Calitatea ieșirii este un produs al capacității modelului ȘI al calității promptului. Când echipele investesc în ingineria promptului (instrucțiuni clare, formate de ieșire structurate, exemple cu puține împușcături, constrângeri bine definite) modelele mai mici funcționează mult peste aparenta lor limită.

Câteva instrumente care merită să fie cunoscute aici:

  • LangChain și DSPy pentru compunerea și optimizarea conductelor de prompt
  • Guidance pentru generarea constrânsă și ieșirile structurate
  • PromptFoo pentru evaluarea sistematică a prompturilor pe modele

Unele dintre cele mai impresionante funcții IA din producție astăzi rulează pe modele care nu ar fi intrat în top 5 pe niciun clasament de capacități. Ele rulează doar pe prompturi foarte bune.

Reglarea fină schimbă ecuația

Comparația între un model de frontieră general și un model open-source mai mic arată foarte diferit odată ce reglarea fină intră în imagine. Un model Llama 3.1 8B reglat fin pe datele dvs. specifice de domeniu (terminologia dvs., cazurile dvs. limită, formatul dvs. de ieșire preferat) poate depăși GPT-4o pe sarcina dvs. specifică.

Acesta nu este un scenariu ipotetic. Companii din domeniul sănătății, tehnologiei juridice și comerțului electronic au demonstrat acest lucru în mod repetat.

De unde să începeți cu reglarea fină:

  • Hugging Face pentru gazduirea modelului open-source, seturi de date și infrastructură de antrenament
  • Together AI pentru rularea rapidă și ieftină a reglării fine pe modelele open-source populare
  • Replicate pentru implementarea modelului personalizat fără a gestiona propria infrastructură GPU

Reglarea fină necesită o investiție inițială: curățarea datelor, timpul de calcul și munca de evaluare. Dar pentru sarcini de volum ridicat și specifice domeniului, economia de obicei funcționează substanțial în favoarea sa.

Securitatea și rezidența datelor nu sunt aspecte trecute cu vederea

Unele aplicații nu pot trimite date către API-uri terțe deloc. Luați în considerare:

  • Platformele de sănătate care funcționează sub HIPAA
  • Uneltele financiare care manipulează informații personale sau date de tranzacție reglementate
  • Software-ul de întreprindere cu cerințe stricte de rezidență a datelor

Aceste medii au constrângeri pe care niciun model de frontieră API nu le poate ocoli, indiferent de capacitate. Modelele autogazduite, fie într-un mediu local, fie într-un cloud privat, sunt singura cale înainte. Acest lucru înseamnă modele open-source precum Llama 3, Mistral sau Phi-3, care rulează pe propria infrastructură. Un model de frontieră pe care nu îl puteți utiliza în mod legal în producție nu este alegerea potrivită, punct.

Pasul de evaluare pe care echipele îl sar peste

Majoritatea echipelor selectează un model prin presupunerea că modelul scump este cel mai bun, fără a-l testa. Ceea ce ar trebui să facă este să ruleze evaluări structurate pe mostre reprezentative ale cazului lor de utilizare real.

Iată un proces care funcționează:

  1. Construiți un set de evaluare de 100 până la 200 de intrări reprezentative cu ieșiri așteptate
  2. Rulați-le prin două sau trei modele candidate în condiții realiste
  3. Evaluati împotriva criteriilor dvs. reale: acuratețe, conformitate cu formatul, ton, latență, cost pe apel
  4. Decideți pe baza datelor, nu a intuiției sau a clasamentelor

Unelte precum Braintrust, PromptFoo și Weights & Biases Prompts fac această evaluare sistematică accesibilă fără o pregătire de cercetare. Acesta durează câteva ore pentru a fi configurat. Rezultatul este acela că nu alegeți modelul greșit pentru șase luni.

Când modelul de frontieră este de fapt alegerea corectă

Pentru a fi corect: există sarcini pentru care modelele de frontieră își câștigă cu adevărat prețul.

Utilizați un model de frontieră atunci când:

  • Sarcina necesită raționament complex, multi-pașii, fără un șablon clar
  • Variația calității ieșirii este costisitoare și volumul este relativ scăzut
  • Aveți nevoie de cunoștințe ample despre lume sau de judecată nuanțată care nu poate fi evitată prin prompturi
  • Sunteți în faza de prototipare și nu ați definit încă limitele sarcinii

Rămâneți cu un model mai ușor atunci când:

  • Sarcina este bine definită și repetitivă
  • Viteza și costul contează la volumul pe care îl rulează
  • Puteți investi în ingineria promptului sau reglarea fină
  • Regulile de rezidență a datelor sau de conformitate exclud API-urile terțe

Punctul nu este de a evita modelele puternice. Punctul este de a alege în mod deliberat, cu dovezi, în loc de a se baza pe numele cel mai mare de pe clasament pentru că a părut a fi alegerea sigură.

Rezumat

Alegerea unui model de IA pentru aplicația dvs. nu ar trebui să se simtă ca o competiție de prestigiu. Modelul cel mai capabil pe hârtie nu este întotdeauna modelul potrivit pentru problema dvs., sau de obicei.

Potrivirea modelului cu sarcina. Rulați evaluări pe date reale. Luați în considerare latența, costul, cerințele de securitate și capacitatea echipei dvs. pentru ingineria promptului sau reglarea fină. Cele mai bune decizii de produs IA sunt bazate pe aceste detalii, nu pe faptul că o companie a publicat numerele cele mai strălucitoare în ultimul trimestru.

Echipele care livrează produse IA excelente nu rulează neapărat modelele cele mai puternice. Ei rulează cele mai potrivite.

David Balaban este un cercetător în domeniul securității calculatoarelor, cu peste 17 ani de experiență în analiza malware-ului și evaluarea software-ului antivirus. David conduce proiectele MacSecurity.net și Privacy-PC.com care prezintă opinii ale experților pe probleme actuale de securitate a informației, incluzând ingineria socială, malware, testarea de penetrare, inteligența amenințărilor, confidențialitatea online și hacking-ul cu pălărie albă. David are o puternică experiență în soluționarea problemelor de malware, cu o focalizare recentă pe măsurile de contracarare a ransomware-ului.