Lideri de opinie
De ce costurile tokenurilor distrug bugetele directorilor financiari în 2026

În mai puțin de un an, costurile tokenurilor AI au trecut de la un detaliu tehnologic minor la o problemă bugetară discutată la nivelul consiliului de administrație. Acum douăsprezece luni, „costul tokenurilor” nu era o poziție urmărită de majoritatea directorilor financiari. Acum apare în toate locurile nedorite: în presă, în note interne, în înghețarea bugetelor și în conferințele privind rezultatele financiare.
Uber le-a oferit inginerilor săi acces la Claude Code la sfârșitul anului 2025. Până în aprilie 2026, compania își consumase în patru luni întregul buget anual pentru programare cu ajutorul AI. Ca răspuns, a limitat cheltuielile la 1.500 de dolari per angajat, pe lună și pentru fiecare instrument, după cum a relatat prima dată Bloomberg. Dacă este permisă folosirea simultană a două instrumente de programare agentică, de exemplu Claude și Cursor, plafonul se dublează la 3.000 de dolari pe lună pentru fiecare inginer, adică 36.000 de dolari anual pentru utilizarea AI de către o singură persoană. Se estimează că Uber are aproximativ 4.000 de ingineri, ceea ce ar echivala cu cheltuieli de 144 de milioane de dolari pentru AI.
Cheltuielile Meta ar putea fi și mai mari. O notă internă avertiza că valoarea costurilor tokenurilor AI urma să atingă miliarde de dolari în 2026. Motivul se află în mecanismul de funcționare a agenților la scară largă. Atunci când un agent AI se conectează la o bază de cod pentru a remedia o eroare sau a scrie software, procesează mii de tokenuri de context la fiecare solicitare. Aplicați acest lucru într-o organizație de dimensiunea Meta și adăugați inițiativa companiei ca inginerii să utilizeze Claude: consumul de tokenuri nu doar crește, ci explodează.
Potrivit indicelui AI al Ramp, care urmărește plățile reale către furnizori în peste 70.000 de companii, primul procent dintre companiile care adoptă AI cheltuiește acum aproximativ 7.500 de dolari pe angajat și pe lună pentru AI, iar aceste cheltuieli cresc cu 14,1% de la o lună la alta. Directori ai Mercor, o companie nouă de recrutare bazată pe AI, au declarat public că, în unele organizații, costurile tokenurilor AI încep să se apropie de remunerațiile angajaților sau chiar să le depășească.
De aici trebuie desprinsă o lecție. Dacă cele mai mari companii de tehnologie din lume pot fi surprinse de aceste costuri, oricine poate fi surprins. Consumul de tokenuri a devenit o categorie de cheltuieli cu adevărat nouă, care nu exista în niciun cont de profit și pierdere acum doi ani. Nu se comportă precum costurile software pe care echipele financiare au învățat timp de decenii să le modeleze și să le includă în calculele tradiționale ale rentabilității investiției. Înțelegerea motivului pentru care costurile tokenurilor AI se comportă atât de diferit față de cheltuielile software tradiționale este primul pas pentru a le ține sub control.
De ce costurile tokenurilor AI sunt atât de greu de prevăzut
Bugetarea tradițională a programelor software se bazează pe o presupunere simplă: costurile cresc odată cu numărul de angajați. Zece angajați în plus înseamnă zece licențe suplimentare, la un preț cunoscut. Acest lucru este ușor de prevăzut și planificat atunci când companiile cresc sau cumpără licențe pentru platforme software noi.
Tokenurile AI invalidează această presupunere. Costurile cresc în funcție de utilizare, nu de numărul de angajați, iar utilizarea este extrem de inegală, greu de prevăzut și, în cazul agenților autonomi, nici măcar nu este legată de o persoană așezată în fața unei tastaturi. Un singur inginer care desfășoară o sesiune de programare agentică poate consuma mii de dolari într-o lună fără niciun avertisment, deoarece contorul funcționează indiferent dacă rezultatul este util. Multe modele generează și mii de tokenuri ascunse, invizibile, doar pentru a „gândi” pas cu pas înainte de a răspunde, multiplicând costul fiecărei solicitări.
Aceasta este partea pe care majoritatea organizațiilor nu au inclus-o încă în calcule: fiecare dolar nou cheltuit pentru AI agentică trebuie să provină de undeva. Pentru majoritatea directorilor financiari, nu este o eroare de rotunjire absorbită de un fond pentru inovare. Vorbim despre milioane de dolari în cheltuieli noi care nu existau acum doi ani. Acest lucru creează un compromis real cu numărul de angajați, alte investiții tehnologice sau bugetele discreționare din alte părți ale companiei.
Cele trei niveluri de risc ale cheltuielilor AI în companii
Analizând modul în care organizațiile cheltuiesc în realitate pentru AI, observăm un model tot mai clar. Riscul de cost nu este distribuit uniform. Se concentrează în anumite locuri, iar într-o organizație obișnuită probabil că doar unul dintre cele trei niveluri este în prezent sub control.
Utilizatorii din vânzări, marketing și operațiuni folosesc în mare parte instrumente tarifate per licență: între 20 și 30 de dolari per utilizator, pe lună, la preț fix. Acesta este nivelul pe care departamentul financiar știe deja să îl bugeteze, deoarece se comportă exact ca orice altă poziție SaaS achiziționată în ultimii douăzeci de ani.
Dezvoltatorii care folosesc instrumente de programare agentică sunt sursa poveștilor precum cea a Uber, iar întreaga categorie tocmai a trecut de la tarife fixe la prețuri măsurate în funcție de consum. GitHub Copilot a trecut la facturarea bazată pe tokenuri în iunie 2026, iar dezvoltatorii au estimat facturi care cresc de la 29 la 750 de dolari pe lună și de la 50 la 3.000 de dolari lunar în sesiuni agentice intensive. Uber nu este o excepție, ci o perspectivă timpurie asupra direcției întregii categorii.
Agenții autonomi reprezintă nivelul pe care aproape nimeni nu l-a modelat încă. Pentru un agent nu există conceptul de „licență de utilizator”. Agentul funcționează nesupravegheat, pornește subagenți, reîncearcă în caz de eșec și consumă tokenuri tot timpul, indiferent dacă produce sau nu ceva valoros. Acesta este nivelul pentru care există cele mai puține date privind costurile și cele mai puține precedente bugetare.
Pe scurt, nivelul cu care directorii financiari se simt cel mai confortabil reprezintă și cel mai mic risc financiar. Cele două niveluri care fac efectiv ca bugetele să explodeze sunt cele care se îndepărtează de tarifele previzibile chiar în momentul în care utilizarea lor crește cel mai rapid.
Eliminarea deficitului de gestionare a costurilor AI
Elementul comun în situațiile Uber și Meta și în ansamblul mai larg de date Ramp este lipsa de vizibilitate. Majoritatea organizațiilor nu au un nivel de control între angajatul sau agentul care deschide un instrument și instrumentul respectiv. Plafoanele de cheltuieli precum cel al Uber sunt o soluție grosieră, aplicată după producerea faptelor, pentru o problemă care ar trebui de fapt abordată mai devreme.
Aceasta este lacuna pe care o categorie mai nouă de instrumente, numită adesea orchestrarea agenților sau portaluri pentru agenți, a fost concepută să o acopere: să direcționeze fiecare sarcină către cel mai ieftin model capabil să o realizeze, să impună limite de cheltuieli înainte ca acestea să fie depășite și să ofere departamentului financiar un contor în timp real, nu o surpriză lunară.
Această categorie evoluează rapid și se împarte deja în câteva niveluri distincte. Unul este reprezentat de portalurile cu control al costurilor, care se află între aplicațiile unei organizații și furnizorii săi de modele și adaugă plafoane de cheltuieli per echipă, direcționarea automată a sarcinilor simple către modele mai ieftine și stocarea răspunsurilor în memoria cache: aceleași mecanisme folosite manual de Uber atunci când și-a impus plafonul. Al doilea nivel este orchestrarea agenților, care se concentrează asupra coordonării mai multor agenți ce lucrează împreună și integrează tot mai mult vizibilitatea costurilor de la început, în loc să o adauge ulterior. Un nivel mai nou, destinat departamentului financiar, începe să trateze cheltuielile pentru AI așa cum echipele FinOps tratează de mult cheltuielile pentru cloud: atribuite în funcție de echipă și funcționalitate, bugetate și analizate lunar, în loc să fie descoperite după producerea lor.
Există apoi o abordare arhitecturală care vizează limitarea cheltuielilor prin reducerea dependenței de modelele lingvistice mari. Unele companii au început să creeze o arhitectură hibridă SLM/LLM, în care modelele lingvistice mici sunt antrenate pentru un set restrâns de sarcini corporative, precum politicile interne, serviciul pentru clienți, procesarea documentelor de credit sau analizarea manifestelor de transport. Avantajele economice pot fi convingătoare.
Potrivit unei comparații din 2026 a modelelor LLM pentru companii, la un milion de conversații lunare, modelele LLM de vârf găzduite costă între 15.000 și 75.000 de dolari pe lună, în timp ce un model lingvistic mic, ajustat și instalat intern, costă între 150 și 800 de dolari lunar pentru același volum. Goldman Sachs, de exemplu, gestionează cheltuielile AI la scară largă printr-un portal centralizat de modele care clasifică fiecare solicitare în funcție de tipul sarcinii și o direcționează către cel mai rentabil model pentru lucrarea respectivă, de la modele open-source ușoare până la LLM-uri de vârf, totul în cadrul propriului perimetru de securitate.
Elementul comun este că majoritatea instrumentelor actuale au fost construite de și pentru ingineri, pentru a le accelera productivitatea prin utilizarea agenților. Nivelul care încă lipsește în majoritatea organizațiilor este cel conceput să răspundă direct întrebărilor directorului financiar: ce echipă, ce buget, cum estimăm cheltuielile și ce caz de utilizare comercială este susținut de această cheltuială? Aceasta este lacuna care probabil va conta cel mai mult pe măsură ce cheltuielile cu AI agentică vor continua să se acumuleze.
Acum doi ani, nimic din toate acestea nu exista ca poziție bugetară. Astăzi, costurile tokenurilor AI se numără printre pozițiile cu cea mai rapidă creștere și cel mai puțin înțelese din bilanț, iar gestionarea costurilor AI devine rapid o disciplină financiară esențială, nu un proiect secundar. Am observat o evoluție similară când serviciile cloud au fost adoptate pentru prima dată și costurile au explodat în acel prim val. Organizațiile care planifică implementarea AI agentice ar face bine să poarte acum această discuție între departamentele tehnic și financiar și să stabilească o abordare de gestionare. Uber și Meta au arătat deja ce se întâmplă când discuția are loc după producerea faptelor, nu înainte.












