Interviuri
Isaiah N. Granet, Co-Fondator și CEO al Bland – Seria de Interviuri

Isaiah N. Granet, Co-Fondator și CEO al Bland, este un fondator de startup și inginer a cărui experiență combină execuția tehnică cu experiența antreprenorială timpurie și impactul social de lungă durată. Înainte de a lansa actuala sa aventură, el a participat la Z Fellows și Y Combinator, a câștigat experiență în inginerie la Lantern și a fondat San Diego Chill, o organizație non-profit care a strâns peste 2,5 milioane de dolari pentru a ajuta copiii cu dizabilități de dezvoltare să aibă acces la sport, câștigând recunoaștere națională și continuând și astăzi cu implicarea sa la nivelul consiliului de administrație.
Bland se axează pe construirea infrastructurii pentru apeluri telefonice bazate pe inteligență artificială, permițând companiilor să implementeze agenți vocali care pot gestiona suportul clienților, vânzările și fluxurile de lucru operaționale la scară largă. Platforma este proiectată pentru a înlocui sau completa centrele de apel tradiționale, oferind interacțiuni vocale programabile, răspunsuri în timp real și integrări profunde cu sistemele de afaceri, poziționându-se ca un strat central în modul în care companiile automatizează comunicarea cu clienții.
Ați fondat San Diego Chill ca adolescent pentru a crea acces incluziv la sport pentru copiii cu dizabilități de dezvoltare, mult înainte de a intra în Y Combinator sau de a lansa Bland. Cum a influențat experiența dvs. timpurie de a construi o organizație din lumea reală modul în care ați abordat fondarea unei companii de inteligență artificială cu vocație, care acum se află între întreprinderi și clienții lor?
Mult din viața și munca mea s-a concentrat pe construire. De la o vârstă fragedă, am avut această dorință constantă de a aduce lucruri la viață. Odată ce o idee sau o convingere despre lume apare în mintea mea, devine imposibil pentru mine să o ignor. Construirea San Diego Chill nu numai că m-a învățat cum să creez și să conduc o organizație, dar mi-a arătat și impactul pe care acțiunile noastre le pot avea asupra altora. A putea da înapoi prin crearea unei organizații care altfel nu ar fi existat este ceva profund răsplătitor. Lecțiile și valorile învățate de la Chill mă însoțesc în fiecare zi.
După ce ați trecut prin YC în 2023, ce v-a convins că infrastructura vocală pentru întreprinderi era încă fundamental defectă, justificând construirea unui sistem de la capăt, în loc de a adăuga modele LLM pe legacy IVR?
Gândiți-vă la ultima dată când ați folosit un chatbot al unei bănci. Probabil ați așteptat mai mult decât ar fi trebuit, ați primit un răspuns care nu a abordat ceea ce ați întrebat cu adevărat și, în cele din urmă, ați sunat oricum. Apoi, o voce robotică v-a condus printr-un meniu de opțiuni pe care nu le-ați dorit, iar apăsarea tastei 0 nu a făcut nimic util.
Băncile au cheltuit miliarde pentru a face această experiență posibilă, iar chatbot-urile se clasează pe ultimul loc în ceea ce privește satisfacția clienților, cu 29%. Mai mic decât email. Mai mic decât centrele de apel, despre care toată lumea se plânge deja.
Acesta a fost dinamismul pentru două decenii. Întreprinderile încearcă să țină clienții departe de personalul lor. Clienții încearcă în continuare să ajungă la o persoană. Niciuna dintre părți nu câștigă.
Problema nu este că companiile nu vor să remedieze situația. Pur și simplu nu pot angaja personal suficient pentru a oferi o experiență de calitate la scară largă. Un centru de apel care gestionează un milion de apeluri pe lună este o operațiune scumpă și dificilă, iar calitatea este, prin definiție, inconsistentă.
Ce s-a schimbat este că inteligența artificială face, în sfârșit, posibilă rezolvarea apelurilor, și nu doar dirijarea sau devierea lor. Nu vorbim despre copaci telefonici. Nu vorbim despre muzică de așteptare. Vorbind despre un agent care înțelege ce cere clientul și gestionează situația.
Dar acest lucru funcționează doar dacă sistemul este construit pentru voce în timp real, de la zero. Când adăugați modele LLM pe legacy IVR sau asamblați servicii terțe, latența se instalează și fiabilitatea scade. Conversațiile se întrerup.
De aceea ne-am concentrat pe construirea infrastructurii de la capăt. Vocea funcționează doar dacă pare imediată și naturală. Dacă nu, clientul închide.
Bland a luat măsura neobișnuită de a construi și găzdui propriul stivă TTS, inferență și transcriere internă. Care au fost compromisurile pe care le-ați văzut în a vă baza pe API-urile terțe care v-au împins, în cele din urmă, spre deținerea stratului complet de infrastructură vocală?
Fiecare strat pe care îl externalizați adaugă latență și risc.
Majoritatea platformelor de voce AI sunt revânzători. Ei iau transcrierea de la terți, adaugă un model de la terți, îl direcționează prin TTS de la terți și vă oferă rezultatul. Acest lucru poate funcționa într-un demo controlat. Rareori funcționează atunci când volumul de apeluri explodează sau când ceva din lanț merge prost.
Există și o problemă de date. Furnizorii de modele de bază, OpenAI fiind exemplul evident, au folosit datele clienților pentru a antrena modele. Ei spun că licențele pentru întreprinderi sunt diferite. Poate că sunt. Dar această incertitudine este suficientă pentru a face multe echipe de securitate și conformitate să se simtă inconfortabil.
Când găzduiți întreaga stivă — transcriere, inferență, TTS, orchestrare — controlați fiecare milisecundă și fiecare actualizare a modelului. Datele clienților rămân în ecosistemul clientului. Nu ating o linie de antrenament terță, nu trec prin infrastructură pe care nu o puteți audita și nu se mișcă, decât dacă clientul decide astfel.
Puteți oferi fiecărui client întreprindere infrastructură dedicată, astfel încât un vârf de la o altă companie să nu afecteze niciodată performanța lor. Și când ceva se strică, puteți să remediați problema, în loc de a aștepta pe un furnizor al unui furnizor.
Pentru industriile reglementate, unii clienți au nevoie de întreaga stivă în propria lor VPC sau pe teren. Acest lucru este posibil doar dacă furnizorul deține ceea ce implementează.
Automatizarea tradițională a centrelor de contact s-a concentrat puternic pe devierea apelurilor de suport simple. De ce ați decis să priorizați interacțiunile complexe, pe coada lungă, în loc de a optimiza pentru automatizarea pe bază de volum mai întâi?
Automatizarea tradițională a centrelor de contact s-a concentrat în mare măsură pe devierea apelurilor de suport simple. De ce ați prioriza interacțiunile complexe, pe coada lungă, în loc de a începe cu cazuri de utilizare de volum ridicat?
Am adoptat abordarea opusă. Dacă putem gestiona în mod fiabil apelurile cele mai complexe și sensibile, totul devine simplu. Scopul nu este să construim demo-uri, ci să livrăm rezolvarea completă a apelurilor la scară. Acest lucru necesită sisteme cu latență scăzută și fiabilitate ridicată care pot gestiona cazurile limită care definesc, de fapt, conversațiile reale ale clienților.
Agenții dvs. sunt din ce în ce mai mult integrați în CRM-uri și baze de date operaționale pentru a rezolva apelurile de la capăt la capăt. Cum schimbă automatizarea vocală native arhitectura fluxurilor de lucru ale întreprinderilor în comparație cu copiloții bazati pe chat?
Sistemele legacy nu comunică între ele. CRM-urile, instrumentele de programare și platformele de facturare sunt izolate. Fără acces la aceste sisteme, un agent vocal poate răspunde doar la întrebări generice și nu la multe altele.
El nu poate căuta un cont, actualiza un registru sau rezerva o întâlnire. El colectează informații și le transmite. Între timp, reprezentanții umani petrec timp cu lucruri care nu ar trebui să atingă o persoană: înregistrarea notițelor de apel, programarea manuală a întâlnirilor, generarea de rapoarte pentru a determina cine are nevoie de un follow-up.
Integrarea profundă este ceea ce face posibilă rezolvarea de la capăt la capăt. Fără aceasta, ați automatizat doar salutul, nu apelul.
Demo-ul de clonare a vocii Soulja Boy a subliniat cum agenții conversaționali pot extinde dincolo de operațiunile interne în experiențe cu față spre brand. Credeți că agenții vocali ai întreprinderilor vor evolua în reprezentanți digitali cu față spre client care operează continuu pe canalele de vânzări, suport și marketing?
În mod absolut. Vedem o lume în care fiecare client are o relație personală cu afacerile sale favorite și esențiale. Ceea ce este important este că inteligența artificială nu este doar “divertisment”, ci capabilă să rezolve, într-adevăr, problemele complexe ale clienților.
Vocea în timp real introduce latență, halucinații și provocări de identitate care nu există în implementările de inteligență artificială bazate pe text. Care au fost cele mai grele constrângeri tehnice pe care le-ați întâlnit la construirea agenților care trebuie să răspundă în mai puțin de o secundă, menținând, în același timp, acuratețea conversațională?
Latența. Acolo este locul în care mor majoritatea demo-urilor.
Dacă un chatbot necesită trei secunde pentru a răspunde, utilizatorul așteaptă. Dacă un agent vocal se oprește în mod ciudat după ce ați terminat de vorbit, conversația este deja întreruptă. Răspunsurile trebuie să vină înapoi în mai puțin de 400 de milisecunde. Majoritatea platformelor nu pot ajunge acolo, deoarece sunt asamblate din multiple servicii terțe, fiecare adăugând propria întârziere.
Dar latența este doar o parte a problemei. Apelurile reale ale clienților sunt haotice în moduri pe care demo-urile nu le captează niciodată. Oamenii întrerup în mijlocul propoziției. Zgomotul de fond se instalează. Cei care sună schimbă limba. Cererile sunt vagi. Inteligența artificială vocală care funcționează în producție gestionează întreruperile fără a pierde contextul, se adaptează atunci când conversațiile ies de pe scenariu și face toate acestea fără a suna ca și cum ar fi în așteptare.
Clienții nu compară inteligența artificială vocală cu alte roboți. Ei o compară cu vorbirea cu o persoană. Acesta este standardul.
Există o examinare în creștere a modului în care sistemele de inteligență artificială care sună uman reprezintă ele însele în timpul interacțiunilor. Cum ar trebui să gândească întreprinderile despre transparență atunci când implementează agenți conversaționali care pot fi de neînțeles de la oameni?
Credem ferm în onestitate și transparență pentru utilizatorul final. Deși unele reglementări sunt birocratice și sufocante, orice formă de înșelăciune nu este acceptabilă. Lucrăm cu întreprinderile pentru a dezvolta experiențe fluente bazate pe încredere cu clientul.
Pe măsură ce agenții inteligenței artificiale încep să gestioneze milioane de interacțiuni cu clienții simultan, care sunt provocările operaționale care apar mai întâi atunci când companiile trec de la implementările pilot la implementări la scară de producție?
Câteva lucruri contează în practică. Primul este arhitectura modulară a prompturilor. Prompturile monolitice sunt aproape imposibil de depanat. Când un apel merge prost, trebuie să izolați exact unde și de ce s-a întâmplat, nu să vă uitați la un zid de instrucțiuni, încercând să determinați care linie a cauzat problema.
Observabilitatea completă contează la fel de mult. Rezumatele post-apel nu sunt suficiente. Aveți nevoie de vizibilitate în timp real asupra a ceea ce face agentul la fiecare punct al fiecărei interacțiuni.
Barajele sunt, de asemenea, esențiale, mai ales în industriile reglementate. Agentul trebuie să rămână în cadrul politicii. Acest lucru nu este opțional. Și dacă nu, trebuie să existe o revenire grațioasă.
În cele din urmă, există managementul cunoștințelor. Agentul are nevoie de acces la datele exclusive, cum ar fi produse, politici și proceduri. Platforma ar trebui, de asemenea, să aducă la suprafață lacunele de cunoștințe în mod automat, pe măsură ce apar în apelurile reale, și nu săptămâni mai târziu, după ce un client se plânge.
Privind înainte, credeți că agenții vocali ai întreprinderilor vor rămâne unelte specifice sarcinilor sau vor evolua în agenți de inteligență artificială generalizați, capabili să gestioneze în mod autonom fluxuri de lucru comerciale întregi inițiate prin conversație?
Dacă aș avea răspunsul! Cred că agenții vocali vor evolua pe tot stivul de afaceri, dar este puțin probabil să vezi o întreagă afacere condusă de un agent vocal. Acest lucru fiind spus, cred că oamenii vor putea obține servicii instantanee, precise și mai cuprinzătoare de la agenții inteligenței artificiale decât primesc astăzi. De fapt, credem că vor avea loc mai multe apeluri telefonice atunci când se va întâmpla acest lucru. Nu mai puține.
Mulțumim pentru acest interviu minunat; cititorii care doresc să afle mai multe despre subiect pot vizita Bland.












