Rozhovory

Isaiah N. Granet, spoluzakladatel a CEO společnosti Bland – Interview Series

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Isaiah N. Granet, spoluzakladatel a CEO společnosti Bland, je zakladatel startupu a inženýr, jehož pozadí spojuje technickou realizaci s časnými podnikatelskými zkušenostmi a dlouhodobou prací v oblasti sociálního dopadu. Předtím, než spustil svou současnou firmu, se zúčastnil programu Z Fellows a Y Combinator, získal zkušenosti s inženýrstvím v Lantern a založil San Diego Chill, neziskovou organizaci, která vybrala přes 2,5 milionu dolarů na pomoc dětem s vývojovými postižením přístupu ke sportu, získala národní uznání a pokračuje dodnes s jeho účastí na úrovni správní rady.

Bland se zaměřuje na budování infrastruktury pro telefonní hovory s umělou inteligencí, umožňující firmám nasadit hlasové agenty, které mohou zpracovat zákaznickou podporu, prodej a provozní pracovní postupy ve velkém měřítku. Platforma je navržena tak, aby nahradila nebo doplnila tradiční call centra nabídkou programovatelných hlasových interakcí, okamžité reakce a hlubokých integrací s podnikovými systémy, čímž se staví jako základní vrstva v tom, jak firmy automatizují komunikaci se zákazníky.

Založil jste San Diego Chill jako teenager, aby jste vytvořil inkluzivní přístup ke sportu pro děti s vývojovými postižením, dlouho předtím, než jste vstoupil do Y Combinator nebo spustil Bland. Jak vám tato raná zkušenost s budováním skutečné organizace ovlivnila přístup k založení hlasové AI společnosti, která nyní stojí mezi podniky a jejich zákazníky?

Velká část mého života a práce se zaměřila na budování. Již od mladého věku jsem měl neustálou touhu přivést věci k životu. Jakmile mi vyvstane v hlavě nějaká myšlenka nebo přesvědčení o světě, stává se pro mě nemožné ji ignorovat. Budování San Diego Chill mě nejen naučilo, jak vytvořit a řídit organizaci, ale také mě učil o dopadu, který naše akce mohou mít na ostatní. Mít možnost vrátit se vytvořením organizace, která by jinak neexistovala, je něco hluboce uspokojivého. Lekce a hodnoty, které jsem se naučil z Chill, mě doprovázejí každý den.

Po absolvování YC v roce 2023, co vás přesvědčilo, že podniková hlasová infrastruktura je stále fundamentálně rozbitá, aby ospravedlňovala budování koncového systému místo vrstvení LLM na stávající nástroje IVR?

Přemýšlejte o posledním případu, kdy jste použili bankovní chatbot. Pravděpodobně jste čekali déle, než byste měli, dostali jste odpověď, která nezodpověděla to, co jste skutečně požadovali, a nakonec jste zavolali. Poté vám robotický hlas provedl menu možností, které jste nechtěli, a stisknutí 0 nebylo k ničemu užitečné.

Banky investovaly miliardy do toho, aby tato zkušenost byla možná, a chatboty stále zaujímají poslední místo v zákaznické spokojenosti s 29 %. Nižší než e-mail. Nižší než call centra, o kterých si všichni již stěžují.

To je dynamika, která trvá už dvě desetiletí. Podniky se snaží držet zákazníky od svého personálu. Zákazníci se snaží dostat k člověku. Žádná strana nevyhrává.

Problém není v tom, že společnosti nechtějí to opravit. Ony to prostě nemohou zvládnout personálně. Call centrum, které zpracovává milion hovorů měsíčně, je drahá a obtížná operace, a kvalita je téměř definicí nekonzistentní.

Co se změnilo, je to, že umělá inteligence konečně umožňuje řešit hovory místo jejich pouze směrování nebo odklánění. Ne telefonní stromy. Ne hudba na čekání. Agent, který rozumí tomu, co zákazník požaduje, a zpracovává to.

Ale to funguje pouze tehdy, pokud je systém postaven pro reálný hlas od základu. Když vrstvíte LLM na stávající nástroje IVR nebo šijete dohromady třetí strany, dojde k prodlevě a spolehlivost klesá. Konverzace se rozpadají.

To je důvod, proč jsme se zaměřili na budování infrastruktury od začátku do konce. Hlas funguje pouze tehdy, pokud působí okamžitý a přirozený. Pokud to není, zákazník zavěsí.

Bland podnikl neobvyklý krok, když postavil a hostil svou vlastní TTS, inferenci a transkripci interně. Jaké kompromisy jste viděl při spoléhání se na třetí strany, které vás nakonec vedly k tomu, abyste vlastnili plnou vrstvu hlasové infrastruktury?

Každá vrstva, kterou outsourcujete, přidává prodlevu a riziko.

Většina platforem pro hlasovou AI jsou prodejci. Berou třetí stranu pro transkripci, přidávají třetí stranu modelu, směrují ji přes třetí stranu TTS a předávají vám výsledek. To může fungovat v kontrolovaném demo. Ve skutečnosti to zřídka funguje, když se objem hovorů zvýší nebo něco v řetězci jde špatně.

Existuje také problém s daty. Poskytovatelé základních modelů, jako je OpenAI, použili zákaznická data k výcviku modelů. Říkají, že podnikové licence jsou odlišné. Možná jsou. Ale tato nejistota je dostatečná, aby mnoho bezpečnostních a compliance týmů pocítilo nepohodlí.

Když self-hostujete celý stack — transkripci, inferenci, TTS, orchestraci — kontrolujete každý milisekund a každý update modelu. Zákaznická data zůstávají uvnitř zákaznického ekosystému. Nedotýkají se třetí strany pro výcvik, neprocházejí infrastrukturou, kterou nelze auditovat, a nepohybuje se, pokud zákazník nerozhodne jinak.

Můžete poskytnout každému podnikovému zákazníkovi dedikovanou infrastrukturu, aby se zvýšila výkonnost jiného podniku. A když něco selže, můžete to skutečně opravit, místo abyste čekali na dodavatele dodavatele.

Pro regulované odvětví některé zákazníky potřebují plnou vrstvu ve své vlastní VPC nebo na místě. To je možné pouze tehdy, pokud dodavatel skutečně vlastní to, co nasazuje.

Tradiční automatizace kontaktního centra se zaměřila silně na odklánění jednoduchých podpůrných hovorů. Proč jste se rozhodl prioritizovat dlouhý ocas, komplexní interakce zákazníků místo optimalizace pro objemovou automatizaci?

Tradiční automatizace kontaktního centra se většinou zaměřila na odklánění jednoduchých podpůrných hovorů. Proč jste prioritizoval komplexní, dlouhý ocas interakcí místo začátku s vysokovýkonnými případy?

Brali jsme opačný přístup. Pokud můžeme spolehlivě zpracovat nejkomplexnější a nejcitlivější hovory, všechno ostatní se stává přímočarým. Cílem není budovat demo, ale dodávat plnou agenticí řešení hovorů ve velkém měřítku. To vyžaduje nízkou prodlevu, vysoce spolehlivé systémy, které mohou zvládnout hrany případů, které skutečně definují skutečné zákaznické konverzace.

Vaši agenti jsou stále více integrováni do CRM a provozních databází, aby řešili hovory od začátku do konce. Jak se mění architektura podnikových pracovních postupů pomocí hlasové automatizace ve srovnání s chatbota?

Legacy systémy často nemluví spolu. CRM, nástroje pro plánování a fakturační platformy jsou izolované. Bez přístupu k těmto systémům může hlasový agent pouze odpovědět na obecné otázky a nic víc.

Nemůže vyhledat účet, aktualizovat záznam nebo rezervovat schůzku. Shromažďuje informace a předává je. Mezitím lidské zástupci tráví čas prací, která by neměla být dotčena člověkem: protokolování hovorů, manuální rezervace schůzek, tahání zpráv, aby se zjistilo, kdo potřebuje následné kroky.

Hluboká integrace je to, co umožňuje konečné řešení. Bez ní jste pouze automatizovali pozdrav, ne hovor.

Nedávná demonstrace hlasového klonu Soulja Boy ukázal, jak konverzační agenti mohou jít za hranice interních operací do značek orientovaných zkušeností. Vidíte, že podnikoví hlasoví agenti se budou vyvíjet do zákaznicky orientovaných digitálních zástupců, kteří budou fungovat kontinuálně napříč prodejními, podpůrnými a marketingovými kanály?

Určitě. Vidíme svět, ve kterém má každý zákazník osobní vztah se svými oblíbenými a nezbytnými podniky. Co je důležité, je to, že umělá inteligence není pouze “zábavná”, ale schopná skutečně řešit vaše nejsložitější problémy.

Reálný hlas představuje prodlevu, halucinaci a identifikační výzvy, které neexistují v textově založených nasazeních AI. Jaké byly nejobtížnější technické omezení, se kterými jste se setkali při budování agentů, kteří potřebují reagovat do jedné sekundy, zatímco udržují konverzační přesnost?

Prodleva. To je místo, kde většina demo umírá.

Jestliže chatbot potřebuje tři sekundy, aby odpověděl, uživatel čeká. Jestliže hlasový agent pauzuje nevhodně po tom, co jste dokončili mluvení, konverzace je již rozbitá. Odpovědi musí přijít zpět do 400 milisekund. Většina platforem nemůže dosáhnout toho, protože šijí dohromady několik třetích stran, každá přidává svou vlastní prodlevu.

Ale prodleva je pouze částí toho. Skutečné zákaznické hovory jsou špinavé způsoby, které demo nikdy nezachytí. Lidé přerušují uprostřed věty. Hluk na pozadí se dostává dovnitř. Volající mění jazyk. Žádosti jsou vágní. Hlasová AI, která vydrží ve výrobě, zvládne přerušení bez ztráty kontextu, přizpůsobí se, když konverzace jdou mimo scénář, a dělá to, aniž by znělo, jako by to bufferovalo.

Zákazníci nesrovnávají hlasovou AI s jinými boty. Srovnávají ji s mluvením s člověkem. To je laťka.

Existuje rostoucí kontrola nad tím, jak se lidsky znějící systémy AI představují během interakcí. Jak by podniky měly uvažovat o transparentnosti při nasazování konverzačních agentů, kteří mohou být nerozlišitelní od lidského personálu?

Pečlivě věříme v upřímnost a transparentnost pro konečného uživatele. I když je some regulace zatěžující a dusivá, žádná forma klamu není přijatelná. Pracujeme s podniky na vytvoření bezproblémových zkušeností, které jsou založeny na důvěře se zákazníkem.

Jakmile AI agenti začnou zpracovávat miliony současných zákaznických interakcí, jaké provozní výzvy se obvykle objevují jako první, když společnosti přecházejí z pilotních nasazení na výrobní nasazení?

Několik věcí má význam v praxi. První je modulární architektura promptů. Monolitické prompty jsou téměř nemožné k debugování. Když hovor jde špatně, musíte izolovat přesně, kde a proč se to stalo, ne zírat na zeď instrukcí, aby se zjistilo, která řádka způsobila problém.

Plná viditelnost má stejně velký význam. Shrnutí hovoru po hovoru nejsou dostatečná. Potřebujete reálnou viditelnost toho, co agent dělá v každém okamžiku každé interakce.

Strážní jsou také nezbytné, zejména v regulovaných odvětvích. Agent musí zůstat uvnitř politiky. To není volitelné. A pokud to neudělá, musí být jemný fallback.

Nakonec je zde znalostní management. Agent potřebuje přístup k proprietárním datům, jako jsou produkty, politiky a postupy. Platforma by také měla automaticky povrchové znalostní mezery, jakmile se objeví v reálných hovorech, ne týdny později, poté, co zákazník si stěžuje.

Pohledem do budoucna, věříte, že podnikoví hlasoví agenti zůstanou úkolem specifickými nástroji, nebo se vyvinou do obecných AI agentů schopných autonomně řídit celý obchodní proces iniciovaný konverzací?

Jestliže bych měl odpověď! Domnívám se, že hlasoví agenti se budou vyvíjet napříč celým obchodním stackem, ale je nepravděpodobné, že uvidíme celý podnik řízený hlasovým agentem. To být řečeno, věřím, že lidé budou moci získat okamžitou, přesnou a komplexnější službu od AI agentů, než dostanou dnes. Ve skutečnosti věříme, že více telefonních hovorů se bude odehrávat, když k tomu dojde. Ne méně.

Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se více dozvědět, by měli navštívit Bland.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.