Tankeledare

Du kan inte provköra –testa ett varumärke som pratar med alla på olika sätt

mm
Lägg till Unite.AI bland dina föredragna källor på Google

För några dagar sedan hamnade jag i en ganska hetsig diskussion med min vän Faniprize. Hon är den person jag berättar färska arbetsberättelser för när jag känner av en större fråga i dem men ännu inte kan namnge den.

Den här gången handlade det om AI‑agenter. Inte om företag behöver dem, det har diskuterats tillräckligt. Jag var mer intresserad av vad som händer när ett företag implementerar en agent och den börjar utföra riktigt arbete, för det är där de mindre uppenbara problemen börjar.

Jag berättade för henne om ett nyligt projekt med en rekryteringsbyrå. En AI‑agent hanterade en del av kommunikationen med potentiella kunder. Ur ett marknadsföringsperspektiv såg det bra ut: den kände till produkten och målgruppen, tonen var rätt och samtalen kändes personliga snarare än mallbaserade.

Enskilda samtal verkade okej. Sedan placerade vi flera bredvid varandra.

I mycket liknande situationer hade agenten gjort något olika löften. Den gav en person en tidsplan för att återkomma och en annan person en annan. I några samtal sade den i princip ”vi kan vara flexibla här” när det gällde individuella villkor, även om företaget aldrig hade gett den friheten att gå med på dessa villkor.

Det fanns ingen dramatisk hallucination, vilket gjorde problemet svårare att upptäcka.

Agenten lät helt normal.

Marknadsföringsteam lägger naturligtvis mycket tid på ton och positionering. Ett rekryteringsföretag bör inte låta som en kryptostartup, och en bank bör inte kommunicera som ett modevarumärke. Men under hur ett varumärke talar finns ett annat lager: vad får agenten faktiskt lova på företagets vägnar?

Ett vackert skrivet meddelande hjälper inte mycket om kunden senare upptäcker att de villkor som diskuterades inte existerar. Då är det inte längre ett kommunikationsproblem. Det är ett rykteproblem.

Vi har lärt agenter att låta som företaget. Nu måste vi kontrollera om de beslutar som det.

Varför den vanliga granskningen missar detta

Den normala kontrollen är att läsa ett fåtal konversationer. Är produktinformationen korrekt? Följde agenten instruktionerna? Sa den något märkligt?

Men fem slumpmässiga konversationer kan alla se bra ut och ändå dölja en allvarlig inkonsekvens. Personalisering gör varje konversation annorlunda avsiktligt: en kund frågar direkt, en annan förklarar utförligt, någon förhandlar, någon fortsätter pressa. Exemplen är inte jämförbara.

I rekryteringsfallet såg inget fel ut förrän vi slutade fråga ”Var detta ett bra svar?” och började fråga ”Vilket beslut fattade agenten här?”

Vad jag började göra istället

Om riktiga samtal inte ger tydliga jämförelser skapar vi dem själva.

Jag tar en affärssituation och kör den genom agenten åtta till tio gånger. De viktiga fakta förblir desamma, men personen på andra sidan förändras: mjukare, mer direkt, redo att skriva under idag, nämner en konkurrent.

Sedan tittar jag på affärsbeslutet. Erbjöd agenten en rabatt endast till den person som pressade hårdare? Ändrades ett tidsåtagande eftersom omständigheterna var olika eller för att samtalet helt enkelt gled åt ett annat håll? Var det ens tillåtet att diskutera speciella villkor?

Jag skulle bli orolig om formuleringen förblev densamma. Det som bör förbli stabilt är företagets ståndpunkt, och om den förändras bör det finnas en affärsmässig anledning.

Det slutgiltiga omdömet måste komma från en människa. Modellen bör inte bedöma sitt eget arbete. Den som äger beslutet – grundaren, försäljningschef eller kommersiell direktör – måste säga om det var acceptabelt.

Vad jag faktiskt tittar på

Jag återkommer ständigt till fyra frågor.

Först, om de viktiga villkoren förblir desamma, förblir beslutet konsekvent? Det är exakt där rekryteringsfallet föll sönder.

För det andra, verkar agenten fortfarande inom företagets faktiska regler? Jag har en gång sett en mänsklig version av detta. En försäljningschef började erbjuda kunder en 20 % rabatt på egen hand. Företaget hade ingen standardrabatt på 20 %; sådana krävde ledningens godkännande. Han försökte inte skada verksamheten. Han ville sälja, och någonstans på vägen flyttade han gränsen för vad han trodde att han kunde besluta. Agenter gör samma sak.

Tredje, har ett förändrat beslut en genuin anledning bakom sig? Kontexten spelar roll, men att förstå den och bli övertalad till något är olika saker. Om den enda förändringen är att en kund var mer ihärdig, vill jag inte att agenten tyst blir mer generös.

Fjärde, vet agenten var dess befogenhet slutar? Ibland är det korrekta steget helt enkelt: Jag behöver kontrollera detta med en person. Det är ett fullt acceptabelt svar.

Testet avslöjar ibland företaget istället

Du tar med de tvivelaktiga besluten tillbaka till teamet, frågar vad agenten skulle ha gjort, och folk ger olika svar.

Försäljning har en syn. Marknadsföring har en annan. Grundaren säger: “Nåja, normalt gör vi inte så, men ibland gör vi det.” En chef minns tre undantag från förra året.

Allt detta hamnar i materialet vi ger agenten. Om företaget inte har kommit överens om logiken lär sig modellen av en rörig verklighet. Ibland skapade den inte motsägelsen.

Det gjorde bara det synligt.

Så AI-testning blir nästan av en slump en affärsrevision. Vem kan godkänna en rabatt? Vad kan en säljare lova utan att fråga? Vilka regler faktiskt är regler, och vilka bara är vanor? Och är ett undantag fortfarande ett undantag om folk gör det varje vecka?

Kanske behöver agenter utbildning på samma sätt som människor

Vi behandlar fortfarande AI-agenter som mjukvara: konfigurerar dem, ställer in prompten och låter dem arbeta. Ju mer ansvar vi ger dem, desto mindre meningsfullt känns det för mig.

Vi ger inte en ny försäljningschef en varumärkesbok på måndag och antar att de är redo för varje kund. Någon lyssnar på deras samtal, diskuterar svåra fall, rättar dem när de går för långt. Så lär de sig företagets logik.

Varför förvänta sig att en AI-agent ska lära sig det från en enda prompt? När den hanterar riktiga samtal tror jag att vi måste träna den genom fall och återkoppling, nästan som vi coachar människor.

Det förändrar vad varumärkeskonsekvens betyder för mig. En agent som pratar med tio personer på exakt samma sätt skulle vara en fruktansvärd agent. Den bör anpassa sig till personen, kulturen och situationen.

Det som inte bör förändras slumpmässigt är den underliggande logiken: vad företaget kommer att lova, vad det inte kommer att lova, och när någon måste stanna upp och fråga.

Om din agent i morgon hade tio något olika versioner av samma svåra samtal, skulle den fortfarande agera som samma företag?

Olga Belkovich, VD och medgrundare av U (in) AI, ett MarTech AI-labb som utvecklar empatiska AI-system som fångar experters beslutslogik och anpassar kommunikationen till olika personer och sammanhang. Med mer än 18 års erfarenhet av marknadsstrategi och digital transformation fokuserar hon på AI-implementering, digitala tvillingar och att bevara varumärkeskonsistens i automatiserad kommunikation.