Myslitelé

Když je poradcem bot. Konverzační AI bez poškozování lidí.

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Co nemůže udělat AI? Zeptáme se jí na rady, jak moudře utratit naše peníze, a ona nám řekne o dostupných daňově efektivních vozidlech. Zeptáme se jí na vztahy, a ona nabízí empatii tvarovanou podle rozpoznání vzorců. Zeptáme se jí, co dělat s naším životem ve 2 hodiny ráno, a ona nám dá odpověď… protože to je to, pro co je navržena.

Vznikající obava není selhání těchto nástrojů, ale jejich plynulost. Jsou tak uklidňujícím způsobem jisté, že to, co je navrženo pro naši podporu, může s dostatečnou jistotou a opakováním začít zkreslovat, jak přemýšlíme, cítíme a jednáme způsoby, které jsme nikdy neplánovali.

Záhlaví blikají červeně. OpenAI nedávno odhalila, že v každém týdnu stovky tisíc uživatelů ChatGPT mohou vykazovat známky závažných emočních poruch, včetně sebevražedných myšlenek. Zatímco odborníci na duševní zdraví varují před “jevem, kdy uživatelé vyvíjejí bludy nebo závislost prostřednictvím prodloužených, emočně náročných konverzací s chatboty. Státy v USA již omezují, jak lze boty používat v terapii.

Tyto příběhy nás znepokojují, protože zpochybňují základní předpoklad, že AI je pouze nástroj. Když se poradce stává důvěrníkem nebo se zdá jako přítel, co se stane s opravdovým lidským spojením?

Developers již nevytvářejí pouze zábavné funkce; vytvářejí interakce, které mohou ovlivnit, jak lidé cítí a myslí. Proto je důležité navrhnout konverzační AI, která poskytuje hodnotu bez ohrožování duševního zdraví uživatelů.

1.   Zúžte záměr

Nedávná studie Harvardské univerzity varuje, že konverzační boti mají tendenci souhlasit i tehdy, když uživatelé mají špatnou představu, protože tato podpora udržuje uživatele zapojené. Nicméně to také otevírá dveře “sycophantické” potvrzování. Pokud je chatbot navržen jako terapeut nebo důvěrník, měli byste odolat pokušení navrhnout jej tak, aby poskytoval takovou úroveň emoční potvrzování.

První krok je stanovení jasného záměru: přesně definovat, co má váš bot dělat a co by se mělo vyvarovat. Je to zákaznický podpůrný asistent, produktivní průvodce, kariérní kouč, finanční pomocník, konverzační společník, tvůrce receptů? Jasnost v této fázi stanoví hranice, které drží systém v mezích a brání mu v tom, aby se dostal do nežádoucího území.

Druh konverzace, jako jsou otevřené, osobní a neosobní, a modality jako hlas nebo text, ovlivňují emoční a problematické použití. Studie prokázala, že vysoká denní využitelnost je spojena s větší samotou a závislostí na AI.

Developers musí sami sebe zeptat: Jak udržet konverzace otevřené natolik, aby byly užitečné, ale uzavřené natolik, aby se vyvarovaly emočnímu zapletení? Například zákaznický podpůrný bot by mohl umožnit otevřené vysvětlení problému uživatele, ale vyvarovat se emočně validujícím frázím, jako je “To zní opravdu těžko, jsem zde pro vás…”.

Když je účel příliš široký, roste riziko neúmyslné emoční vazby nebo škodlivého překročení. Stanovením jasného záměru minimalizujete šanci, že lidé začnou považovat bot za terapeuta nebo duševního partnera.

2.   Ověřte znalostní základnu

Podle zprávy o halucinacích z roku 2025 některé LLM stále halucinují až 30% odpovědí. Ani top-modely nemohou zcela eliminovat riziko. Nejnižší míra halucinací mezi sledovanými AI modely byla kolem 3–5%.

Jakmile jste stanovili svůj účel, ujistěte se, že znalostní základna botu je založena na spolehlivých, odborně ověřených zdrojích. Pokud stavíte něco s cílem podpory duševního zdraví nebo emoční podpory, zapojte do kurátorství obsahu klinické odborníky, psychology nebo odborníky na danou problematiku.

Náš lékařský poradce, Dr. Miguel Villagra, řekl QuickBlox, že “když outsourcujeme příliš mnoho našeho rozhodování a emočního zpracování do AI, ztrácíme duševní sílu, která nám pomáhá realisticky testovat a korigovat.” Nedávno velké modely, jako je OpenAI, naznačují, že chatboty by měly zavádět úmyslné “přestávky” nebo malé konverzační pauzy, které uživatelům připomínají, aby se vrátili ke svému vlastnímu úsudku, místo aby systém nesl emoční zátěž.

Ještě více, tyto přestávky závisí na tom, zda bot ví, kdy přestat a kdy přesměrovat. Toto rozhodnutí závisí na pevné, ověřené znalostní základně, která je ukotvena ve faktech, nikoli v lichotkách. Mezery nebo nepřesnosti v databázi jsou nejlehčí a nejběžnější brány k halucinacím, kde AI sebevědomě poskytuje uživatelům zavádějící nebo nebezpečné rady.

Když je základní informace pečlivě kurátorovaná, pravidelně aktualizovaná a strukturovaná kolem ověřených zdrojů, je model mnohem méně pravděpodobný, že vynalezne odpovědi nebo emočně ozve cokoliv, co slyší. Místo toho je nucen čerpat z ukotveného materiálu, přesměrovat, když něco spadá mimo jeho doménu, a zpochybnit předpoklady.

3.   Integrujte bezpečnostní kontroly

Pouze 48 hodin po spuštění AI společníků se Grok stal nejlepší aplikací v Japonsku. Uživatelé mohou mluvit s těmito postavami pomocí hlasu, zatímco realistické avatary odrážejí výrazy a gesta. Je to level imerzivity, který je ohromující, ale také znepokojivě podobný.

Bezpečnostní kontroly jsou vaše zábrany. Měly by zahrnovat:

  • Připomínky reality: výzvy, které připomínají uživatelům, že mluví s AI, ne s člověkem.
  • Detekce krize: mechanismy pro identifikaci jazyka, který signalizuje závažné rozrušení, sebevražedné myšlenky nebo bludné ideje.
  • Protokoly eskalace: když je detekováno riziko, bot by měl uživatelům jemně naznačit, aby vyhledali lidskou pomoc, jako jsou profesionální zdroje, linky pomoci nebo poradit jim, aby se obrátili na důvěryhodné přátele.

Bez těchto kontrol riskují developery umožnit echo komory, které posilují škodlivé myšlení. Odborníci výslovně varovali, že souhlasnost AI může potvrdit nezdravé smyčky víry.

4.   Red-Team Dialogy

Po testování hlavních botů studie vedená výzkumníky ze Stanfordovy univerzity zjistila, že GPT-4o ukázala stigma ve 38% odpovědí a Meta Llama 3.1-405b to udělala 75% času. Pokud i top-modely z předních laboratoří stále ukazují měřitelné stigma, pak menší týmy budující doménově specifické boty jsou téměř jistě ohroženy skrytými bezpečnostními selháními.

Před spuštěním proveďte adversářské testování. Zapojte červený tým, který by mohl být interní nebo externí, s konkrétním úkolem testovat bot s rizikovými, emočně náročnými konverzacemi. Jejich jediným účelem je otestovat bot proti nejtěžším, nejšpinavějším lidským scénářům, aby se zabránilo skutečnému poškození uživatelů, až bude produkt živý.

Červené týmy mohou požádat boty, aby sehrály edge případy. Pro zákaznickou službu by to byl někdo v krizi, pro konverzační boty někdo osamělý nebo někdo s pokroucenými vírami. Ohodnoťte, jak bot reaguje. Zůstává ukotvený? Povzbuzuje realistiku místo iluze? Tato fáze pomáhá odhalit slepá místa, která vaše bezpečnostní kontroly nebo znalostní základna nemohou sama odhalit.

5.   Spusťte Canary Launch

Mezinárodní zpráva o bezpečnosti AI z roku 2025, publikovaná panelem 96 globálních odborníků, vyzývá k monitorování a intervenci jako kritickým pro snížení rizika při nasazování AI. Zpráva identifikuje systémová rizika, jako je ztráta kontroly, selhání spolehlivosti nebo předpojatosti, která jsou obtížně detekovatelná v kontrolovaném prostředí, ale mohou se objevit pouze tehdy, když modely interagují s reálnými uživateli.

Nasazení vašeho botu do malé, kontrolované skupiny nejprve, také známé jako “canary” publikum, pomáhá developerům monitorovat, jak uživatelé interagují. Odborníci by měli přezkoumat interakce, aby zhodnotili, zda uživatelé byli emocionálně připojeni.

Je důležité zapojit relevantní poradce, včetně psychologů, do této fáze, protože mohou hluboce pochopit, welche spouštěcí slova a fráze by mohly vést uživatele na rizikovou cestu.

Developers by měli shromáždit jak kvalitativní, tak kvantitativní zpětnou vazbu od kontrolní skupiny, jako je délka konverzace, posuny nálady, testování hranic, opakované emoční prozrazení, úroveň pohodlí uživatelů a jakékoli vzorce, které psychologové označují jako známky závislosti nebo rozrušení. Tento počáteční rollout je pro ověření předpokladů a rafinaci bezpečnostní architektury v úzce zaměřeném spuštění, spíše než v plném nasazení.

6.   Pokračující monitorování a iterace

V roce 2024 se odborníci z devíti zemí a Evropské unie sešli, aby diskutovali o mezinárodní spolupráci na bezpečnosti AI. Souhrnná zpráva zdůraznila potřebu škálovatelné, iterativní AI governance. Lídry naznačili, že je zapotřebí rámce pro testování v reálném světě, třetí strany pro hodnocení a pokračující zajištění bezpečnosti za hranicemi přednasazovacích kontrol.

Podle pokynů ze zprávy musí developery být bdělí a nepřetržitě monitorovat interakce uživatelů a sledovat bezpečnostní metriky, jako jsou spouštěče krize nebo opakované vysoce rizikové dialogy. Tyto mohou zahrnovat fráze nebo chování, které naznačují sebepoškozování, beznaděj, sebevražedné úmysly, extrémní osamělost nebo bludné víry.

V těchto případech musí developery aktualizovat znalostní základnu přidáním jasnějších pravidel odmítnutí a rafinací šablon reakce na krizi, opravou jakýchkoli faktických mezer, které bot zpracoval nesprávně. Měli by také zvažovat začlenění nových pokynů od psychologů nebo odborníků na danou problematiku, aby pomohli systému směrovat konverzace bezpečně příště, když se tyto spouštěče objeví. Pokud se objeví vzorce, jako je uživatelé, kteří se stále více spoléhají na bot pro emoční podporu, můžete potřebovat zpřísnit omezení nebo yeniden vyhodnotit svůj designový přístup.

Konverzační AI má transformační potenciál. Používá-li se uvážlivě, může rozšířit přístup, zvětšit empatii a snížit tření v koučování nebo základních poradenských službách. Jako někdo, kdo je hluboce investován do tohoto prostoru, moje sázka není na nahrazení lidí, ale na jejich doplnění; poskytování lidem více nástrojů, ne méně, a dělání toho zodpovědně.

Nate MacLeitch, zakladatel a generální ředitel QuickBlox, je vysoce zkušený obchodní profesionál s rozmanitým zázemím v odvětvích, jako jsou telekomunikace, média, software a technologie. Začal svou kariéru jako obchodní zástupce státu Kalifornie v Londýně a od té doby zastával klíčové vedoucí pozice, včetně ředitele prodeje ve společnosti WIN Plc (nyní Cisco) a provozního ředitele ve společnosti Twistbox Entertainment (nyní Digital Turbine). V současné době působí jako generální ředitel QuickBlox, vedoucí platformy pro komunikaci s umělou inteligencí. Kromě své pracovní zkušenosti je Nate aktivně zapojen jako poradce a investor do startupů, jako jsou Whisk.com, Firstday Healthcare a TechStars. Má tituly z UC Davis a London School of Economics and Political Science (LSE).