Etika

Výzkumníci z MIT vyvinuli model AI poháněný zvědavostí pro zlepšení testování bezpečnosti chatbotů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

V posledních letech se velké jazykové modely (LLM) a chatboty AI staly nesmírně rozšířenými, měnícími způsob, jakým interagujeme s technologií. Tyto sofistikované systémy mohou generovat lidsky podobné odpovědi, pomáhat s různými úkoly a poskytovat cenné informace.

Nicméně, jak tyto modely postupují, obavy týkající se jejich bezpečnosti a potenciálu pro generování škodlivého obsahu se dostaly do popředí. Pro zajištění odpovědného nasazení chatbotů AI jsou nezbytná důkladná testování a bezpečnostní opatření.

Omezení současných metod testování bezpečnosti chatbotů

V současné době je primární metodou pro testování bezpečnosti chatbotů AI proces zvaný red-teaming. To zahrnuje lidské testery, kteří vytvářejí podněty navržené k vyvolání nebezpečných nebo toxických odpovědí z chatbotu. Exponováním modelu širokému spektru potenciálně problematických vstupů se vývojáři snaží identifikovat a řešit jakékoli zranitelnosti nebo nežádoucí chování. Nicméně, tento lidsky řízený přístup má svá omezení.

Vzhledem k obrovskému počtu možných uživatelských vstupů je téměř nemožné, aby lidský tester pokryl všechny potenciální scénáře. I s rozsáhlým testováním mohou být mezery ve vstupních datech, které chatbot zanechávají zranitelným vůči generování nebezpečných odpovědí, když je konfrontován s novými nebo neočekávanými vstupy. Kromě toho je ruční povaha red-teamingu časově náročným a zdrojově náročným procesem, zejména když jazykové modely pokračují ve svém růstu a složitosti.

Pro řešení těchto omezení se výzkumníci obrátili na automatizaci a techniky strojového učení, aby vylepšili efektivitu a účinnost testování bezpečnosti chatbotů. Díky využití síly AI samé se snaží vyvinout komplexnější a škálovatelnější metody pro identifikaci a zmírnění potenciálních rizik spojených s velkými jazykovými modely.

Přístup strojového učení poháněný zvědavostí k red-teamingu

Výzkumníci z Improbable AI Lab na MIT a MIT-IBM Watson AI Lab vyvinuli inovativní přístup ke zlepšení procesu red-teamingu pomocí strojového učení. Jejich metoda zahrnuje trénování samostatného modelu red-teamingu na automatickou generaci různých vstupů, které mohou vyvolat širší spektrum nežádoucích odpovědí z testovaného chatbotu.

Klíč k tomuto přístupu spočívá v tom, že se modelu red-teamingu vdechne smysl pro zvědavost. Tím, že se model povzbuzuje k prozkoumání nových vstupů a zaměřuje se na generování vstupů, které vyvolávají toxické odpovědi, se výzkumníci snaží odhalit širší spektrum potenciálních zranitelností. Tento přístup poháněný zvědavostí je dosažen kombinací technik učení s posílením a modifikovaných signálů odměn.

Model poháněný zvědavostí zahrnuje bonus entropie, který povzbuzuje model red-teamingu k generování více náhodných a rozmanitých vstupů. Kromě toho jsou zavedeny odměny za novost, aby se model povzbudil k vytváření vstupů, které jsou semanticky a lexikálně odlišné od dříve vygenerovaných. Prioritizací novosti a rozmanitosti se model tlačí k prozkoumání neznámých území a odhalení skrytých rizik.

Pro zajištění toho, aby vygenerované vstupy zůstaly srozumitelné a přirozené, výzkumníci také zahrnuli bonus jazyka do trénovacího cíle. Tento bonus pomáhá zabránit tomu, aby model red-teamingu generoval nesmyslný nebo irelevantní text, který by mohl oklamat klasifikátor toxicity a přiřadit vysoké skóre.

Přístup poháněný zvědavostí prokázal pozoruhodný úspěch v překonání lidských testerů a ostatních automatizovaných metod. Generuje větší rozmanitost různých vstupů a vyvolává stále více toxických odpovědí z testovaných chatbotů. Značně tento přístup dokázal odhalit zranitelnosti v chatbotích, které prošly rozsáhlými lidsky navrženémi bezpečnostními opatřeními, čímž se prokázal jako efektivní v odhalení potenciálních rizik.

Dopady na budoucnost bezpečnosti AI

Vývoj přístupu red-teamingu poháněného zvědavostí představuje významný krok vpřed v zajištění bezpečnosti a spolehlivosti velkých jazykových modelů a chatbotů AI. Jak tyto modely pokračují ve svém vývoji a stávají se stále více integrovanými do našeho denního života, je zásadní mít robustní testovací metody, které mohou držet krok s jejich rychlým vývojem.

Přístup poháněný zvědavostí nabízí rychlejší a účinnější způsob, jak provádět kontrolu kvality na modelech AI. Automatizací generování rozmanitých a nových vstupů může tento přístup výrazně snížit čas a zdroje potřebné pro testování, zatímco současně zlepšuje pokrytí potenciálních zranitelností. Tato škálovatelnost je özellikle cenná v rychle se měnících prostředích, kde modely mohou vyžadovat časté aktualizace a re-testování.

Kromě toho přístup poháněný zvědavostí otevírá nové možnosti pro přizpůsobení procesu testování bezpečnosti. Například pomocí velkého jazykového modelu jako klasifikátoru toxicity by vývojáři mohli trénovat klasifikátor pomocí firemních dokumentů. To by umožnilo modelu red-teamingu testovat chatboty pro soulad s konkrétními firemními směrnicemi, zajišťující vyšší úroveň přizpůsobení a relevance.

Jak AI pokračuje ve svém pokroku, význam přístupu red-teamingu poháněného zvědavostí pro zajištění bezpečnějších systémů AI nelze přehlédnout. Proaktivním identifikováním a řešením potenciálních rizik tento přístup přispívá k vývoji více důvěryhodných a spolehlivých chatbotů AI, které lze s důvěrou nasadit v různých oblastech.

Alex vede AI‑poháněné zpravodajské operace společnosti Unite.AI, spojující žurnalistiku, výzkum a automatizaci, aby podpořil včasné a škálovatelné pokrytí umělé inteligence. Jeho práce pomáhá zajistit, aby se nové vývoje umělé inteligence rychle objevovaly, a to při zachování redakčních standardů publikace.