Modely a platformy AI

Algoritmus TextFooler oklame NLP AI

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Jak působivé jsou algoritmy a systémy zpracování přirozeného jazyka v posledních letech, jsou stále zranitelné vůči určitému typu útoku, známému jako „adversní příklad“. Adversní příklady jsou pečlivě navržené fráze, které mohou způsobit, že systém zpracování přirozeného jazyka se chová neočekávaně a nežádoucím způsobem. Programy AI lze naprogramovat tak, aby se chovaly špatně pomocí těchto podivných příkladů, a jako výsledek, výzkumníci AI se snaží navrhnout způsoby, jak se bránit proti účinkům adversních příkladů.

Nedávno, tým výzkumníků z Univerzity v Hongkongu a Agentury pro vědu, technologie a výzkum v Singapuru spolupracoval na vytvoření algoritmu, který demonstruje nebezpečí adversních příkladů. Jak uvedl Wired, algoritmus byl nazván TextFooler výzkumným týmem a funguje tak, že jemně mění části věty, což ovlivňuje, jak klasifikátor NLP vykládá větu. Jako příklad, algoritmus převedl jednu větu na jinou podobnou větu a tato věta byla zavedena do klasifikátoru, který určoval, zda je recenze negativní nebo pozitivní. Původní věta byla:

“Postavy, obsazené do nemožných vynucených situací, jsou úplně odtržené od reality.”

Byla převedena na tuto větu:

“Postavy, obsazené do nemožných navržených okolností, jsou plně odtržené od reality.”

Tyto jemné změny vedly klasifikátor textu k tomu, aby klasifikoval recenzi jako pozitivní místo negativní. Výzkumný tým otestoval stejný přístup (nahrazování určitých slov synonymy) na několika různých datech a algoritmech klasifikace textu. Výzkumný tým uvádí, že byli schopni snížit přesnost klasifikace algoritmu na pouhých 10%, z 90%. To je navzdory skutečnosti, že lidé, kteří čtou tyto věty, je vykládají jako mající stejný význam.

Tyto výsledky jsou znepokojivé v éře, kdy se algoritmy NLP a AI používají stále častěji a pro důležité úkoly, jako je hodnocení zdravotních nároků nebo analýza právních dokumentů. Není známo, jak velké nebezpečí pro současné algoritmy představují adversní příklady. Výzkumné týmy po celém světě se stále snaží zjistit, jak velký dopad mohou mít. Nedávno zveřejněná zpráva skupiny Stanford Human-Centered AI naznačuje, že adversní příklady mohou být použity k oklamání algoritmů AI a spáchání daňových podvodů.

Existují určitá omezení nedávné studie. Například, Sameer Singh, asistent profesora počítačových věd na UC Irvine, uvádí, že metoda adversních příkladů použitá byla účinná, ale vyžaduje určitou znalost architektury AI. AI musí být opakovaně testována, dokud není nalezena účinná skupina slov, a takové opakované útoky mohou být zpozorovány bezpečnostními programy. Singh a jeho kolegové provedli vlastní výzkum na toto téma a zjistili, že pokročilé systémy, jako jsou algoritmy OpenAI, mohou produkovat rasistické a škodlivé texty, když jsou spuštěny s určitými spouštěcími frázemi.

Adversní příklady jsou také potenciálním problémem při zpracování vizuálních dat, jako jsou fotografie nebo videa. Jeden známý příklad zahrnuje aplikaci určitých jemných digitálních transformací na obrázku koťátka, což vede klasifikátor obrazu k tomu, aby jej vykládal jako monitor nebo stolní počítač. V jiném příkladu, výzkum provedený profesorkou Dawn Song z UC Berkeley ukázal, že adversní příklady mohou být použity k změně toho, jak jsou vnímány dopravní značky počítačovými systémy vidění, což by mohlo být nebezpečné pro autonomní vozidla.

Výzkum, jako je ten, který provedl tým z Hongkongu a Singapuru, může pomoci inženýrům AI lépe pochopit, jaké zranitelnosti mají algoritmy AI, a potenciálně navrhnout způsoby, jak se bránit proti těmto zranitelnostem. Jako příklad, klasifikátory ensemble lze použít ke snížení šance, že adversní příklad bude schopen oklamat počítačový systém vidění. S touto technikou se použije řada klasifikátorů a provedou se jemné transformace na vstupním obrázku. Většina klasifikátorů obvykle rozpozná aspekty skutečného obsahu obrázku, které jsou poté agregovány dohromady. Výsledek je takový, že i když beberapa klasifikátorů je oklámáno, většina z nich nebude a obrázek bude správně klasifikován. Adversní příklady jsou znovu použity a jemné transformace jsou provedeny na vstupním obrázku. Většina klasifikátorů obvykle rozpozná aspekty skutečného obsahu obrázku, které jsou poté agregovány dohromady. Výsledek je takový, že i když několik klasifikátorů je oklámáno, většina z nich nebude a obrázek bude správně klasifikován.

Blogger a programátor se specializací na Machine Learning a Deep Learning témata. Daniel doufá, že pomůže ostatním využít sílu AI pro sociální dobro.