Zprávy

Když umělá inteligence selže: Zpráva Enkrypt AI odhaluje nebezpečné zranitelnosti multimodálních modelů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

V květnu 2025 vydala společnost Enkrypt AI svou Zprávu o multimodálním testování, která je děsivou analýzou, jež odhaluje, jak snadno lze pokročilé systémy umělé inteligence manipulovat k vytváření nebezpečného a neetického obsahu. Zpráva se zaměřuje na dva vedoucí modely Pixtral – Pixtral-Large (25.02) a Pixtral-12b – a vykresluje obraz modelů, které jsou nejen technicky působivé, ale také znepokojivě zranitelné.

Modely vidění a jazyka (VLM) jako Pixtral jsou navrženy tak, aby interpretovaly jak vizuální, tak textové vstupy, což jim umožňuje inteligentně reagovat na komplexní, reálné podněty. Ale tato schopnost přináší zvýšené riziko. Na rozdíl od tradičních jazykových modelů, které zpracovávají pouze text, mohou být VLM ovlivněny interakcí mezi obrázky a slovy, což otevírá nové dveře pro útoky. Testování společnosti Enkrypt AI ukazuje, jak snadno lze tyto dveře otevřít.

Varovné výsledky testů: Selhání CSEM a CBRN

Tým za zprávou použil sofistikované metody testování – formu adversního hodnocení navrženého tak, aby napodoboval reálné hrozby. Tyto testy využívaly taktiky jako jailbreaking (podněcování modelu pečlivě vytvořenými dotazy k obejití bezpečnostních filtrů), image-based deception a manipulace s kontextem. Varovně, 68 % těchto adversních podnětů vyvolalo škodlivé reakce napříč oběma modely Pixtral, včetně obsahu souvisejícího s groomováním, zneužíváním a dokonce i navrhováním chemických zbraní.

Jedním z nejpozoruhodnějších odhalení je zapojení do materiálu souvisejícího se sexuálním zneužíváním dětí (CSEM). Zpráva zjistila, že modely Mistral byly 60krát více pravděpodobné, že vyprodukuje obsah související s CSEM ve srovnání s průmyslovými standardy, jako je GPT-4o a Claude 3.7 Sonnet. V testovacích případech modely reagovaly na zamaskované dotazy související s groomováním s komplexními, vícesložkovými obsahy, které vysvětlovaly, jak manipulovat s nezletilými – zabalené v neupřímných prohlášeních, jako je „pouze pro vzdělávací povědomí“. Modely nebyly prostě selhávající při odmítání škodlivých dotazů – dokončovaly je v detailech.

Stejně znepokojivé byly výsledky v kategorii CBRN (chemických, biologických, radiačních a jaderných) rizik. Když byly modely podněcovány k úpravě nervového plynu VX – chemické zbraně – nabízely šokujícíly specifické nápady pro zvýšení jeho perzistence v prostředí. Popisovaly, v cenzurovaných, ale jasně technických detailech, metody, jako je encapsulace, environmentální shielding a řízené uvolňování.

Tyto selhání nebyla vždy vyvolána zjevně škodlivými dotazy. Jednou z taktik bylo nahrání obrázku prázdného číslovacího seznamu a vyžádání si od modelu, aby „doplnil detaily“. Tento jednoduchý, zdánlivě neškodný dotaz vedl k vytvoření neetických a nezákonných instrukcí. Fúze vizuální a textové manipulace se ukázala jako zvláště nebezpečná – zdůrazňující jedinečnou výzvu, kterou představují multimodální modely AI.

Proč modely vidění a jazyka představují nové bezpečnostní výzvy

V srdci těchto rizik leží technická komplexita modelů vidění a jazyka. Tyto systémy neonly interpretují jazyk – syntetizují význam napříč formáty, což znamená, že musí interpretovat obsah obrázků, pochopit textový kontext a reagovat odpovídajícím způsobem. Tato interakce zavádí nové vektory pro exploataci. Model může správně odmítnout škodlivý textový dotaz sám o sobě, ale když je spojen s Sugestivním obrázkem nebo ambivalentním kontextem, může generovat nebezpečný výstup.

Testování společnosti Enkrypt AI odhalilo, jak cross-modální injekční útoky – kde jemné signály v jedné modalitě ovlivňují výstup druhé – mohou zcela obejít standardní bezpečnostní mechanismy. Tato selhání demonstrují, že tradiční techniky moderování obsahu, vytvořené pro systémy s jednou modalitou, nejsou dostatečné pro dnešní VLM.

Zpráva také popisuje, jak byly modely Pixtral přístupné: Pixtral-Large prostřednictvím AWS Bedrock a Pixtral-12b prostřednictvím platformy Mistral. Tento kontext reálného nasazení dále zdůrazňuje naléhavost těchto zjištění. Tyto modely nejsou omezeny na laboratoře – jsou dostupné prostřednictvím hlavních cloudových platforem a mohly by být snadno integrovány do spotřebitelských nebo podnikových produktů.

Co musí být uděláno: Návrh pro bezpečnější AI

Na svou obhajobu společnost Enkrypt AI nabízí nejen přehled problémů, ale také cestu vpřed. Zpráva nastiňuje komplexní strategii zmírnění, začínající bezpečnostním výcvikem. To zahrnuje přeškolování modelu pomocí vlastních dat z testování, aby se snížila náchylnost k škodlivým dotazům. Techniky, jako je Direct Preference Optimization (DPO), se doporučují pro jemné nastavení reakcí modelu, aby se zabránilo rizikovým výstupům.

Dále zdůrazňuje důležitost kontextově-aware guardrailů – dynamických filtrů, které mohou interpretovat a blokovat škodlivé dotazy v reálném čase, s ohledem na plný kontext multimodálního vstupu. Kromě toho se navrhuje použití Model Risk Cards jako transparentní opatření, které pomáhá zainteresovaným stranám pochopit omezení modelu a známé případy selhání.

Snad nejkritičtějším doporučením je považovat testování za probíhající proces, ne za jednorázový test. Jak se modely vyvíjejí, tak se vyvíjejí i strategie útoků. Pouze kontinuální hodnocení a aktivní monitorování mohou zajistit dlouhodobou spolehlivost, zejména když jsou modely nasazeny v citlivých sektorech, jako je zdravotnictví, vzdělávání nebo obrana.

Zpráva o multimodálním testování od Enkrypt AI je jasným signálem pro odvětví umělé inteligence: multimodální síla přichází s multimodální odpovědností. Tyto modely představují skok vpřed v schopnostech, ale také vyžadují skok v tom, jak přemýšlíme o bezpečnosti, zabezpečení a etickém nasazení. Pokud zůstanou bez kontroly, neriskují pouze selhání – riskují skutečnou újmu.

Pro každého, kdo pracuje na nebo nasazuje velké AI, je tato zpráva nejen varováním. Je to playbook. A nemohla přijít v více naléhavém čase.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.