KI-Modelle und Plattformen

TextFooler-Algorithmus täuscht NLP-KI

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

So beeindruckend die Algorithmen und Systeme der natürlichen Sprachverarbeitung in den letzten Jahren geworden sind, sie sind immer noch anfällig für eine Art von Ausnutzung, die als “adversarialer Beispiel” bekannt ist. Adversarial-Beispiele sind sorgfältig konstruierte Phrasen, die ein NLP-System dazu bringen können, auf unerwartete und unerwünschte Weise zu reagieren. AI-Programme können mit diesen seltsamen Beispielen dazu gebracht werden, Fehlverhalten zu zeigen, und als Ergebnis versuchen AI-Forscher, Wege zu entwerfen, um sich vor den Auswirkungen adversarialer Beispiele zu schützen.

Kürzlich haben ein Team von Forschern der Universität von Hongkong und der Agentur für Wissenschaft, Technologie und Forschung in Singapur zusammengearbeitet, um einen Algorithmus zu erstellen, der die Gefahr adversarialer Beispiele demonstriert. Wie Wired berichtete, wurde der Algorithmus von dem Forschungsteam TextFooler genannt und er funktioniert, indem er subtile Änderungen an Teilen eines Satzes vornimmt, was die Art und Weise beeinflusst, wie ein NLP-Klassifizierer den Satz interpretiert. Als Beispiel konvertierte der Algorithmus einen Satz in einen anderen ähnlichen Satz und der Satz wurde in einen Klassifizierer eingegeben, der darauf ausgelegt war, zu bestimmen, ob eine Bewertung negativ oder positiv war. Der ursprüngliche Satz war:

“Die Charaktere, die in unmöglich konstruierten Situationen sind, sind völlig von der Realität entfremdet.”

Es wurde in den folgenden Satz umgewandelt:

“Die Charaktere, die in unmöglich entwickelten Umständen sind, sind völlig von der Realität entfremdet.”

Diese subtilen Änderungen veranlassten den Textklassifizierer, die Bewertung als positiv zu klassifizieren, anstatt als negativ. Das Forschungsteam testete den gleichen Ansatz (Ersetzen bestimmter Wörter durch Synonyme) auf mehreren verschiedenen Datensätzen und Textklassifizierungs-Algorithmen. Das Forschungsteam berichtet, dass es in der Lage war, die Klassifizierungsgenauigkeit eines Algorithmus auf nur 10% zu reduzieren, von 90%. Dies trotz der Tatsache, dass Menschen, die diese Sätze lesen, sie als gleichbedeutend interpretieren würden.

Diese Ergebnisse sind besorgniserregend in einer Ära, in der NLP-Algorithmen und KI immer häufiger und für wichtige Aufgaben wie die Bewertung von medizinischen Ansprüchen oder die Analyse von Rechtsdokumenten eingesetzt werden. Es ist unbekannt, wie groß die Gefahr durch adversarialen Beispiele für derzeit verwendete Algorithmen ist. Forschungsteams auf der ganzen Welt versuchen immer noch, den Einfluss zu ermitteln, den sie haben können. Kürzlich veröffentlichte ein Bericht der Stanford Human-Centered AI-Gruppe, dass adversarialen Beispiele KI-Algorithmen täuschen und für Steuerbetrug eingesetzt werden könnten.

Es gibt einige Einschränkungen der jüngsten Studie. Zum Beispiel bemerkt Sameer Singh, ein Assistant Professor für Informatik an der UC Irvine, dass die verwendete adversarial-Methode effektiv war, aber sie erfordert einige Kenntnisse der KI-Architektur. Die KI muss wiederholt getestet werden, bis eine effektive Gruppe von Wörtern gefunden werden kann, und solche wiederholten Angriffe könnten von Sicherheitsprogrammen bemerkt werden. Singh und seine Kollegen haben ihre eigene Forschung auf diesem Gebiet durchgeführt und festgestellt, dass fortgeschrittene Systeme wie OpenAI-Algorithmen rassistische, schädliche Texte liefern können, wenn sie mit bestimmten Trigger-Phrasen konfrontiert werden.

Adversarial-Beispiele sind auch ein potenzielles Problem, wenn es um visuelle Daten wie Fotos oder Videos geht. Ein berühmtes Beispiel ist die Anwendung bestimmter subtiler digitaler Transformationen auf ein Bild eines Kätzchens, was den Bildklassifizierer dazu bringt, es als Monitor oder Desktop-PC zu interpretieren. In einem anderen Beispiel fand die Forschung von Dawn Song, Professorin an der UC Berkeley, heraus, dass adversarial-Beispiele verwendet werden können, um zu ändern, wie Verkehrszeichen von Computer-Vision-Systemen wahrgenommen werden, was potenziell gefährlich für autonome Fahrzeuge sein könnte.

Forschung wie die, die von dem Hongkong-Singapur-Team durchgeführt wurde, könnte KI-Ingenieuren helfen, die Art von Schwachstellen zu verstehen, die KI-Algorithmen haben, und möglicherweise Wege zu entwerfen, um sich vor diesen Schwachstellen zu schützen. Als Beispiel können Ensemble-Klassifizierer verwendet werden, um die Chance zu reduzieren, dass ein adversarial-Beispiel in der Lage ist, das Computer-Vision-System zu täuschen. Mit dieser Technik werden mehrere Klassifizierer verwendet und leichte Transformationen werden am Eingabebild vorgenommen. Die meisten Klassifizierer werden typischerweise Aspekte des wahren Inhalts des Bildes erkennen, die dann aggregiert werden. Das Ergebnis ist, dass selbst wenn einige der Klassifizierer getäuscht werden, die meisten von ihnen nicht getäuscht werden und das Bild ordnungsgemäß klassifiziert wird.

Blogger und Programmierer mit Spezialisierungen in Machine Learning und Deep Learning Themen. Daniel hofft, anderen zu helfen, die Macht von KI für das soziale Wohl zu nutzen.