KI-Modelle und Plattformen

Google-Forscher entdecken das Problem der Unterspezifikation, das viele KI-Modelle behindert

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Ein Team von Forschern bei Google (GOOGL ) hat kürzlich eine häufige Ursache für das Scheitern von KI-Modellen identifiziert und auf das Problem der Unterspezifikation als einen der Hauptgründe hingewiesen, warum maschinelle Lernmodelle oft ganz anders in der realen Welt performen als während der Tests und der Entwicklung.

Maschinelle Lernmodelle scheitern oft, wenn sie in der realen Welt eingesetzt werden, auch wenn sie im Labor optimal performen. Es gibt viele Gründe, warum die Diskrepanz zwischen der Leistung während der Entwicklung und der realen Welt auftritt. Einer der häufigsten Gründe, warum KI-Modelle in der realen Welt scheitern, ist ein Konzept, das als Datenverschiebung bezeichnet wird. Datenverschiebung bezieht sich auf einen grundlegenden Unterschied zwischen den Daten, die zur Entwicklung eines maschinellen Lernmodells verwendet werden, und den Daten, die dem Modell während der Anwendung zugeführt werden. Als Beispiel werden Computer-Vision-Modelle, die auf hochwertigen Bildern trainiert werden, Schwierigkeiten haben, wenn sie mit Daten aus low-quality-Kameras gefüttert werden, die in der täglichen Umgebung des Modells verwendet werden.

Laut MIT Technology Review hat ein Team von 40 verschiedenen Forschern bei Google einen weiteren Grund identifiziert, warum die Leistung eines maschinellen Lernmodells so stark variieren kann. Das Problem ist die “Unterspezifikation”, ein statistisches Konzept, das Probleme beschreibt, bei denen beobachtete Phänomene viele mögliche Ursachen haben, von denen nicht alle vom Modell berücksichtigt werden. Laut dem Leiter der Studie, Alex D’Amour, tritt dieses Problem in vielen maschinellen Lernmodellen auf und sagt, dass es “überall passiert”.

Die typische Methode, ein maschinelles Lernmodell zu trainieren, besteht darin, dem Modell eine große Menge an Daten zu füttern, die es analysieren und relevante Muster extrahieren kann. Anschließend wird dem Modell eine Reihe von Beispielen präsentiert, die es noch nicht gesehen hat, und es wird aufgefordert, die Natur dieser Beispiele auf der Grundlage der Merkmale vorherzusagen, die es gelernt hat. Sobald das Modell eine bestimmte Genauigkeit erreicht hat, wird das Training in der Regel als abgeschlossen betrachtet.

Laut dem Google-Forschungsteam muss mehr getan werden, um sicherzustellen, dass die Modelle wirklich auf nicht-trainierte Daten verallgemeinert werden können. Die klassische Methode, maschinelle Lernmodelle zu trainieren, produziert verschiedene Modelle, die alle ihre Tests bestehen, aber diese Modelle unterscheiden sich in kleinen Aspekten, die unwichtig erscheinen, es aber nicht sind. Verschiedene Knoten in den Modellen haben unterschiedliche zufällige Werte, oder die Trainingsdaten können auf unterschiedliche Weise ausgewählt oder dargestellt werden. Diese Variationen sind klein und oft willkürlich, und wenn sie keinen großen Einfluss auf die Leistung des Modells während des Trainings haben, werden sie leicht übersehen. Wenn jedoch der Einfluss all dieser kleinen Änderungen kumuliert, können sie zu großen Variationen in der realen Welt führen.

Diese Unterspezifikation ist problematisch, weil sie bedeutet, dass, auch wenn der Trainingsprozess in der Lage ist, gute Modelle zu produzieren, er auch ein schlechtes Modell produzieren kann und der Unterschied nicht entdeckt wird, bis das Modell die Produktion verlässt und in Gebrauch genommen wird.

Um den Einfluss der Unterspezifikation zu bewerten, untersuchte das Forschungsteam eine Reihe von Modellen. Jedes Modell wurde mit dem gleichen Trainingsprozess trainiert, und dann wurden die Modelle einer Reihe von Tests unterzogen, um Unterschiede in der Leistung aufzuzeigen. In einem Fall wurden 50 verschiedene Versionen eines Bilderkennungssystems auf dem ImageNet-Datensatz trainiert. Die Modelle waren alle gleich, außer dass sie unterschiedliche neuronale Netzwerk-Werte hatten, die ihnen zu Beginn des Trainings zufällig zugewiesen wurden. Die Stress-Tests, die verwendet wurden, um Unterschiede in den Modellen aufzuzeigen, wurden mit ImageNet-C durchgeführt, einer Variante des ursprünglichen Datensatzes, der Bilder enthält, die durch Kontrast- oder Helligkeitsanpassung verändert wurden. Die Modelle wurden auch auf ObjectNet getestet, einer Reihe von Bildern, die alltägliche Objekte in ungewöhnlichen Orientierungen und Kontexten zeigen. Obwohl alle 50 Modelle auf dem Trainingsdatensatz etwa die gleiche Leistung hatten, variierte die Leistung stark, als die Modelle durch die Stress-Tests gelaufen wurden.

Das Forschungsteam fand ähnliche Ergebnisse, als es zwei verschiedene NLP-Systeme trainierte und testete, sowie als es verschiedene andere Computer-Vision-Modelle testete. In jedem Fall unterschieden sich die Modelle stark voneinander, obwohl der Trainingsprozess für alle Modelle der gleiche war.

Laut D’Amour müssen maschinelle Lern-Forscher und -Ingenieure viel mehr Stress-Tests durchführen, bevor sie Modelle in die freie Wildbahn entlassen. Dies kann schwierig sein, da Stress-Tests auf spezifische Aufgaben zugeschnitten werden müssen, die Daten aus der realen Welt verwenden, die für bestimmte Aufgaben und Kontexte schwer zu beschaffen sein können. Eine mögliche Lösung für das Problem der Unterspezifikation besteht darin, viele Modelle gleichzeitig zu produzieren und dann die Modelle auf eine Reihe von realen Aufgaben zu testen, um das Modell auszuwählen, das konsistent die besten Ergebnisse zeigt. Die Entwicklung von Modellen auf diese Weise erfordert viel Zeit und Ressourcen, aber der Trade-off könnte sich lohnen, insbesondere für KI-Modelle, die in medizinischen Kontexten oder anderen Bereichen eingesetzt werden, in denen Sicherheit im Vordergrund steht. Wie D’Amour via MIT Technology Review erklärte:

“Wir müssen besser darin werden, genau zu spezifizieren, was unsere Anforderungen an unsere Modelle sind. Denn oft passiert es, dass wir diese Anforderungen erst entdecken, nachdem das Modell in der realen Welt gescheitert ist.”

Blogger und Programmierer mit Spezialisierungen in Machine Learning und Deep Learning Themen. Daniel hofft, anderen zu helfen, die Macht von KI für das soziale Wohl zu nutzen.