KI-Modelle und Plattformen

Ubers Fiber ist ein neues verteiltes Framework für die Ausbildung von KI-Modellen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Laut VentureBeat haben KI-Forscher bei Uber kürzlich eine Arbeit auf Arxiv veröffentlicht, in der sie eine neue Plattform vorstellen, die bei der Erstellung verteilter KI-Modelle helfen soll. Die Plattform heißt Fiber und kann für sowohl Verstärkungs-Lernalgorithmen als auch für populationenbasiertes Lernen verwendet werden. Fiber soll es Nicht-Experten ermöglichen, die Macht verteilter KI-Algorithmen und -Modelle zu nutzen, indem es große parallele Berechnungen zugänglicher macht.

Fiber wurde kürzlich auf GitHub als Open-Source-Software veröffentlicht und ist mit Python 3.6 oder höher kompatibel, wenn Kubernetes auf einem Linux-System in einer Cloud-Umgebung läuft. Laut dem Forschungsteam kann die Plattform leicht auf Hunderte oder Tausende von einzelnen Maschinen skaliert werden.

Das Forschungsteam von Uber erklärt, dass viele der jüngsten und relevantesten Fortschritte im Bereich der künstlichen Intelligenz durch größere Modelle und mehr Algorithmen getrieben wurden, die mit verteilten Trainingsmethoden trainiert wurden. Allerdings bleibt die Erstellung von populationenbasierten Modellen und Verstärkungsmodellen eine schwierige Aufgabe für verteilte Trainingsmethoden, da sie häufig Probleme mit Effizienz und Flexibilität haben. Fiber macht das verteilte System zuverlässiger und flexibler, indem es Cluster-Management-Software mit dynamischer Skalierung kombiniert und es Benutzern ermöglicht, ihre Aufträge von einer Maschine auf eine große Anzahl von Maschinen zu übertragen.

Fiber besteht aus drei verschiedenen Komponenten: einer API, einem Backend und einer Cluster-Schicht. Die API-Schicht ermöglicht es Benutzern, Elemente wie Warteschlangen, Manager und Prozesse zu erstellen. Die Backend-Schicht von Fiber ermöglicht es Benutzern, Aufträge zu erstellen und zu beenden, die von verschiedenen Clustern verwaltet werden, und die Cluster-Schicht verwaltet die einzelnen Cluster selbst sowie ihre Ressourcen, was die Anzahl der Elemente, die Fiber überwachen muss, erheblich reduziert.

Fiber ermöglicht es, Aufträge zu queuen und remote auf einer lokalen Maschine oder vielen verschiedenen Maschinen auszuführen, indem es das Konzept von job-basierten Prozessen verwendet. Fiber verwendet auch Container, um sicherzustellen, dass Elemente wie Eingabedaten und abhängige Pakete selbstständig sind. Das Fiber-Framework enthält auch eine integrierte Fehlerbehandlung, sodass ein Worker, wenn er abstürzt, schnell wiederhergestellt werden kann. Fiber kann all dies tun, während es mit Cluster-Managern interagiert, sodass Fiber-Apps wie normale Apps auf einem bestimmten Computer-Cluster laufen.

Experimentelle Ergebnisse zeigten, dass Fibers Reaktionszeit im Durchschnitt nur wenige Millisekunden betrug und dass es auch besser als Baseline-KI-Techniken skalierte, wenn es mit 2.048 Prozessor-Kernen/Workern aufgebaut wurde. Die Zeit, die zum Abschließen von Aufträgen benötigt wurde, verringerte sich allmählich, wenn die Anzahl der Worker erhöht wurde. IPyParallel benötigte etwa 1400 Sekunden, um 50 Iterationen des Trainings abzuschließen, während Fiber die gleichen 50 Iterationen des Trainings in etwa 50 Sekunden mit 512 verfügbaren Workern abschließen konnte.

Die Co-Autoren der Fiber-Arbeit erklären, dass Fiber in der Lage ist, mehrere Ziele zu erreichen, wie z.B. die dynamische Skalierung von Algorithmen und die Nutzung großer Mengen an Rechenleistung:

„[Unsere Arbeit zeigt], dass Fiber viele Ziele erreicht, wie z.B. die effiziente Nutzung einer großen Menge heterogener Rechenhardware, die dynamische Skalierung von Algorithmen zur Verbesserung der Ressourcennutzungseffizienz, die Verringerung der ingenieurtechnischen Belastung, die erforderlich ist, um [Verstärkungs-Lernalgorithmen] und populationenbasierte Algorithmen auf Computer-Clustern zu verwenden, und die schnelle Anpassung an verschiedene Rechenumgebungen zur Verbesserung der Forschungseffizienz. Wir erwarten, dass es weiterhin Fortschritte bei der Lösung schwieriger [Verstärkungs-Lernalgorithmen]-Probleme mit [Verstärkungs-Lernalgorithmen]-Algorithmen und populationenbasierten Methoden ermöglichen wird, indem es einfacher wird, diese Methoden zu entwickeln und sie in den erforderlichen Größenordnungen zu trainieren, um sie wirklich strahlen zu lassen.”

Blogger und Programmierer mit Spezialisierungen in Machine Learning und Deep Learning Themen. Daniel hofft, anderen zu helfen, die Macht von KI für das soziale Wohl zu nutzen.