Modely a platformy AI
Uber’s Fiber Je Nový Distribuovaný Rámec Pro Školení Modelů Umělé Inteligence
Podle VentureBeat, výzkumníci z Uberu nedávno zveřejnili článek na Arxiv, ve kterém představují novou platformu určenou k usnadnění tvorby distribuovaných modelů umělé inteligence. Platforma se jmenuje Fiber a lze ji použít pro řízení úkolů učení s posilováním a populací. Fiber je navržen tak, aby umožnil přístup k velkým paralelním výpočtům i těm, kteří nejsou odborníky, a umožnil jim využít sílu distribuovaných algoritmů a modelů umělé inteligence.
Fiber byl nedávno zveřejněn jako open-source na GitHubu a je kompatibilní s Pythonem 3.6 nebo vyšším, s Kubernetes běžícím na Linuxovém systému a běžícím v cloudu. Podle týmu výzkumníků je platforma schopna snadno škálovat na stovky nebo tisíce jednotlivých strojů.
Tým výzkumníků z Uberu vysvětluje, že mnoho z nejnovějších a nejrelevantnějších pokroků v oblasti umělé inteligence bylo dosaženo díky větším modelům a více algoritmům, které jsou trénovány pomocí distribuovaných trénovacích technik. Nicméně, vytváření modelů založených na populaci a učení s posilováním zůstává obtížným úkolem pro distribuované trénovací schéma, protože často mají problémy s efektivitou a flexibilitou. Fiber činí distribuovaný systém spolehlivějším a flexibilnějším kombinací softwaru pro správu clusterů s dynamickým škálováním a umožňuje uživatelům přesunout své úkoly z jednoho stroje na velký počet strojů bezproblémově.
Fiber se skládá ze tří různých komponent: API, backendu a clusterové vrstvy. API vrstva umožňuje uživatelům vytvářet fronty, manažery a procesy. Backendová vrstva Fiberu umožňuje uživatelům vytvářet a ukončovat úkoly, které jsou spravovány různými clustery, a clusterová vrstva spravuje jednotlivé clustery a jejich zdroje, což značně snižuje počet položek, které Fiber musí sledovat.
Fiber umožňuje úkolům být zařazeným a spuštěným vzdáleně na jednom místním stroji nebo na mnoha různých strojích, využívaje konceptu procesů podporovaných úkoly. Fiber také využívá kontejnery, aby zajistil, že vstupní data a závislé balíčky jsou samohostené. Rámec Fiber také obsahuje vestavěné zpracování chyb, aby se v případě, že dojde k havárii pracovního procesu, mohl rychle obnovit. Fiber je schopen udělat vše toto, zatímco interaguje se správci clusterů, což umožňuje aplikacím Fiber běžet jako normální aplikace běžící na daném clusteru.
Experimentální výsledky ukázaly, že Fiberova doba odezvy byla v průměru několik milisekund a že také lépe škáloval než základní techniky umělé inteligence, když byl postaven s 2 048 procesorovými jádry/pracovníky. Doba potřebná k dokončení úkolů se postupně snižovala, jak se zvyšoval počet pracovních procesů. IPyParallel dokončil 50 iterací trénování za khoảng 1400 sekund, zatímco Fiber byl schopen dokončit stejné 50 iterace trénování za khoảng 50 sekund s 512 pracovníky.
Spoluautoři článku o Fiber vysvětlují, že Fiber je schopen dosáhnout mnoha cílů, jako je efektivní využití velkého množství heterogenního výpočetního hardwaru, dynamické škálování algoritmů pro zlepšení efektivity využití zdrojů, snížení inženýrského zatížení required k tomu, aby algoritmy učení s posilováním a založené na populaci fungovaly na clusteru, a rychlá adaptace na různé výpočetní prostředí pro zlepšení efektivity výzkumu.
„[Naše práce ukazuje], že Fiber dosahuje mnoha cílů, včetně efektivní利用 velkého množství heterogenního výpočetního hardwaru, dynamického škálování algoritmů pro zlepšení efektivity využití zdrojů, snížení inženýrského zatížení required k tomu, aby algoritmy učení s posilováním a založené na populaci fungovaly na clusteru, a rychlé adaptace na různé výpočetní prostředí pro zlepšení efektivity výzkumu. Očekáváme, že to dále umožní pokrok při řešení obtížných problémů učení s posilováním s algoritmy učení s posilováním a založenými na populaci tím, že usnadní vývoj těchto metod a jejich trénování ve škálách nezbytných k tomu, aby skutečně zazářily.”












