Myslitelé

Povolení nasazení umělých inteligencí v reálném světě ve velkém měřítku

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Autor: Brad King, field CTO, Scality

Nástroje umělé inteligence a strojového učení a big data mají jeden společný rys – potřebují data a potřebují jich hodně. Obecná moudrost říká, že čím více, tím lépe. Analytici předpovídají, že globální tvorba dat poroste do roku 2025 na více než 180 zettabytů – a v roce 2020 dosáhla tvorba a replikace dat nového maxima 64,2 zettabytů.

Tato data jsou extrémně cenná – často nezaměnitelná a někdy představující jednorázové nebo einmalové události. Tato data je třeba uložit bezpečně a zabezpečit; a zatímco se odhaduje, že pouze malý procentní podíl nově vytvořených dat je uchováván, poptávka po úložné kapacitě dále roste. Skutečně, instalovaná základna úložné kapacity se má podle výzkumníků ze Statisty mezi lety 2020 a 2025 zvýšit o 19,2 %.

S větším množstvím vytvářených dat – zejména těmi, které vytvářejí AI/ML workloady – organizace potřebují více úložného prostoru, ale ne všechny úložné řešení mohou zvládnout tyto intenzivní a masivní workloady. Co je třeba, je nový přístup k úložnému prostoru. Podívejme se, jak organizace překonávají tyto výzvy prostřednictvím tří případových studií.

Cestovní průmysl

Zatímco mnozí z nás se teprve zvyknou na cestování opět po více než roce lockdownů, cestovní průmysl se snaží vrátit do předpandemických časů ve velkém stylu. A to činí důležitost dat – zejména relevantního použití těchto dat – ještě důležitější.

Představte si, co byste mohli udělat s vědomím, kam většina světových cestujících letos pojede, nebo kam pojedou zítra. Pro cestovní agenturu by to bylo obrovské.

Ale tyto cestovní organizace se potýkají s takovým množstvím dat, že procházet jimi a určit, co je významné, je ohromující perspektiva. Přibližně jeden petabyte dat je generován každý den a některá data jsou duplikována weby jako Kayak. Tato data jsou časově citlivá a cestovní společnosti potřebují rychle zjistit, která data jsou významná. Potřebují nástroj, který by jim umožnil efektivněji zvládnout tuto úroveň rozsahu.

Automobilový průmysl

Jiný příklad pochází z automobilového průmyslu, který je určitě jedním z nejdiskutovanějších případových studií. Průmysl již dlouho pracuje na pomocných nástrojích, jako jsou držitelé jízdních pruhů, zabránění srážkám a podobně. Všechny tyto senzory generují obrovská množství dat. A samozřejmě, vyvíjejí, testují a ověřují algoritmy pro samořiditelná vozidla.

Co průmysl potřebuje, je lepší způsob, jak dát smysl uloženým datům, aby je mohli použít k analýze incidentů, kdy něco šlo špatně, kurátorovat výstupy senzorů jako testovací případ, testovat algoritmy proti datům senzorů a podobně. Potřebují testování QA, aby se vyhnuli regresím, a potřebují dokumentovat případy, které selžou.

Digitální patologie

Jiný zajímavý případový study pro AI/ML, který se také potýká s přílivem dat a potřebou lépe využít data, je digitální patologie. Stejně jako v ostatních případech, co skutečně potřebují, je schopnost lépe využít těchto dat, aby mohli dělat věci, jako automaticky detekovat patologie v tkáňových vzorcích, provádět vzdálenou diagnostiku a podobně.

Ale úložný prostor dnes omezuje použití. Obrázky s užitečným rozlišením jsou příliš velké na to, aby je bylo možné uložit ekonomicky. Avšak rychlý objektový úložný prostor umožní nové schopnosti – jako jsou obrazové banky, které lze použít jako klíčový tréninkový zdroj, a použití prostorových křivek pro pojmenování a uložení multirezolucních obrázků v objektovém úložišti. Také ermögňují rozšiřitelné a flexibilní značkování metadat, což usnadňuje vyhledávání a pochopení této informace.

AI workloady vyžadují nový přístup

Jak jsme viděli v předchozích třech případech, je kritické být schopni agregovat a orchestrovat obrovská množství dat souvisejících s AI/ML workloady. Datové sady často dosahují rozsahu multi-petabytů, s požadavky na výkon, které by mohly nasátit celou infrastrukturu. Při zpracování tak velkých školicích a testovacích datových sad je překonání úložných uzlů (problémy s latencí a/nebo propustností) a kapacitních omezení/limitů klíčovými prvky pro úspěch.

AI/ML/DL workloady vyžadují úložnou architekturu, která může udržet data proudící skrze potrubí, s vynikajícím syrovým výkonem I/O a schopností škálovat kapacitu. Úložná infrastruktura musí držet krok s rostoucími požadavky napříč všemi fázemi AI/ML/DL potrubí. Řešením je úložná infrastruktura speciálně navržená pro rychlost a neomezenou škálovatelnost.

Extrahování hodnoty

Nedochází ani týden, aby nevyšly příběhy o potenciálu AI a ML změnit obchodní procesy a každodenní životy. Existuje mnoho případových studií, které jasně demonstrují výhody používání těchto technologií. Realita AI v podniku dnes je však jedna z enormně velkých datových sad a úložných řešení, která nemohou zvládnout tyto masivní workloady. Inovace v automobilech, zdravotnictví a mnoha dalších odvětvích nemohou pokračovat, dokud nebude vyřešen problém úložiště. Rychlý objektový úložný prostor překonává výzvu uchovávání velkých dat, aby organizace mohly extrahovat hodnotu z těchto dat a posouvat své podnikání kupředu.

Jako field CTO je Brad King zodpovědný za návrh největších systémů, které Scality nasazuje po celém světě. Tyto systémy zahrnují multi-petabyte, multi-site systémy s hundredy serverů. Brad je jedním ze spoluzakladatelů Scality. Začal svou mnohostrannou kariéru jako námořní architekt ve francouzském námořnictvu, kde prováděl numerické simulace převrhnutí lodí a vln kolem velkých lodí. Poté se připojil k výzkumnému centru Schlumberger v Paříži, kde pracoval několik let na turbulentní dynamice tekutin, laboratorní automatizaci, velkých paralelních numerických simulacích a nových internetových technologiích, včetně monitorování projektů NCSA (jako Mosaic) financovaných Schlumberger.