Modely a platformy AI
Jak je zpracování jazyka vylepšováno prostřednictvím Googleova open-source modelu BERT
Bidirectional Encoder Representations from Transformers, jinak známý jako BERT, je trénovací model, který dramaticky zlepšil efektivitu a účinnost modelů NLP. Nyní, když Google (GOOGL ) zpřístupnil modely BERT jako open-source, umožňuje to vylepšení modelů NLP napříč všemi odvětvími. V tomto článku se podíváme na to, jak BERT dělá z NLP jednu z nejvýkonnějších a nejužitečnějších řešení AI v dnešním světě.
Aplikace modelů BERT na vyhledávání
Googleův vyhledávač je světově proslulý svou schopností předkládat relevantní obsah a nyní zpřístupnil tento program pro zpracování přirozeného jazyka jako open-source celému světu.
Schopnost systému číst a interpretovat přirozený jazyk se stává stále více vitální, protože svět exponenciálně produkuje nové údaje. Googleova knihovna významů slov, frází a obecná schopnost předkládat relevantní obsah je open-source. Kromě zpracování přirozeného jazyka má model BERT schopnost extrahovat informace z velkých množství nestrukturovaných údajů a lze jej použít k vytvoření vyhledávacích rozhraní pro jakoukoli knihovnu. V tomto článku se podíváme, jak lze tuto technologii aplikovat v energetickém sektoru.
BERT (Bidirectional Encoder Representations from Transformers) je přístup k předtrénování navrženým týmem Google AI Language, který byl vyvinut za účelem překonání společného problému raných modelů NLP: nedostatku dostatečných trénovacích dat.
Podrobněji, bez přílišného detailu:
Trénování modelů
Nízkoúrovňové (například rozpoznávání názvů entit, segmentace témat) a vysoké úrovně (například analýza sentimentu, rozpoznávání řeči) úkoly NLP vyžadují úkolu-specifické anotované datové sady. Ačkoli jsou obtížně dostupné a drahé na sestavení, anotované datové sady hrají zásadní roli ve výkonu jak mělkých, tak hlubokých neuronových sítí. Vysokokvalitní výsledky inference mohly být dosaženy pouze tehdy, když byly k dispozici miliony nebo dokonce miliardy anotovaných trénovacích příkladů. A to byl problém, který činil mnoho úkolu NLP nedosažitelnými. To bylo do doby, než byl vyvinut BERT.
BERT je obecný model reprezentace jazyka, trénovaný na velkých korpusích nestrukturovaného textu. Když je model vystaven velkým množství textového obsahu, učí se pochopit kontext a vztahy mezi slovy ve větě. Na rozdíl od předchozích učících modelů, které reprezentovaly význam pouze na úrovni slov (banka by znamenala totéž v „bankovní účet“ a „travnatá banka“), BERT se skutečně stará o kontext. To znamená, co přichází před a po slovu ve větě. Kontext se ukázal jako významná chybějící schopnost modelů NLP, s přímým dopadem na výkon modelu. Navržení kontextu-aware modelu, jako je BERT, je mnoha považováno za začátek nové éry v NLP.
Trénování BERT na velkých množstvích textového obsahu je technika známá jako předtrénování. To znamená, že váhy modelu jsou upraveny pro obecné úkoly porozumění textu a že více jemné modely lze postavit na jeho základě. Autoři prokázali superioritu této techniky, když nasadili modely založené na BERT na 11 úkolech NLP a dosáhli špičkových výsledků.
Předtrénované modely
Nejlepší věc je: předtrénované modely BERT jsou open-source a veřejně dostupné. To znamená, že kdokoli může řešit úkoly NLP a budovat své modely na základě BERT. Nic nemůže být lepší, že? Počkejte: to také znamená, že modely NLP lze nyní trénovat (jemně upravit) na menších datech, bez potřeby trénovat od začátku. Začátek nové éry, skutečně.
Tyto předtrénované modely pomáhají společnostem snížit náklady a čas na nasazení modelů NLP pro interní nebo externí použití. Účinnost dobře trénovaných modelů NLP je zdůrazněna Michaelem Alexism, CEO virtuální společnosti pro budování firemní kultury, teambuilding.com.
“Největší výhodou NLP je škálovatelné a konzistentní inference a zpracování informací.” – Michael Alexis, CEO teambuilding.com
Michael uvádí, jak lze NLP aplikovat na programy pro budování firemní kultury, jako jsou icebreakery nebo průzkumy. Společnost může získat cenné informace o tom, jak firemní kultura funguje, analýzou odpovědí zaměstnanců. To je možné nejen analýzou textu, ale také anotací textu. Základní model se vlastně „čte mezi řádky“, aby odvodil inference o emocích, pocitech a celkovém pohledu. BERT může pomoci v situacích, jako je tato, předtrénováním modelů s základními indikátory, které mohou odhalit nuance jazyka a poskytnout přesnější informace.
Vylepšování dotazů
Schopnost modelovat kontext proměnila BERT v hrdinu NLP a revolucionalizovala samotný Google Search. Níže je citát z týmu Google Search a jejich zkušebních zkušeností, zatímco ladili BERT, aby porozuměl záměru za dotazem.
“Zde jsou einige příklady, které demonstrují schopnost BERT porozumět záměru za vaším dotazem. Zde je dotaz na „2019 brazilský cestující do USA potřebuje vízum.“ Slovo „do“ a jeho vztah k ostatním slovům v dotazu jsou zvláště důležité pro porozumění významu. Jde o brazilského cestujícího do USA a ne naopak. Předtím naše algoritmy nerozuměly důležitosti tohoto vztahu a vracely výsledky o občanech USA cestujících do Brazílie. S BERT je Search schopen pochopit tuto nuanci a vědět, že velmi běžné slovo „do“ vlastně hodně znamená, a můžeme poskytnout mnohem relevantnější výsledek pro tento dotaz.”
– Porozumění vyhledávání lépe než kdykoli předtím, od Pandu Nayaka, Google Fellow a Vice Prezidenta pro Search.

Příklad vyhledávání BERT, před a po. Zdroj blog
V našem posledním článku o NLP a OCR, jsme ilustrovali některé použití NLP v sektoru nemovitostí. Také jsme zmínili, jak „NLP nástroje jsou ideální pro extrakci informací“. Podívejme se na energetický sektor a uvidíme, jak disruptivní NLP technologie, jako je BERT, umožňují nové použití.
Modely NLP mohou extrahovat informace z velkých množství nestrukturovaných údajů
Jedním ze způsobů, jak lze modely NLP použít, je extrakce kritických informací z nestrukturovaných textových údajů. E-maily, deníky, poznámky, protokoly a zprávy jsou všechny příklady textových údajů, které jsou součástí denních operací firem. Některé z těchto dokumentů mohou být pro firmy kritické pro zvýšení provozní efektivity a snížení nákladů.
Při snaze o implementaci předpovědi údržby větrných turbín, zprávy o selhání mohou obsahovat kritické informace o chování různých komponent. Ale protože různé výrobci větrných turbín mají různé normy pro sběr dat (tj. zprávy o údržbě přicházejí v různých formátech a dokonce i jazycích), ruční identifikace relevantních datových položek by mohla rychle stát majitele elektrárny draho. NLP nástroje mohou extrahovat relevantní koncepty, atributy a události z nestrukturovaného obsahu. Textová analýza může být poté použita k nalezení korelací a vzorců v různých zdrojích dat. To dává majitelům elektráren možnost implementovat předpovědní údržbu na základě kvantitativních měření identifikovaných v jejich zprávách o selhání.
Modely NLP mohou poskytnout vyhledávací rozhraní přirozeného jazyka
Podobně, geovědci pracující pro ropné a plynárenské společnosti obvykle potřebují procházet mnoho dokumentů souvisejících s minulými těžebními operacemi, vrtnými protokoly a seismickými daty. Protože tyto dokumenty také přicházejí v různých formátech a jsou obvykle rozloženy na mnoha místech (jak fyzických, tak digitálních), tráví mnoho času hledáním informací na špatných místech. Řešením by mohlo být NLP poháněné vyhledávací rozhraní, které by umožnilo uživatelům vyhledávat data v přirozeném jazyce. Poté by model NLP mohl korelovat data napříč stovkami dokumentů a vrátit sadu odpovědí na dotaz. Pracovníci by mohli poté ověřit výstup na základě svých vlastních odborných znalostí a zpětná vazba by dále vylepšila model.
Existují však také technické úvahy pro nasazení takových modelů. Jedním z aspektů by bylo, že odborný žargon může zmást tradiční učící modely, které nemají odpovídající sémantické porozumění. Za druhé, výkon modelů může být ovlivněn velikostí trénovací datové sady. To je okamžik, kdy předtrénované modely, jako je BERT, mohou být prospěšné. Kontextové reprezentace mohou modelovat odpovídající význam slov a odstranit jakékoli zmatení způsobené odborným žargónem. Používáním předtrénovaných modelů je možné trénovat síť na menších datech. To šetří čas, energii a zdroje, které by jinak byly nezbytné pro trénování od začátku.
Co se týče vaší vlastní firmy?
Můžete si myslet, zda existují nějaké úkoly NLP, které by vám mohly pomoci snížit náklady a zvýšit provozní efektivitu?
Tým Blue Orange Digital pro datové vědy je rád, že může upravit BERT pro vaši výhodu také!










