Myslitelé
Použití OCR pro komplexní technické výkresy

Optické rozpoznávání znaků (OCR) revolucionalizovalo způsob, jakým podniky automatizují zpracování dokumentů. Nicméně, kvalita a přesnost této technologie nestačí pro každou aplikaci. Čím je dokument složitější, tím méně přesná je technologie. To platí zejména pro technické výkresy. AčkoliOCR technologie “out of the box” nemusí být vhodná pro tuto úlohu, existují jiné způsoby, jak dosáhnout cílů zpracování dokumentů pomocí OCR. V následujícím textu budou probrány několik možných řešení, aby vám poskytly obecnou představu bez přílišného technického detailu.
Výzvy rozpoznávání technických výkresů
Při technických výkresech OCR zápasí s porozuměním významu jednotlivých textových prvků. Technologie může číst text, ale nerozumí jeho významu. Existuje několik možností, které inženýři a výrobci mohou zvážit, pokud je automatické rozpoznávání technických dokumentů nakonfigurováno správně. Viz níže nejvýznamnější z nich.

Zdroj obrázku: Mobidev
Pro dosažení komplexní analýzy technické dokumentace je nutné vycvičit modely umělé inteligence. Stejně jako lidé, modely umělé inteligence potřebují zkušenosti a výcvik, aby rozuměly těmto výkresům.
Jedna z výzev rozpoznávání technických výkresů spočívá v tom, že software musí rozumět, jak oddělit různé pohledy na výkres. Tyto jsou různé části výkresu, které poskytují základní představu o jeho rozložení. Oddělením pohledů a porozuměním jejich vzájemným vztahům může software vypočítat ohraničující rámeček.
Tento proces může zahrnovat několik výzev:
- Pohledy mohou překrývat
- Pohledy mohou být poškozeny
- Štítky mohou být stejně vzdáleny od dvou pohledů
- Pohledy mohou být vnořeny
Vztah mezi pohledy je další možný problém. Musíte zvážit, zda je pohled rovinou součástí diagramu, otočenou součástí, blokem nebo něčím jiným. Kromě toho mohou existovat další problémy, jako jsou řetězové měření, chybějící anotace, implicitně definované výšky odkazem na standard nebo jiné problémy.
Důležité je, že obecné OCR nemůže spolehlivě rozumět textu ve výkresech, který je obklopen grafickými prvky, jako jsou linie, symboly a anotace. Z tohoto důvodu je nutné hlubší zkoumání OCR s využitím strojového učení, které bude pro tuto aplikaci užitečnější.
Předem vytvořené a přizpůsobené modely OCR
Na trhu existuje dostatek softwaru OCR, ale ne všechny tyto software lze trénovat nebo upravovat uživatelem. Jak jsme se dozvěděli, trénink může být nezbytný pro analýzu vašich technických výkresů. Nicméně, existují OCR nástroje pro tento typ výkresů.
Předem vytvořené nástroje OCR
Zde jsou einige běžné možnosti pro rozpoznávání technických výkresů pomocí OCR:
- ABBYY FineReader: tento všestranný software pro interpretaci výkresů nabízí technologii OCR s rozpoznávacími schopnostmi pro text. Podporuje různé formáty obrázků, uchování rozložení, export dat a integrace.
- Adobe Acrobat Pro: kromě toho, že poskytuje editaci, prohlížení a správu PDF, Acrobat umožňuje skenovat dokumenty OCR a výkresy, extrahovat text a provádět vyhledávání. Podporuje různé jazyky a umožňuje uživatelům konfigurovat možnosti.
- Bluebeam Revu: další populární aplikace PDF, Bluebeam Revu nabízí technologie OCR pro extrakci textu z technických výkresů.
- AutoCAD: což znamená Computer Aided Design, AutoCAD podporuje pluginy OCR pro interpretaci výkresů a převod je do editovatelných CAD prvků.
- PlanGrid: tento software zahrnuje interpretaci výkresů OCR přímo. S touto funkcí můžete nahrát obrázky výkresů a poté extrahovat, organizovat, indexovat a vyhledávat text.
- Textract: tato cloudová funkce AWS umožňuje analýzu dokumentů OCR a může extrahovat prvky, jako jsou tabulky z dokumentů. Může také rozpoznávat prvky z výkresů a poskytuje API pro integraci s jinými aplikacemi.
- Butler OCR: poskytující vývojářům rozhraní API pro extrakci dokumentů, Butler OCR kombinuje strojové učení s lidskou kontrolou pro zlepšení přesnosti rozpoznávání dokumentů.
Přizpůsobené řešení OCR
Pokud hledáte přizpůsobené řešení OCR, která lze trénovat pro lepší automatickou extrakci dat z technických výkresů a přizpůsobit je vašemu specifickému formátu dat, zde jsou einige populární možnosti:
- Tesseract: tento flexibilní, open-source OCR engine udržovaný společností Google lze trénovat na vlastních datech pro rozpoznávání specifických znaků a symbolů ve výkresech.
- OpenCV: Open-Source Computer Vision Library lze kombinovat s nástroji OCR, jako je Tesseract, pro vytvoření přizpůsobených interpretačních řešení. Jeho funkce pro zpracování a analýzu obrázků mohou zlepšit přesnost OCR na technických výkresech, pokud jsou správně využity.
Kromě těchto nástrojů je také možné nezávisle vyvinout přizpůsobené modely strojového učení. Používáním trénovacích modelů na označených datech, rámců, jako je TensorFlow nebo PyTorch, lze tato řešení upravit pro rozpoznávání specifických prvků výkresů a dosažení vyšší přesnosti pro potřeby organizace.
Předem vytvořené modely nabízejí pohodlí a snadné použití, ale nemusí být tak efektivní pro interpretaci technických výkresů jako přizpůsobená řešení. Tato přizpůsobená řešení také vyžadují další zdroje a odborné znalosti pro vývoj a údržbu.
Přizpůsobená řešení vyžadují další finanční zdroje a pracovní sílu pro vývoj. Doporučil bych začít s proof of concept (PoC) pro ověření technických možností a minimálně životaschopného produktu (MVP) pro kontrolu vnímání trhu projektu, než investovat příliš mnoho do přizpůsobeného řešení OCR.
Proces implementace modulu OCR pro čtení technických výkresů
Nejlepším místem pro zahájení budování softwaru OCR pro technické výkresy by bylo analyzovat dostupné open-source nástroje. Pokud vyčerpáte své open-source možnosti, můžete se obrátit na uzavřené zdroje s API integracemi.
Budování softwaru OCR od základu je nepraktické, protože vyžaduje obrovské množství dat pro trénink. To je obtížné a nákladné shromáždit a vyžaduje mnoho zdrojů pro trénink modelu. Ve většině případů by mělo stačit jemné doladění existujících modelů.
Proces od tohoto místa vypadá takto:
- Zvažte požadavky: musíte pochopit, s jakými technickými výkresy vaše aplikace musí pracovat a jaké funkce a funkcionality jsou potřebné pro dosažení tohoto cíle.
- Zachycení a předzpracování obrázků: přemýšlejte o tom, jaké zařízení plánujete použít pro zachycení obrázků. Další kroky předzpracování mohou být potřebné pro zlepšení kvality výsledků. To může zahrnovat ořezání, změnu velikosti, odstranění šumu a další.
- Integrace OCR: zvažte, který OCR engine bude nejlépe fungovat s vaší aplikací. OCR knihovny mají API, které umožňují vaší aplikaci extrahovat text z zachycených obrázků. Je důležité zvažovat open-source OCR řešení pro úsporu nákladů. Třetí strany API mohou být nestálé vzhledem k cenám nebo ztrátě podpory.
- Rozpoznávání a zpracování textu: dále je čas implementovat logiku pro zpracování a rozpoznávání textu. Některé možné úkoly, které můžete zvažovat v tomto kroku, jsou čištění textu, rozpoznávání jazyka nebo jiné techniky, které mohou poskytnout jasnější výsledky rozpoznávání textu.
- Uživatelské rozhraní a zkušenost: snadno použitelné uživatelské rozhraní pro aplikaci je důležité, aby uživatel mohl efektivně použít aplikaci pro zachycení obrázků a spuštění OCR. Výsledky by měly být prezentovány uživateli způsobem, který je snadno pochopitelný.
- Testování: důkladně otestujte aplikaci, aby byla zajištěna její přesnost a použitelnost. Uživatelův feedback je esenciální pro tento proces.
Závěr
Vzhledem k výzvám při vytváření softwaru OCR pro komplexní technické výkresy, organizace mají k dispozici několik možností, jak přistoupit k tomuto problému. Od předem vytvořených modelů a přizpůsobitelných nástrojů pro vytvoření více personalizovaných řešení, podniky mohou najít způsoby, jak účinně analyzovat, indexovat a vyhledávat v technických výkresech a dalších komplexních dokumentech. Stačí trochu vynalézavosti, kreativity a času, aby se vytvořilo řešení, které splňuje jejich potřeby.












