Vordenker

Mit OCR für komplexe technische Zeichnungen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Die optische Zeichenerkennung (OCR) hat die Art und Weise, wie Unternehmen Dokumente automatisieren, revolutioniert. Allerdings reicht die Qualität und Genauigkeit der Technologie nicht für jeden Anwendungsfall aus. Je komplexer das zu verarbeitende Dokument ist, desto weniger genau wird es. Dies gilt insbesondere für technische Zeichnungen. Obwohl OCR-Technologien aus der Box möglicherweise nicht für diese Aufgabe geeignet sind, gibt es andere Möglichkeiten, Dokumentverarbeitungsziele mit OCR zu erreichen. Im Folgenden werde ich mehrere gangbare Lösungen vorstellen, um Ihnen eine allgemeine Vorstellung ohne zu viele technische Details zu geben.

Herausforderungen der technischen Zeichenerkennung

Wenn es um technische Zeichnungen geht, hat die OCR Schwierigkeiten, die Bedeutung einzelner Textelemente zu verstehen. Die Technologie kann den Text lesen, aber sie versteht seine Bedeutung nicht. Es gibt eine Reihe von Möglichkeiten für Ingenieure und Hersteller, die automatische Erkennung von technischen Dokumenten zu berücksichtigen, wenn diese korrekt konfiguriert ist. Siehe die wichtigsten davon unten.

Bildquelle: Mobidev

Um komplexe technische Dokumentanalysen durchzuführen, müssen Ingenieure AI-Modelle trainieren. Genau wie Menschen benötigen AI-Modelle Erfahrung und Training, um diese Zeichnungen zu verstehen.

Eine Herausforderung bei der Erkennung von Blaupausen und technischen Zeichnungen ist, dass die Software verstehen muss, wie sie die verschiedenen Ansichten der Zeichnung trennen kann. Diese sind verschiedene Teile der Zeichnung, die eine grundlegende Vorstellung von ihrer Anordnung geben. Durch die Trennung der Ansichten und das Verständnis, wie sie zueinander in Beziehung stehen, kann die Software die Begrenzungsbox berechnen.

Dieser Prozess kann mehrere Herausforderungen beinhalten:

  • Ansichten können sich überlappen
  • Ansichten können beschädigt sein
  • Labels können gleich weit von zwei Ansichten entfernt sein
  • Ansichten können ineinander verschachtelt sein

Die Beziehung zwischen den Ansichten ist ein weiteres mögliches Problem. Sie müssen berücksichtigen, ob die Ansicht ein flacher Teil des Diagramms, ein gedrehter Teil, ein Block oder etwas anderes ist. Zusätzlich können andere Probleme wie verkettete Maße, fehlende Annotationen, implizit definierte Höhen durch Bezugnahme auf einen Standard oder andere Probleme auftreten.

Wichtig ist, dass generische OCR nicht zuverlässig Text in Zeichnungen verstehen kann, der von grafischen Elementen wie Linien, Symbolen und Annotationen umgeben ist. Aufgrund dieser Tatsache müssen wir tiefer in die OCR mit Machine Learning eintauchen, die für diese Anwendung hilfreicher sein wird.

Vorab trainierte und benutzerdefinierte OCR-Modelle

Es gibt keine Knappheit an OCR-Software auf dem Markt, aber nicht alle dieser Software kann vom Benutzer trainiert oder modifiziert werden. Wie wir gelernt haben, kann das Training eine Notwendigkeit für die Analyse Ihrer technischen Zeichnungen sein. Es gibt jedoch OCR-Tools für diese Arten von Zeichnungen.

Vorab trainierte OCR-Tools

Hier sind einige gängige Optionen für die OCR-Erkennung von technischen Zeichnungen:

  • ABBYY FineReader: diese vielseitige Blaupausen-Interpretations-Software bietet OCR-Technologie mit Erkennungsfähigkeiten für Text. Sie unterstützt verschiedene Bildformate, Layout-Erhaltung, Datenexport und Integrationen.
  • Adobe Acrobat Pro: zusätzlich zu PDF-Bearbeitung, -Anzeige und -Verwaltung ermöglicht Acrobat das Scannen von OCR-Dokumenten und Blaupausen, den Export von Text und die Durchführung von Suchvorgängen. Sie unterstützt verschiedene Sprachen und ermöglicht es Benutzern, Optionen zu konfigurieren.
  • Bluebeam Revu: eine weitere beliebte PDF-Anwendung, bietet Bluebeam Revu OCR-Technologien für die Textextraktion aus technischen Zeichnungen.
  • AutoCAD: steht für Computer Aided Design, AutoCAD unterstützt OCR-Plug-ins für die Interpretation von Blaupausen und die Umwandlung in bearbeitbare CAD-Elemente.
  • PlanGrid: diese Software enthält Blaupausen-OCR-Interpretationen aus der Box. Mit dieser Funktion können Sie Blaupausenbilder hochladen und dann Text extrahieren, organisieren, indizieren und durchsuchen.
  • Textract: diese cloudbasierte AWS-Funktion ermöglicht die OCR-Analyse von Dokumenten und kann Elemente wie Tabellen aus Dokumenten extrahieren. Sie kann auch Elemente aus Blaupausen erkennen und bietet APIs für die Integration mit anderen Anwendungen.
  • Butler OCR: bietet Entwicklern Dokumentextraktions-APIs, Butler OCR kombiniert Machine Learning mit menschlicher Überprüfung, um die Genauigkeit der Dokumentenerkennung zu verbessern.

Benutzerdefinierte OCR-Lösungen

Wenn Sie nach benutzerdefinierten OCR-Lösungen suchen, die trainiert werden können, um bessere automatische Datenextraktion aus technischen Zeichnungen zu erreichen und auf Ihr spezifisches Datenformat anzupassen, gibt es hier einige beliebte Optionen:

  • Tesseract: dieser flexible, Open-Source-OCR-Motor, der von Google gewartet wird, kann auf benutzerdefinierte Daten trainiert werden, um Blaupausen-spezifische Zeichen und Symbole zu erkennen.
  • OpenCV: Open-Source-Computer-Vision-Bibliothek kann mit OCR-Tools wie Tesseract kombiniert werden, um benutzerdefinierte interpretative Lösungen zu erstellen. Seine Bildverarbeitungs- und Analysefunktionen können die Genauigkeit der OCR auf technischen Zeichnungen verbessern, wenn sie ordnungsgemäß verwendet werden.

Abgesehen von diesen Tools ist es auch möglich, unabhängig benutzerdefinierte Machine-Learning-Modelle zu entwickeln. Durch die Verwendung von Trainingsmodellen auf markierten Datensätzen, Frameworks wie TensorFlow oder PyTorch, können diese Lösungen fein abgestimmt werden, um spezifische Blaupausen-Elemente zu erkennen und eine höhere Genauigkeit für die Bedürfnisse einer Organisation zu erreichen.

Vorab trainierte Modelle bieten Bequemlichkeit und einfache Handhabung, aber sie können möglicherweise nicht so effektiv sein, technische Zeichnungen zu interpretieren, wie benutzerdefinierte Lösungen. Diese benutzerdefinierten Lösungen erfordern auch zusätzliche Ressourcen und Fachwissen, um sie zu entwickeln und zu warten.

Benutzerdefinierte Lösungen erfordern zusätzliche finanzielle Ressourcen und Arbeitskraft, um sie zu entwickeln. Ich würde empfehlen, mit einem Proof-of-Concept (PoC) zu beginnen, um die technischen Fähigkeiten zu validieren und ein Minimum Viable Product (MVP), um die Wahrnehmung des Marktes für das Projekt zu überprüfen, bevor Sie zu viel in eine benutzerdefinierte OCR-Lösung investieren.

Der Prozess der Implementierung eines OCR-Moduls für das Lesen von technischen Zeichnungen

Der beste Ausgangspunkt für den Bau von OCR-Software für technische Zeichnungen wäre, verfügbare Open-Source-Tools zu analysieren. Wenn Sie Ihre Open-Source-Optionen ausgeschöpft haben, müssen Sie möglicherweise auf Closed-Source-Optionen mit API-Integrationen zurückgreifen.

Das Erstellen einer OCR-Lösung von Grund auf ist nicht praktikabel, da es ein riesiges Dataset für das Training erfordert. Dies ist schwierig und teuer zu sammeln und erfordert viele Ressourcen für die Modellierung. In den meisten Fällen sollte das Feinabstimmen bestehender Modelle Ihren Bedürfnissen genügen.

Der Prozess sieht von hier aus wie folgt aus:

  1. Anforderungen berücksichtigen: Sie müssen verstehen, mit welchen Arten von technischen Zeichnungen Ihre Anwendung arbeiten soll und welche Funktionen und Funktionalitäten erforderlich sind, um dieses Ziel zu erreichen.
  2. Bildaufnahme und Vorverarbeitung: denken Sie über die Geräte nach, die Sie zur Aufnahme der Bilder planen. Zusätzliche Vorverarbeitungsschritte können erforderlich sein, um die Qualität Ihrer Ergebnisse zu verbessern. Dazu gehören das Beschneiden, Umgrößen, Entstören und mehr.
  3. OCR-Integration: berücksichtigen Sie den OCR-Motor, der am besten mit Ihrer Anwendung funktioniert. OCR-Bibliotheken haben APIs, die es Ihrer Anwendung ermöglichen, Text aus aufgenommenen Bildern zu extrahieren. Es ist wichtig, Open-Source-OCR-Lösungen für Kosteneinsparungen zu berücksichtigen. Drittanbieter-APIs können in Bezug auf Preisgestaltung über die Zeit oder Verlust der Unterstützung launisch sein.
  4. Texterkennung und -verarbeitung: als nächstes ist es Zeit, Logik zu implementieren, um Text zu verarbeiten und zu erkennen. Einige mögliche Aufgaben, die Sie in diesem Schritt berücksichtigen können, sind Textbereinigung, Spracherkennung oder andere Techniken, die eine klarere Texterkennung ermöglichen können.
  5. Benutzeroberfläche und -erfahrung: eine benutzerfreundliche Benutzeroberfläche für die App ist wichtig, damit der Benutzer sie effektiv verwenden kann, um Bilder aufzunehmen und OCR zu starten. Die Ergebnisse sollten dem Benutzer auf eine Weise präsentiert werden, die leicht zu verstehen ist.
  6. Testen: testen Sie die Anwendung gründlich, um ihre Genauigkeit und Benutzerfreundlichkeit zu gewährleisten. Benutzerfeedback ist für diesen Prozess unerlässlich.

Fazit

Angesichts der Herausforderungen bei der Erstellung von OCR-Software für komplexe technische Zeichnungen haben Organisationen eine Reihe von Optionen, um das Problem anzugehen. Von vorab trainierten Modellen und anpassbaren Tools, um personalisierte Lösungen zu erstellen, können Unternehmen Wege finden, um Blaupausen und andere komplexe Dokumente effektiv zu analysieren, zu indizieren und zu durchsuchen. Alles, was es braucht, ist ein bisschen Erfindungsreichtum, Kreativität und Zeit, um eine Lösung zu erstellen, die ihren Bedürfnissen entspricht.

AI-Teamleiterin bei MobiDev, einem Softwareentwicklungsunternehmen, das Unternehmen auf der ganzen Welt hilft, mit bahnbrechenden Technologien wie künstlicher Intelligenz, Data Science, erweiterter Realität und dem Internet der Dinge zu innovieren. Ihr professioneller Schwerpunkt liegt auf Datenanalyse, Prognose, NLP und Chatbots. Autorin von Artikeln über künstliche Intelligenz für AiiotTalk, Hackernoon, DevTo. Sprecherin auf verschiedenen AI-Konferenzen und Tech-Talks.