Лідери думок

Використання OCR для складних інженерних креслень

mm
Додайте Unite.AI до бажаних джерел у Google

Оптичне розпізнавання символів (OCR) революціонізувало спосіб, у який компанії автоматизують обробку документів. Однак якість і точність цієї технології не завжди достатні для кожної програми. Чим складнішим є оброблюваний документ, тим менше точністю стає технологія. Це особливо справедливо для інженерних креслень. Хоча готові рішення OCR можуть не підходити для цієї задачі, існують інші способи досягнення цілей обробки документів за допомогою OCR. У тому, що слідує, я розгляну кілька життєздатних рішень, щоб дати вам загальне уявлення без занурення у надто технічні деталі.

Виклики розпізнавання інженерних креслень

При роботі з технічними кресленнями OCR стикається з труднощами у розумінні значення окремих текстових елементів. Технологія може прочитати текст, але не розуміє його значення. Існує ряд можливостей для інженерів і виробників, якщо автоматичне розпізнавання технічних документів налаштовано правильно. Дивіться найважливіші з них нижче.

Джерело зображення: Mobidev

Для досягнення складної технічної документації аналіз інженери повинні тренувати моделі штучного інтелекту. Як і люди, моделі штучного інтелекту потребують досвіду і тренувань, щоб зрозуміти ці креслення.

Одним з викликів розпізнавання креслень і інженерних креслень є те, що програмне забезпечення повинно розуміти, як розділити різні види креслення. Це різні частини креслення, які дають базове уявлення про його макет. Розділивши види і зрозумівши, як вони пов’язані один з одним, програмне забезпечення може розрахувати обмежувальну рамку.

Цей процес може включати кілька викликів:

  • Види можуть перекриватися
  • Види можуть бути пошкоджені
  • Мітки можуть бути рівновіддалені до двох видів
  • Види можуть бути вкладені

Відношення між видами є ще однією можливою проблемою. Ви повинні враховувати, чи є вид плоскою частиною діаграми, повернутою частиною, блоком чи чимось іншим. Крім того, можуть бути інші проблеми, такі як ланцюгові вимірювання, відсутні анотації, імпліцитно визначені висоти через посилання на стандарт, або інші проблеми.

Важливо, що загальне OCR не може надійно зрозуміти текст у кресленнях, оточених графічними елементами, такими як лінії, символи та анотації. Через цю обставину нам потрібно глибше зануритися у OCR з машинним навчанням, яке буде більш корисним для цієї програми.

Готові і настраївані моделі OCR

Нема нестачі програмного забезпечення OCR на ринку, але не все це програмне забезпечення можна налаштувати або змінити користувачем. Як ми дізналися, тренування може бути необхідним для аналізу інженерних креслень. Однак інструменти OCR для цих видів креслень існують.

Готові інструменти OCR

Ось кілька загальних варіантів для розпізнавання інженерних креслень:

  • ABBYY FineReader: це універсальне програмне забезпечення для інтерпретації креслень пропонує технологію OCR з можливостями розпізнавання тексту. Воно підтримує різні формати зображень, збереження макету, експорт даних і інтеграції.
  • Adobe Acrobat Pro: окрім надання можливостей редагування, перегляду та керування PDF, Acrobat дозволяє сканувати документи OCR і креслення, витягувати текст і виконувати пошук. Воно підтримує різні мови і дозволяє користувачам налаштовувати опції.
  • Bluebeam Revu: ще одна популярна програма для роботи з PDF, Bluebeam Revu пропонує технологію OCR для витягання тексту з інженерних креслень.
  • AutoCAD: що означає Комп’ютерна допомога у проектуванні, AutoCAD підтримує плагіни OCR для інтерпретації креслень і перетворення їх у редактируємі елементи CAD.
  • PlanGrid: це програмне забезпечення включає інтерпретацію креслень OCR з коробки. З цієї функції ви можете завантажити зображення креслень, а потім витягати, організовувати, індексувати і шукати текст.
  • Textract: ця хмарна функція AWS дозволяє виконувати аналіз документів OCR і витягувати елементи, такі як таблиці з документів. Вона також може розпізнавати елементи з креслень і пропонує API для інтеграції з іншими програмами.
  • Butler OCR: надаючи розробникам API для витягання документів, Butler OCR поєднує машинне навчання з перевіркою людини, щоб підвищити точність розпізнавання документів.

Настраївані рішення OCR

Якщо ви шукаєте настраївані рішення OCR, які можна тренувати для досягнення кращої автоматичної витягання даних з інженерних креслень і адаптувати до вашого конкретного формату даних, ось кілька популярних варіантів:

  • Tesseract: ця гнучка, відкрита OCR-рушина, підтримувана Google, може бути натренована на власних даних для розпізнавання символів і знаків, специфічних для креслень.
  • OpenCV: бібліотека відкритого комп’ютерного зору може бути поєднана з інструментами OCR, такими як Tesseract, для створення настраївних рішень. Її функції обробки і аналізу зображень можуть підвищити точність OCR на інженерних кресленнях при правильному використанні.

Окрім цих інструментів, також можливо розробити самостійно моделі машинного навчання. Використовуючи тренувальні моделі на позначених наборах даних, фреймворки, такі як TensorFlow або PyTorch, ці рішення можна налаштувати для розпізнавання конкретних елементів креслень і досягнення вищої точності для потреб організації.

Готові моделі пропонують зручність і легкість використання, але можуть не бути такими ефективними для інтерпретації інженерних креслень, як настраївні рішення. Ці настраївні рішення також потребують додаткових ресурсів і експертизи для розробки та підтримки.

Настраївні рішення потребують додаткових фінансових ресурсів і праці для розробки. Я б порадив почати з доказу концепції (PoC), щоб підтвердити технічні можливості і мінімально життєздатного продукту (MVP), щоб перевірити сприйняття ринку проєкту, перш ніж вкладати надто великі кошти у настраївне рішення OCR.

Процес реалізації модуля OCR для читання інженерних креслень

Найкраще місце для початку будівництва програмного забезпечення OCR для інженерних креслень було б аналіз доступних відкритих інструментів. Якщо ви вичерпали відкриті варіанти, вам може знадобитися звернутися до закритих рішень з інтеграцією API.

Будівництво рішення OCR з нуля є недоцільним, оскільки воно потребує величезного набору даних для тренування. Це складно і дорого отримати і потребує великих ресурсів для тренування моделі. У більшості випадків налаштування існуючих моделей повинно бути достатнім.

Процес далі виглядає так:

  1. Враховуйте вимоги: вам потрібно зрозуміти, з якими інженерними кресленнями повинна працювати ваша програма, і які функції та можливості необхідні для досягнення цієї мети.
  2. Збір зображень і попередня обробка: подумайте про те, які пристрої ви плануєте використовувати для збору зображень. Додаткові кроки попередньої обробки можуть бути необхідні для покращення якості результатів. Це може включати обрізання, зміну розміру, шумоподавлення та інше.
  3. Інтеграція OCR: розгляньте, який двигун OCR працюватиме найкраще з вашою програмою. Бібліотеки OCR мають API, які дозволяють вашій програмі витягувати текст з зображень. Важливо розглянути відкриті рішення OCR для економії коштів. Треті сторони API можуть бути непередбачуваними щодо ціни з часом або втратити підтримку.
  4. Розпізнавання і обробка тексту: далі, час реалізувати логіку для обробки і розпізнавання тексту. Деякі можливі завдання, які ви можете розглянути в цьому кроку, включають очистку тексту, розпізнавання мови або інші техніки, які можуть забезпечити чіткіше розпізнавання тексту.
  5. Інтерфейс користувача і досвід: легкий у використанні інтерфейс для програми важливий, щоб користувач міг ефективно використовувати його для збору зображень і ініціювання OCR. Результати повинні бути представлені користувачеві у вигляді, який легко зрозуміти.
  6. Тестування: ретельно протестуйте програму, щоб забезпечити її точність і зручність використання. Зворотний зв’язок користувача є важливим для цього процесу.

Підсумок

У face викликів створення програмного забезпечення OCR для складних інженерних креслень, організації мають ряд варіантів для підходу до цієї проблеми. Від ряду готових моделей і настраївних інструментів для створення більш персоналізованих рішень, компанії можуть знайти способи ефективно аналізувати, індексувати і шукати креслення та інші складні документи. Все, що потрібно, це трохи винахідливості, креативності і часу, щоб створити рішення, яке відповідає їхнім потребам.

Керівник команди штучного інтелекту в MobiDev, компанії з розробки програмного забезпечення, яка допомагає компаніям усьому світі інновувати з допомогою передових технологій, таких як штучний інтелект, наукові дані, доповнена реальність та Інтернет речей. Її професійний фокус - аналіз даних, прогнозування, NLP та чат-боти. Автор статей про штучний інтелект для AiiotTalk, Hackernoon, DevTo. Докладач на різних конференціях зі штучного інтелекту та технологічних дискусіях.