Лидеры мнений

Использование OCR для сложных инженерных чертежей

mm
Добавьте Unite.AI в избранные источники в Google

Оптическое распознавание символов (OCR) революционизировало способ, которым бизнес автоматизирует обработку документов. Однако качество и точность технологии не подходят для каждого применения. Чем сложнее документ, тем менее точным становится технология. Это особенно верно для инженерных чертежей. Хотя готовые решения OCR могут не подходить для этой задачи, существуют другие способы достижения целей обработки документов с помощью OCR. В дальнейшем я рассмотрю несколько жизнеспособных решений, чтобы дать вам общее представление без слишком глубокого погружения в технические детали.

Проблемы распознавания инженерных чертежей

Когда речь идет о технических чертежах, OCR испытывает трудности с пониманием значения отдельных текстовых элементов. Технология может прочитать текст, но не понимает его смысл. Существует ряд возможностей для инженеров и производителей, если автоматическое распознавание технического документа настроено правильно. Ниже приведены наиболее значимые из них.

Источник изображения: Mobidev

Чтобы достичь сложного анализа технической документации, инженерам необходимо обучать модели ИИ. Как и люди, модели ИИ нуждаются в опыте и обучении, чтобы понять эти чертежи.

Одной из проблем распознавания чертежей и инженерных чертежей является то, что программное обеспечение должно уметь разделять различные виды чертежа. Это разные части чертежа, которые дают базовое представление о его расположении. Разделив виды и поняв, как они связаны между собой, программное обеспечение может рассчитать ограничивающую рамку.

Этот процесс может включать несколько проблем:

  • Виды могут перекрываться
  • Виды могут быть повреждены
  • Метки могут быть равноудалены от двух видов
  • Виды могут быть вложенными

Отношение между видами является еще одной возможной проблемой. Вы должны учитывать, является ли вид плоской частью диаграммы, повернутой частью, блоком или чем-то другим. Кроме того, могут быть другие проблемы, такие как цепные измерения, отсутствующие аннотации, неявно определенные высоты через ссылку на стандарт или другие проблемы.

Важно отметить, что общий OCR не может надежно понимать текст в чертежах, окруженный графическими элементами, такими как линии, символы и аннотации. Из-за этого нам необходимо глубже изучить OCR с машинным обучением, которое будет более полезным для этого применения.

Готовые и настраиваемые модели OCR

На рынке существует множество программного обеспечения OCR, но не все из них можно обучать или модифицировать пользователем. Как мы узнали, обучение может быть необходимым для анализа ваших инженерных чертежей. Однако существуют инструменты OCR для этих видов чертежей.

Готовые инструменты OCR

Ниже приведены общие варианты для распознавания OCR инженерных чертежей:

  • ABBYY FineReader: это универсальное программное обеспечение для интерпретации чертежей предлагает технологию OCR с возможностями распознавания текста. Оно поддерживает различные форматы изображений, сохранение макета, экспорт данных и интеграции.
  • Adobe Acrobat Pro: помимо предоставления редактирования, просмотра и управления PDF, Acrobat позволяет сканировать документы OCR и чертежи, извлекать текст и выполнять поиск. Оно поддерживает различные языки и позволяет пользователям настраивать параметры.
  • Bluebeam Revu: еще одно популярное приложение PDF, Bluebeam Revu предлагает технологию OCR для извлечения текста из инженерных чертежей.
  • AutoCAD: что означает Компьютерное проектирование, AutoCAD поддерживает плагины OCR для интерпретации чертежей и преобразования их в редактируемые элементы CAD.
  • PlanGrid: это программное обеспечение включает интерпретацию OCR чертежей по умолчанию. С помощью этой функции вы можете загрузить изображения чертежей и затем извлечь, организовать, проиндексировать и поискать текст.
  • Textract: эта облачная функция AWS позволяет выполнять анализ OCR документов и может извлекать элементы, такие как таблицы из документов. Оно также может распознавать элементы из чертежей и предоставляет API для интеграции с другими приложениями.
  • Butler OCR: предоставляя разработчикам API для извлечения документов, Butler OCR объединяет машинное обучение с человеческим обзором для повышения точности распознавания документов.

Настраиваемые решения OCR

Если вы ищете настраиваемые решения OCR, которые можно обучать для лучшего автоматического извлечения данных из инженерных чертежей и адаптировать к вашему конкретному формату данных, ниже приведены несколько популярных вариантов:

  • Tesseract: этот гибкий, открытый движок OCR, поддерживаемый Google, можно обучать на пользовательских данных для распознавания символов и знаков, специфичных для чертежей.
  • OpenCV: библиотека компьютерного зрения с открытым исходным кодом может быть объединена с инструментами OCR, такими как Tesseract, для создания настраиваемых интерпретативных решений. Его функции обработки и анализа изображений могут повысить точность OCR на инженерных чертежах при правильном использовании.

Помимо этих инструментов, также возможно независимо разработать настраиваемые модели машинного обучения. Используя обученные модели на помеченных наборах данных, такие решения можно тонко настроить для распознавания конкретных элементов чертежа и достижения более высокой точности для потребностей организации.

Готовые модели предлагают удобство и легкость использования, но могут не быть так эффективны для интерпретации инженерных чертежей, как настраиваемые решения. Эти настраиваемые решения также требуют дополнительных ресурсов и опыта для разработки и поддержки.

Настраиваемые решения требуют дополнительных финансовых ресурсов и труда для разработки. Я бы рекомендовал начать с доказательства концепции (PoC), чтобы проверить технические возможности и минимально жизнеспособный продукт (MVP), чтобы проверить восприятие проекта рынком, прежде чем вкладывать слишком много средств в настраиваемое решение OCR.

Процесс реализации модуля OCR для чтения инженерных чертежей

Лучшее место для начала создания программного обеспечения OCR для инженерных чертежей будет анализом доступных открытых инструментов. Если вы исчерпали открытые варианты, вам может потребоваться обратиться к закрытым вариантам с интеграциями API.

Создание решения OCR с нуля нецелесообразно, поскольку для этого требуется огромный набор данных для обучения. Это трудно и дорого собрать и требует многих ресурсов для обучения модели. В большинстве случаев настройка существующих моделей должна удовлетворять вашим потребностям.

Процесс отсюда выглядит следующим образом:

  1. Учитывайте требования: вам необходимо понять, с какими инженерными чертежами должна работать ваша приложение, и какие функции и возможности необходимы для достижения этой цели.
  2. Захват и предварительная обработка изображений: подумайте о том, какие устройства вы планируете использовать для захвата изображений. Дополнительные шаги предварительной обработки могут быть необходимы для повышения качества результатов. Это может включать обрезку, изменение размера, удаление шума и многое другое.
  3. Интеграция OCR: рассмотрите, какой движок OCR лучше всего работает с вашим приложением. Библиотеки OCR имеют API, которые позволяют вашему приложению извлекать текст из захваченных изображений. Важно учитывать открытые решения OCR для экономии средств. Третьи API могут быть непредсказуемыми в отношении цены со временем или потерять поддержку.
  4. Распознавание и обработка текста: далее, пришло время реализовать логику для обработки и распознавания текста. Некоторые возможные задачи, которые вы можете рассмотреть на этом шаге, включают очистку текста, распознавание языка или другие методы, которые могут обеспечить более четкое распознавание текста.
  5. Интерфейс и опыт пользователя: простой в использовании интерфейс для приложения важен, чтобы пользователь мог эффективно использовать его для захвата изображений и инициализации OCR. Результаты должны быть представлены пользователю в виде, который легко понять.
  6. Тестирование: тщательно протестируйте приложение, чтобы обеспечить его точность и удобство использования. Обратная связь пользователя важна для этого процесса.

Заключение

В условиях проблем создания программного обеспечения OCR для сложных инженерных чертежей у организаций есть ряд вариантов для решения этой проблемы. От ряда готовых моделей и настраиваемых инструментов для создания более персонализированных решений бизнес может найти способы эффективно анализировать, индексировать и искать чертежи и другие сложные документы. Все, что для этого нужно, – это немного изобретательности, креативности и времени, чтобы создать решение, которое соответствует их потребностям.

Руководитель команды ИИ в MobiDev, компании по разработке программного обеспечения, которая помогает компаниям по всему миру инновировать с помощью передовых технологий, таких как искусственный интеллект, наука о данных, дополненная реальность и Интернет вещей. Ее профессиональный фокус - анализ данных, прогнозирование, NLP и чат-боты. Автор статей об искусственном интеллекте для AiiotTalk, Hackernoon, DevTo. Докладчик на различных конференциях по ИИ и технологическим встречам.