Líderes de opinión

Uso de OCR para dibujos de ingeniería complejos

mm
Añade Unite.AI a tus fuentes preferidas en Google

El Reconocimiento Óptico de Caracteres (OCR) ha revolucionado la forma en que las empresas automatizan el procesamiento de documentos. Sin embargo, la calidad y precisión de la tecnología no son suficientes para todas las aplicaciones. Cuanto más complejo sea el documento que se está procesando, menos precisa se vuelve. Esto es especialmente cierto para los dibujos de ingeniería. Aunque las tecnologías OCR de serie no están diseñadas para esta tarea, existen otras formas de lograr sus objetivos de procesamiento de documentos con OCR. A continuación, exploraré varias soluciones viables para darle una idea general sin entrar en demasiados detalles técnicos.

Desafíos del reconocimiento de dibujos de ingeniería

Cuando se trata de dibujos técnicos, el OCR tiene dificultades para entender el significado de los elementos de texto individuales. La tecnología puede leer el texto, pero no entiende su significado. Hay varias oportunidades para que los ingenieros y fabricantes consideren si el reconocimiento automático del documento técnico está configurado correctamente. A continuación, se presentan las más significativas:

Fuente de la imagen: Mobidev

Para lograr un análisis de documentación técnica compleja, los ingenieros necesitan entrenar modelos de inteligencia artificial. Al igual que los humanos, los modelos de inteligencia artificial necesitan experiencia y entrenamiento para entender estos dibujos.

Uno de los desafíos del reconocimiento de planos y dibujos de ingeniería es que el software debe entender cómo separar las diferentes vistas del dibujo. Estas son diferentes partes del dibujo que dan una idea básica de su diseño. Al separar las vistas y entender cómo se relacionan entre sí, el software puede calcular el cuadro delimitador.

Este proceso puede incluir varios desafíos:

  • Las vistas pueden superponerse
  • Las vistas pueden estar dañadas
  • Las etiquetas pueden estar equidistantes de dos vistas
  • Las vistas pueden estar anidadas

La relación entre las vistas es otro posible problema. Debe considerar si la vista es una parte plana del diagrama, una parte girada, un bloque o algo más. Además, puede haber otros problemas como medidas en cadena, anotaciones faltantes, alturas definidas implícitamente a través de una referencia a un estándar, u otros problemas.
Es importante destacar que el OCR genérico no puede entender de manera confiable el texto en los dibujos que está rodeado de elementos gráficos como líneas, símbolos y anotaciones. Debido a este hecho, debemos profundizar en OCR con aprendizaje automático, que será más útil para esta aplicación.

Modelos OCR preentrenados y personalizados

No hay escasez de software OCR en el mercado, pero no todo este software puede ser entrenado o modificado por el usuario. Como hemos aprendido, el entrenamiento puede ser una necesidad para analizar sus dibujos de ingeniería. Sin embargo, existen herramientas OCR para este tipo de dibujos.

Herramientas OCR preentrenadas

A continuación, se presentan algunas opciones comunes para el reconocimiento OCR de dibujos de ingeniería:

  • ABBYY FineReader: este software de interpretación de planos versátil ofrece tecnología OCR con capacidades de reconocimiento de texto. Admite varios formatos de imagen, retención de diseño, exportación de datos e integraciones.
  • Adobe Acrobat Pro: además de ofrecer edición, visualización y administración de PDF, Acrobat permite escanear documentos OCR y planos, extraer texto y realizar búsquedas. Admite varios idiomas y permite a los usuarios configurar opciones.
  • Bluebeam Revu: otra aplicación de PDF popular, Bluebeam Revu ofrece tecnologías OCR para la extracción de texto de dibujos de ingeniería.
  • AutoCAD: que significa Diseño Asistido por Computadora, AutoCAD admite complementos OCR para interpretar planos y convertirlos en elementos CAD editables.
  • PlanGrid: este software incluye la interpretación OCR de planos de serie. Con esta función, puede cargar imágenes de planos y luego extraer, organizar, indexar y buscar el texto.
  • Textract: esta función en la nube de AWS permite el análisis OCR de documentos y puede extraer elementos como tablas de documentos. También puede reconocer elementos de planos y proporciona API para integrarse con otras aplicaciones.
  • Butler OCR: proporciona a los desarrolladores API de extracción de documentos, Butler OCR combina el aprendizaje automático con la revisión humana para mejorar la precisión del reconocimiento de documentos.

Soluciones OCR personalizadas

Si busca soluciones OCR personalizadas que puedan ser entrenadas para lograr una mejor extracción automática de datos de dibujos de ingeniería y adaptarse a su formato de datos específico, a continuación se presentan algunas opciones populares:

  • Tesseract: este motor OCR flexible y de código abierto, mantenido por Google, se puede entrenar con datos personalizados para reconocer caracteres y símbolos específicos de planos.
  • OpenCV: la Biblioteca de Visión por Computadora de Código Abierto se puede combinar con herramientas OCR como Tesseract para crear soluciones interpretativas personalizadas. Sus funciones de procesamiento y análisis de imágenes pueden mejorar la precisión del OCR en dibujos de ingeniería cuando se utilizan correctamente.

Además de estas herramientas, también es posible desarrollar modelos de aprendizaje automático personalizados de forma independiente. Al utilizar modelos de entrenamiento en conjuntos de datos etiquetados, marcos como TensorFlow o PyTorch, estas soluciones se pueden ajustar para reconocer elementos de planos específicos y lograr una mayor precisión para las necesidades de una organización.

Los modelos preentrenados ofrecen conveniencia y facilidad de uso, pero pueden no ser tan efectivos para interpretar dibujos de ingeniería como las soluciones personalizadas. Estas soluciones personalizadas también requieren recursos y experiencia adicionales para desarrollar y mantener.

Las soluciones personalizadas requieren recursos financieros y mano de obra adicionales para desarrollar. Recomiendo comenzar con un prueba de concepto (PoC) para validar las capacidades técnicas y un producto mínimo viable (MVP) para comprobar la percepción del mercado del proyecto antes de invertir demasiado en una solución OCR personalizada.

El proceso de implementación de un módulo OCR para leer dibujos de ingeniería

El mejor lugar para comenzar a construir software OCR para dibujos de ingeniería sería analizar las herramientas de código abierto disponibles. Si agota sus opciones de código abierto, es posible que deba recurrir a opciones de código cerrado con integraciones de API.

Construir una solución OCR desde cero es poco práctico porque requiere un conjunto de datos enorme para el entrenamiento. Esto es difícil y costoso de reunir y requiere muchos recursos para el entrenamiento del modelo. En la mayoría de los casos, ajustar los modelos existentes debe ser suficiente.

El proceso a partir de aquí se parece a lo siguiente:

  1. Considerar los requisitos: necesita entender qué tipo de dibujos de ingeniería su aplicación debe funcionar y qué características y funcionalidades son necesarias para lograr ese objetivo.
  2. Captura y preprocesamiento de imágenes: piense en qué dispositivos planea utilizar para capturar las imágenes. Es posible que se necesiten pasos de preprocesamiento adicionales para mejorar la calidad de los resultados. Esto puede incluir recorte, cambio de tamaño, desenfoque y más.
  3. Integración de OCR: considere el motor OCR que funcionará mejor con su aplicación. Las bibliotecas OCR tienen API que permiten a su aplicación extraer texto de imágenes capturadas. Es importante considerar soluciones OCR de código abierto para ahorrar costos. Las API de terceros pueden ser inestables en cuanto a precios con el tiempo o perder el soporte.
  4. Reconocimiento y procesamiento de texto: a continuación, es hora de implementar la lógica para procesar y reconocer texto. Algunas tareas posibles que puede considerar agregar en este paso son limpieza de texto, reconocimiento de idioma o cualquier otra técnica que pueda proporcionar resultados de reconocimiento de texto más claros.
  5. Interfaz de usuario y experiencia: una interfaz de usuario fácil de usar para la aplicación es importante para que el usuario pueda utilizarla de manera efectiva para capturar imágenes e iniciar el OCR. Los resultados deben presentarse al usuario de una manera que sea fácil de entender.
  6. Pruebas: pruebe a fondo la aplicación para garantizar su precisión y usabilidad. La retroalimentación del usuario es esencial en este proceso.

Conclusión

Ante los desafíos de crear software OCR para dibujos de ingeniería complejos, las organizaciones tienen varias opciones disponibles para abordar el problema. Desde una serie de modelos preentrenados y herramientas personalizables para crear soluciones más personalizadas, las empresas pueden encontrar formas de analizar, indexar y buscar a través de planos y otros documentos complejos de manera efectiva. Solo se necesita un poco de ingenio, creatividad y tiempo para crear una solución que se adapte a sus necesidades.

Líder del equipo de IA en MobiDev, una empresa de desarrollo de software que ayuda a las empresas de todo el mundo a innovar con tecnologías de vanguardia como la inteligencia artificial, la ciencia de datos, la realidad aumentada y el Internet de las cosas. Su enfoque profesional es el análisis de datos, la previsión, el NLP y los chatbots. Autora de artículos sobre inteligencia artificial para AiiotTalk, Hackernoon, DevTo. Ponente en diversas conferencias y charlas técnicas de IA.