Captura de texto
¿Cómo puede la captura de texto mejorar la eficacia de las personas, los equipos o la organización?
Contenido
Si desea ejecutar cualquier tipo de análisis basado en texto, claramente necesita texto para analizar.
El análisis de texto requiere un lenguaje legible por máquina. La mayoría de las organizaciones ya poseen grandes volúmenes de material relevante, pero los registros deben capturarse como datos en lugar de conservarse únicamente como imágenes de páginas.
Cuándo usarlo
Utilice la captura de texto cuando exista lenguaje valioso en papel, en escaneos, en audio o en sistemas que no exponen texto analizable. Se pueden volver a mecanografiar colecciones pequeñas, aunque la transcripción manual es lenta y costosa. Para colecciones más grandes, las tecnologías comunes incluyen:
- Reconocimiento óptico de caracteres (OCR)
- para caracteres impresos a máquina en diferentes fuentes y diseños.
- Reconocimiento inteligente de caracteres (ICR)
- para escritura a mano y campos impresos a mano, donde la variación dificulta el reconocimiento.
- Reconocimiento de códigos de barras
- para metadatos integrados en albaranes, solicitudes, formularios de membresía y documentos similares.
- Reconocimiento inteligente de documentos (IDR)
- para elementos basados en reglas como códigos postales, logotipos y palabras clave, a menudo combinado con el aprendizaje de ejemplos revisados.
Una vez capturados, Text Analytics y Sentiment Analysis pueden ayudar a interpretar lo que comunican los clientes, empleados, inversores y competidores.
Orígenes
La captura de texto evolucionó a través de varias tecnologías relacionadas en lugar de un modelo con nombre. La investigación sobre lectura óptica hizo que los caracteres impresos fueran legibles por máquina; Los sistemas de imágenes de documentos combinaron luego el escaneo con el reconocimiento y el flujo de trabajo. El reconocimiento de escritura a mano, los estándares de códigos de barras y el reconocimiento de voz ampliaron la gama de fuentes capturables. Las plataformas de captura modernas integran estos métodos con detección de diseño, puntuación de confianza y revisión humana.
Qué es
Escanear un documento produce una imagen digital, pero esa imagen no necesariamente está datada. Una persona puede leer la página en la pantalla mientras una ordenador todavía ve solo píxeles. OCR o transcripción convierte esos píxeles en caracteres codificados que se pueden buscar, copiar, clasificar y analizar. Una buena captura también conserva la procedencia, el orden de las páginas, el diseño y la información de confianza para que el texto extraído pueda compararse con su evidencia.
Por qué es importante
El lenguaje contiene señales que se extienden más allá de las palabras literales, incluidos temas, emociones, intenciones y relaciones. Las organizaciones ya poseen este material en contratos, correspondencia, interacciones de servicios y registros operativos. Hacer analizable el subconjunto adecuado puede descubrir las necesidades de los clientes, defectos de proceso y riesgos emergentes sin necesidad de encargar una fuente de datos completamente nueva.
El objetivo no es convertir todos los documentos. La captura genera costes, errores y obligaciones de gobernanza, por lo que el valor depende de la selección de material que pueda responder una pregunta que valga la pena.
Acceso con cuenta gratuita
Lee el contenido completo del recurso (artículo).
Crea tu cuenta gratuita de KeyModels para terminar esta artículo, guardarla en tu biblioteca y conservar el progreso de lectura en todos tus dispositivos.