MV Tools

Guía práctica de OCR

Cómo preparar documentos escaneados para un OCR más preciso

Una lista práctica para revisar imágenes y PDF escaneados, centrada en una precisión que puedas comprobar.

Equipo editorial de MV ToolsActualizado 8 min de lectura

Abrir OCR avanzado de imagen

Define primero la salida que necesitas

Para una imagen de la que necesitas texto, confianza por línea y JSON, usa OCR avanzado de imagen. Usa OCR de PDF si necesitas conservar un PDF que permita búsquedas, o PDF escaneado a Word si necesitas un borrador DOCX editable. Ninguna opción sustituye la revisión humana, sobre todo en nombres, importes, identificadores, textos legales y tablas.

Este recorrido usa OCR avanzado de imagen porque entrega TXT, JSON estructurado, número de líneas y confianza media. Así puedes saber qué se reconoció y por dónde empezar a revisar.

Muestra escaneada propia en español. Incluye párrafos, números, estados y líneas de tabla para revisar el OCR.
Muestra escaneada propia en español. Incluye párrafos, números, estados y líneas de tabla para revisar el OCR.

Prepara el escaneo para facilitar el reconocimiento

Empieza con la fuente más nítida disponible. Mantén la página recta, evita sombras y reflejos, recorta márgenes vacíos excesivos y conserva resolución suficiente para el texto pequeño. Un escaneo claro y frontal suele ser mejor que una foto grande pero borrosa.

La muestra conserva texto, números, estados y líneas de tabla para poder comparar cada parte después. No subas documentos de identidad, contratos o fotos privadas solo para probar una herramienta.

  • Prefiere el escaneo original a una captura de otra captura.
  • En fotos de móvil, aplana la página, usa luz uniforme y evita la perspectiva.
  • Si el archivo mezcla idiomas, elige el más cercano y revisa manualmente el otro.
  • Prueba primero una página difícil que represente bien el conjunto.

Sube la imagen y elige idioma y preprocesamiento

Abre OCR avanzado de imagen. Las capturas proceden de la interfaz de escritorio real; en una pantalla estrecha los controles se apilan, pero el orden no cambia.

  1. Elige una imagen.

    Selecciona mvtools-ocr-scan.png en el campo de imagen. Elegir el archivo no inicia el reconocimiento.

  2. Elige el idioma OCR más adecuado.

    La muestra usa español. El idioma cambia el modelo y la interpretación de caracteres; revisa con atención los fragmentos en otros idiomas.

  3. Activa el preprocesamiento si la captura lo necesita.

    Esta muestra lo mantiene activado. Puede ayudar con poco contraste, luz desigual o páginas fotografiadas, pero no recupera detalles perdidos.

Figura 1 · Confirma el nombre del archivo, elige el idioma más adecuado y decide si conviene preprocesar.
Figura 1 · Confirma el nombre del archivo, elige el idioma más adecuado y decide si conviene preprocesar.

Ejecuta OCR y lee el panel de resultados

Pulsa Ejecutar PaddleOCR y espera a que termine. No envíes la misma tarea varias veces. Al finalizar, comprueba estado, idioma, líneas y confianza antes de descargar TXT o JSON.

  1. Confirma que la tarea terminó.

    COMPLETED indica que se generaron archivos; no significa que todos los caracteres sean correctos.

  2. Usa la confianza como pista.

    Esta muestra alcanza el 99,7 %. Revisa primero texto pequeño con poco contraste, números, símbolos y bordes de tablas.

  3. Descarga los dos formatos.

    TXT sirve para leer y editar. JSON conserva confianza por línea, cajas y detalles estructurados para una revisión más profunda.

Figura 2 · Una ejecución real en español devolvió 18 líneas de una imagen de 102 KB con una confianza media del 99,7 %.
Figura 2 · Una ejecución real en español devolvió 18 líneas de una imagen de 102 KB con una confianza media del 99,7 %.

Compara el original con el texto y la estructura

Lee el TXT completo y después abre el JSON para revisar confidence, box y polygon de cada línea. Compara original y salida lado a lado, empezando por las zonas que más pueden afectar tu tarea.

La página muestra una vista previa de esta salida. No sustituye la revisión de los archivos completos; descarga el escaneo, el TXT y el JSON desde el ejemplo.

Figura 3 · La vista TXT sirve para una lectura rápida, pero hay que comparar números, símbolos y tablas con el original.
Figura 3 · La vista TXT sirve para una lectura rápida, pero hay que comparar números, símbolos y tablas con el original.
  • Texto: busca caracteres omitidos, repetidos o sustituidos y espacios extraños.
  • Números y símbolos: verifica identificadores, fechas, decimales, guiones y unidades.
  • Estructura: comprueba filas y columnas, orden de párrafos, sellos, firmas y escritura manual.
  • Objetivo: confirma que la salida sirve para editar, buscar o archivar; conserva el escaneo original.
Muestra escaneada propia en español. Incluye párrafos, números, estados y líneas de tabla para revisar el OCR.
Muestra escaneada propia en español. Incluye párrafos, números, estados y líneas de tabla para revisar el OCR.
Figura 3 · La vista TXT sirve para una lectura rápida, pero hay que comparar números, símbolos y tablas con el original.
Figura 3 · La vista TXT sirve para una lectura rápida, pero hay que comparar números, símbolos y tablas con el original.

Conoce los límites, la privacidad y el siguiente recurso

OCR avanzado de imagen acepta una imagen JPG, PNG, TIFF, BMP o WebP de hasta 25 MB y tiene un tiempo predeterminado de cinco minutos. OCR de PDF admite hasta 100 MB y 100 páginas; PDF escaneado a Word, hasta 100 MB y 50 páginas. Los PDF cifrados o dañados pueden fallar.

Las tareas suben los archivos al servidor y normalmente se conservan 30 minutos antes de limpiarse. Descarga pronto, no trates el enlace como almacenamiento permanente y sube solo archivos que tengas autorización para procesar.

SituaciónSiguiente acción
Fallan letras pequeñas, números o tablasMejora nitidez, orientación e iluminación y repite con una página representativa.
El PDF ya tiene texto seleccionableNormalmente no uses OCR; conserva la capa de texto para evitar nuevos errores.
Necesitas un PDF con búsquedasUsa OCR de PDF y comprueba que la capa de texto coincida con las páginas.
Necesitas un borrador editableUsa PDF escaneado a Word y revisa el DOCX párrafo por párrafo.

Preguntas frecuentes

¿Una confianza alta significa que el texto es correcto?

No. Ayuda a ordenar la revisión, pero no garantiza significado, nombres, números ni diseño.

¿Un PDF electrónico con texto seleccionable necesita OCR?

Normalmente no. OCR está pensado para escaneos y páginas de imagen; repetirlo puede introducir errores.

¿Por qué una tabla puede volver en otro orden?

OCR lee regiones visuales y no la estructura original. Comprueba las columnas y usa una herramienta de hojas de cálculo si necesitas una tabla real.