MV Tools

Tutorial de extracción de tablas

Cómo extraer tablas de imágenes y PDF escaneados a Excel

Un flujo ilustrado para crear un borrador de hoja de cálculo verificable desde una tabla en imagen y revisar su estructura y valores.

Equipo editorial de MV ToolsActualizado 9 min de lectura

Abrir Imagen a Excel

Elige la herramienta según el archivo de origen

Usa Imagen de tabla a Excel para una captura, un escaneo o una foto con una tabla. Usa PDF de tabla a Excel si la tabla está en un PDF y quizá solo necesites ciertas páginas. Incluso un PDF con texto seleccionable puede guardar un orden interno distinto del diseño visible, por lo que también debes revisar el libro.

El tutorial presenta la misma tabla sencilla en PNG y PDF de solo imagen. Tiene un encabezado, cinco filas de datos y cuatro columnas; los totales conocidos son 751 para T1 y 787 para T2, útiles para comprobar el resultado.

La misma tabla propia se ofrece como PNG y PDF de solo imagen para comparar los dos flujos en igualdad de condiciones.
La misma tabla propia se ofrece como PNG y PDF de solo imagen para comparar los dos flujos en igualdad de condiciones.

Prepara una fuente fácil de reconocer

Prefiere el archivo exportado o escaneado original. Mantén la página recta, conserva resolución para el texto pequeño y recorta contenido ajeno o márgenes excesivos. En fotos, aplana la hoja y evita reflejos, sombras y perspectiva.

Escoge el idioma predominante. Las tablas sin bordes, celdas combinadas o multilínea, reglas tenues, escritura manual, símbolos monetarios e idiomas mezclados dificultan la reconstrucción de filas y columnas.

  • Usa una fuente nítida, no una captura de otra captura.
  • Haz visibles encabezados y límites de la cuadrícula.
  • Prueba primero la página difícil más representativa.
  • No subas información confidencial solo para probar el proceso.

Extrae el PNG con Imagen de tabla a Excel

Abre la herramienta y reproduce los ajustes de la captura. En pantallas estrechas los controles se apilan, pero mantienen el mismo orden.

  1. Selecciona el PNG localizado.

    Elige mvtools-table-sample.png; seleccionar el archivo no inicia la tarea.

  2. Ajusta idioma y preprocesamiento.

    Elige Español y deja activo el preprocesamiento en este ejemplo. Si empeora una imagen limpia, compáralo con una ejecución sin esa opción.

  3. Confirma que la primera fila es encabezado.

    Tarea, Región, T1 y T2 son nombres de columna. Desactiva la opción si la primera fila es un título o un registro.

  4. Ejecuta una vez y espera.

    Evita enviar repetidamente el mismo archivo mientras se procesa.

Figura 1 · Selecciona la imagen, ajusta el idioma de OCR y decide si convienen el preprocesamiento y el encabezado.
Figura 1 · Selecciona la imagen, ajusta el idioma de OCR y decide si convienen el preprocesamiento y el encabezado.

Interpreta el resultado de la imagen

La ejecución real detectó 6 filas, 4 columnas y 24 celdas desde un PNG de 47 KB, con un 100.0% de confianza media. Es el resultado de una muestra artificial muy nítida, no una previsión para recibos o informes densos.

Busca columnas desplazadas, filas omitidas y encabezados incorrectos. Descarga XLSX para revisar la hoja y JSON para inspeccionar la estructura y los detalles del reconocimiento.

  1. Comprueba las dimensiones.

    Esperamos 6 × 4; otra cifra indica que conviene revisar la fuente o los ajustes.

  2. Usa la confianza para priorizar.

    Revisa primero texto pequeño, puntuación, identificadores y zonas de poco contraste.

  3. Compara la vista previa.

    Debe conservar los cuatro encabezados y las cinco tareas en el orden original.

    Figura 3 · La vista previa de hasta 20 filas permite una primera comprobación de estructura antes de abrir XLSX o JSON.
    Figura 3 · La vista previa de hasta 20 filas permite una primera comprobación de estructura antes de abrir XLSX o JSON.
Figura 2 · La ejecución real terminó con una cuadrícula de 6 × 4 y 24 celdas.
Figura 2 · La ejecución real terminó con una cuadrícula de 6 × 4 y 24 celdas.

Extrae páginas concretas del PDF escaneado

El PDF contiene la misma tabla en una página compuesta solo por imagen. Selecciona Español, conserva preprocesamiento y encabezado e introduce 1. En un archivo largo, 1,3-5 limita el trabajo a esas páginas; el campo vacío procesa todas dentro del límite.

La herramienta crea una hoja por página procesada. Esta ejecución produjo 1 hoja y una confianza media del 100.0%; las tablas que continúan entre páginas deben unirse manualmente.

  1. Prueba primero páginas representativas.

    Incluye encabezados, cifras y el diseño más difícil del documento.

  2. Mantén el orden deseado.

    Escribe las páginas en el orden de procesamiento; las repetidas se ignoran.

  3. Verifica páginas y hojas.

    Una página procesada debe dar una hoja en este ejemplo.

    Figura 5 · La ejecución del PDF creó una hoja para su única página procesada.
    Figura 5 · La ejecución del PDF creó una hoja para su única página procesada.
Figura 4 · Elegimos expresamente la página 1; en documentos largos puedes combinar páginas y rangos.
Figura 4 · Elegimos expresamente la página 1; en documentos largos puedes combinar páginas y rangos.

Audita el libro completo

Abre el XLSX y compara celda por celda. Verifica que T1 sume 751 y T2 sume 787, además de fechas, separadores decimales y de miles, signos negativos, ceros iniciales, identificadores, vacíos y alineación.

El OCR entrega valores reconocidos, no la lógica original. Reconstruye fórmulas, tipos de datos, celdas combinadas y formato cuando haga falta, y conserva siempre la fuente para decisiones importantes.

ProblemaAcción recomendada
Sobra o falta una columnaRecorta interferencias, endereza o mejora las reglas y vuelve a probar una tabla.
Una cifra parece válida pero es incorrectaCompara totales y revisa carácter por carácter los valores importantes.
Celdas combinadas o multilínea se desplazanRestaura manualmente la estructura en el libro.
La tabla continúa en otra páginaRevisa cada hoja antes de consolidarlas.

Límites y archivos temporales

Imagen de tabla a Excel admite un JPG, PNG, TIFF, BMP o WebP de hasta 25 MB y tiene un tiempo límite predeterminado de cinco minutos. PDF de tabla a Excel admite un PDF de hasta 100 MB y 50 páginas, rechaza archivos cifrados o protegidos y tiene un límite de diez minutos. Ambas herramientas admiten inglés, chino simplificado, japonés, alemán, francés, español y portugués.

Las herramientas suben temporalmente fuente y resultados al servidor, que normalmente los elimina tras 30 minutos. Descarga XLSX y JSON a tiempo y conserva el original. Los ejemplos de esta guía son archivos públicos propios, no tareas de usuarios retenidas.

Preguntas frecuentes

¿Una confianza media alta garantiza que todas las celdas sean correctas?

No. Ayuda a priorizar la revisión, pero cifras, identificadores, totales y estructura deben compararse con la fuente.

¿Debo marcar la primera fila como encabezado?

Solo si contiene nombres reales de columna; no si es el título del informe o el primer registro.

¿Puedo procesar solo algunas páginas del PDF?

Sí. Introduce páginas y rangos como 1,3-5, o deja el campo vacío para procesar todas dentro del límite de 50 páginas.