Tutorial de extração de tabelas
Como extrair tabelas de imagens e PDFs digitalizados para Excel
Um fluxo ilustrado para criar um rascunho de planilha verificável a partir de uma tabela em imagem e revisar estrutura e valores.
Abrir Imagem para ExcelEscolha a ferramenta de acordo com a origem
Use Imagem de tabela para Excel para captura, digitalização ou foto com uma tabela. Use PDF de tabela para Excel quando ela estiver em um PDF e talvez só algumas páginas interessem. Mesmo um PDF com texto selecionável pode ter ordem interna diferente do layout visual, então a pasta de trabalho precisa ser revisada.
O tutorial usa a mesma tabela simples como PNG e PDF de imagem. Há um cabeçalho, cinco linhas de dados e quatro colunas; os totais conhecidos são 751 no T1 e 787 no T2, pontos úteis para validar a extração.
Prepare uma origem legível pelo OCR
Prefira a exportação ou digitalização original. Mantenha a página reta, resolução suficiente para o menor texto e corte conteúdo alheio ou margens grandes. Em fotos, achate a folha e evite reflexo, sombra e perspectiva.
Escolha o idioma da maioria das células. Tabelas sem borda, células mescladas ou multilinha, linhas fracas, escrita manual, moedas e idiomas mistos dificultam a reconstrução posicional de linhas e colunas.
- Use uma origem nítida, não uma captura de outra captura.
- Deixe cabeçalhos e limites da grade visíveis.
- Teste primeiro uma página difícil e representativa.
- Não envie material confidencial apenas para experimentar.
Extraia o PNG com Imagem de tabela para Excel
Abra a ferramenta e siga as configurações mostradas. Em tela estreita os controles ficam empilhados, mas mantêm a ordem.
Selecione o PNG localizado.
Escolha mvtools-table-sample.png; selecionar não inicia o processamento.
Ajuste idioma e pré-processamento.
Escolha Português e mantenha o pré-processamento neste exemplo. Se piorar uma imagem limpa, compare com uma execução sem ele.
Confirme se a primeira linha é cabeçalho.
Tarefa, Região, T1 e T2 são nomes de coluna. Desative para um título de relatório ou o primeiro registro.
Execute uma vez e aguarde.
Não envie o mesmo arquivo repetidamente enquanto ele está em processamento.
Interprete o resultado da imagem
A execução real detectou 6 linhas, 4 colunas e 24 células em um PNG de 47 KB, com confiança média de 100.0%. É o resultado de uma amostra sintética nítida, não uma previsão para recibos fotografados.
Procure colunas deslocadas, linhas ausentes e cabeçalhos errados. Use XLSX para conferir a planilha e JSON para examinar estrutura e detalhes do reconhecimento.
Confira as dimensões.
Esperamos 6 × 4; outro número pede revisão da origem ou das opções.
Priorize pela confiança.
Confira primeiro texto pequeno, pontuação, identificadores e baixo contraste.
Compare a prévia.
Os quatro cabeçalhos e as cinco tarefas devem seguir a ordem da origem.
Figura 3 · A prévia de até 20 linhas ajuda na primeira conferência estrutural antes do XLSX ou JSON completo.
Extraia páginas específicas do PDF digitalizado
O PDF contém a mesma tabela em uma página de imagem. Selecione Português, mantenha pré-processamento e cabeçalho e informe 1. Em arquivos longos, 1,3-5 processa apenas essas páginas; o campo vazio processa todas dentro do limite.
A ferramenta cria uma planilha por página processada. Esta execução gerou 1 planilha com confiança média de 99.8%; tabelas que continuam em outra página precisam ser consolidadas manualmente.
Teste páginas representativas primeiro.
Inclua cabeçalhos, números e o layout mais difícil do documento.
Preserve a ordem desejada.
Digite páginas na ordem de processamento; duplicatas são ignoradas.
Verifique páginas e planilhas.
Uma página processada deve gerar uma planilha neste exemplo.
Figura 5 · A execução criou uma planilha para a única página processada.
Audite toda a pasta de trabalho
Abra o XLSX e compare célula por célula. Confirme T1 igual a 751 e T2 igual a 787, além de datas, separadores decimais e de milhar, sinais negativos, zeros à esquerda, IDs, vazios e alinhamento.
OCR entrega valores reconhecidos, não a lógica original. Refaça fórmulas, tipos, cabeçalhos mesclados e formatação quando necessário e mantenha a origem ao lado da planilha em decisões importantes.
| O que encontrou | O que fazer |
|---|---|
| Coluna extra ou ausente | Corte interferências, corrija alinhamento ou linhas e teste uma tabela novamente. |
| Número plausível, mas errado | Compare totais e confira valores importantes caractere por caractere. |
| Células mescladas ou multilinha saíram do lugar | Restaure manualmente a estrutura na planilha. |
| Tabela continua na página seguinte | Confira cada planilha antes de consolidar. |
Conheça limites e arquivos temporários
Imagem de tabela para Excel aceita um JPG, PNG, TIFF, BMP ou WebP de até 25 MB e possui limite padrão de cinco minutos. PDF de tabela para Excel aceita um PDF de até 100 MB e 50 páginas, rejeita arquivos criptografados ou protegidos por senha e possui dez minutos. As duas ferramentas aceitam inglês, chinês simplificado, japonês, alemão, francês, espanhol e português.
Origem e resultados são enviados temporariamente ao servidor e normalmente removidos após 30 minutos. Baixe XLSX e JSON logo e guarde o original. Os arquivos desta página são exemplos públicos criados por nós, não tarefas de usuários mantidas.
Perguntas frequentes
Confiança média alta garante todas as células corretas?
Não. Ela ajuda a priorizar a revisão, mas números, identificadores, totais e estrutura precisam ser comparados com a origem.
Devo marcar a primeira linha como cabeçalho?
Somente se ela tiver nomes reais de coluna, não se for título do relatório ou o primeiro registro.
Posso processar apenas algumas páginas do PDF?
Sim. Informe páginas e intervalos como 1,3-5 ou deixe vazio para todas dentro do limite de 50 páginas.