MV Tools

Guia prático de OCR

Como preparar documentos digitalizados para um OCR mais preciso

Uma lista prática para conferir imagens e PDFs digitalizados, com foco em uma precisão que pode ser verificada.

Equipe editorial MV ToolsAtualizado 8 min de leitura

Abrir OCR avançado de imagem

Defina primeiro o resultado de que você precisa

Para uma imagem da qual você precisa de texto, confiança por linha e JSON, use OCR avançado de imagem. Use OCR de PDF quando precisar manter um PDF pesquisável, ou PDF digitalizado para Word quando precisar de um rascunho DOCX editável. Nenhuma opção substitui a revisão humana, especialmente em nomes, valores, IDs, textos legais e tabelas.

Este passo a passo usa OCR avançado de imagem porque ele entrega TXT, JSON estruturado, quantidade de linhas e confiança média. Assim fica mais fácil saber o que foi reconhecido e por onde começar a conferência.

Scan em português criado para o exemplo. Ele contém parágrafos, números, status e linhas de tabela para uma revisão intencional.
Scan em português criado para o exemplo. Ele contém parágrafos, números, status e linhas de tabela para uma revisão intencional.

Prepare o scan para facilitar o reconhecimento

Comece com a fonte mais nítida disponível. Mantenha a página reta, evite sombras e reflexos, corte margens vazias excessivas e preserve resolução suficiente para letras pequenas. Um scan claro e frontal costuma ser melhor que uma foto maior, porém borrada.

O exemplo mantém de propósito textos, números, status e linhas de tabela para comparar cada parte depois do reconhecimento. Não envie documentos de identidade, contratos ou fotos privadas apenas para testar uma ferramenta.

  • Prefira o scan original em vez de uma captura de outra captura.
  • Em fotos de celular, deixe a página plana, use luz uniforme e evite distorção de perspectiva.
  • Se o arquivo misturar idiomas, escolha o mais próximo e revise o outro manualmente.
  • Teste uma página difícil e representativa antes de processar um arquivo inteiro.

Envie a imagem e escolha idioma e pré-processamento

Abra o OCR avançado de imagem acima. As capturas vêm da interface real para computador; em telas estreitas os controles ficam empilhados, mas a ordem é a mesma.

  1. Escolha uma imagem.

    Selecione mvtools-ocr-scan.png no campo de imagem. Escolher o arquivo não inicia o reconhecimento.

  2. Escolha o idioma OCR mais adequado.

    Este exemplo usa português. O idioma altera o modelo e a interpretação dos caracteres; revise com atenção trechos em outros idiomas.

  3. Ative o pré-processamento quando a captura exigir.

    Neste exemplo ele fica ativado. Pode ajudar com baixo contraste, luz irregular ou páginas fotografadas, mas não recupera detalhes ausentes.

Figura 1 · Confirme o nome do arquivo, escolha o idioma mais adequado e decida se o pré-processamento é necessário.
Figura 1 · Confirme o nome do arquivo, escolha o idioma mais adequado e decida se o pré-processamento é necessário.

Execute o OCR e leia o painel de resultados

Clique em Executar PaddleOCR e aguarde a conclusão. Não envie a mesma tarefa várias vezes durante o processamento. Ao terminar, confira status, idioma, linhas e confiança antes de baixar TXT ou JSON.

  1. Confirme que a tarefa terminou.

    COMPLETED indica que os arquivos foram gerados; não significa que todos os caracteres estão corretos.

  2. Use a confiança como uma pista.

    Este exemplo chega a 99,5%. Confira primeiro letras pequenas com pouco contraste, números, símbolos e bordas de tabelas.

  3. Baixe os dois formatos.

    TXT é prático para ler e editar. JSON preserva confiança por linha, caixas e detalhes estruturados para uma conferência aprofundada.

Figura 2 · Uma execução real em português retornou 17 linhas de uma imagem de 105 KB com confiança média de 99,5%.
Figura 2 · Uma execução real em português retornou 17 linhas de uma imagem de 105 KB com confiança média de 99,5%.

Compare a fonte com o texto e a estrutura

Leia o TXT inteiro e depois abra o JSON para conferir confidence, box e polygon de cada linha. Compare fonte e saída lado a lado, começando pelas áreas mais importantes para sua tarefa.

A página mostra uma prévia desta saída. Ela não substitui a conferência dos arquivos completos; baixe o scan, o TXT e o JSON no exemplo acima.

Figura 3 · A prévia TXT ajuda na leitura rápida, mas números, símbolos e tabelas ainda precisam ser comparados ao original.
Figura 3 · A prévia TXT ajuda na leitura rápida, mas números, símbolos e tabelas ainda precisam ser comparados ao original.
  • Texto: procure caracteres ausentes, repetidos ou substituídos e espaços inesperados.
  • Números e símbolos: confira IDs, datas, casas decimais, hífens e unidades.
  • Estrutura: verifique linhas e colunas, ordem dos parágrafos, carimbos, assinaturas e escrita manual.
  • Objetivo: confirme se a saída atende à edição, pesquisa ou arquivamento; guarde o scan original.
Scan em português criado para o exemplo. Ele contém parágrafos, números, status e linhas de tabela para uma revisão intencional.
Scan em português criado para o exemplo. Ele contém parágrafos, números, status e linhas de tabela para uma revisão intencional.
Figura 3 · A prévia TXT ajuda na leitura rápida, mas números, símbolos e tabelas ainda precisam ser comparados ao original.
Figura 3 · A prévia TXT ajuda na leitura rápida, mas números, símbolos e tabelas ainda precisam ser comparados ao original.

Entenda limites, privacidade e o próximo recurso

O OCR avançado de imagem aceita uma imagem JPG, PNG, TIFF, BMP ou WebP de até 25 MB e tem tempo limite padrão de cinco minutos. O OCR de PDF aceita até 100 MB e 100 páginas; PDF digitalizado para Word, até 100 MB e 50 páginas. PDFs criptografados ou danificados podem falhar.

As tarefas enviam arquivos ao servidor. Eles normalmente ficam armazenados por 30 minutos e depois são removidos. Baixe os resultados rapidamente, não trate o link como armazenamento permanente e envie apenas arquivos que você pode processar.

SituaçãoPróxima ação
Letras pequenas, números ou tabelas estão erradosMelhore nitidez, orientação e iluminação e tente novamente com uma página representativa.
O PDF já tem texto selecionávelNormalmente não use OCR; aproveite a camada de texto existente para evitar novos erros.
Você precisa de um PDF pesquisávelUse OCR de PDF e verifique se a camada de texto está alinhada às páginas corretas.
Você precisa de um rascunho editávelUse PDF digitalizado para Word e revise o DOCX parágrafo por parágrafo.

Perguntas frequentes

Confiança alta significa que o texto está certamente correto?

Não. Ela ajuda a priorizar a revisão, mas não garante significado, nomes, números ou layout.

Um PDF eletrônico com texto selecionável precisa de OCR?

Geralmente não. OCR serve para scans e páginas em imagem; executá-lo de novo pode criar erros.

Por que uma tabela pode voltar na ordem errada?

OCR lê regiões visuais, não a estrutura original. Confira as colunas e use uma ferramenta de planilha se precisar de uma tabela real.