MV Tools

Tutoriel OCR

Préparer des documents scannés pour un OCR plus précis

Une liste de contrôle pratique pour les images et PDF scannés, axée sur une précision vérifiable.

Équipe éditoriale MV ToolsMis à jour 8 min de lecture

Ouvrir l’OCR avancé d’image

Déterminez d’abord la sortie nécessaire

Pour une image dont vous voulez le texte, la confiance par ligne et le JSON, utilisez l’OCR avancé d’image. Utilisez l’OCR PDF pour conserver un PDF interrogeable, ou la conversion de PDF scanné vers Word pour obtenir un brouillon DOCX modifiable. Aucun de ces outils ne remplace une vérification humaine, surtout pour les noms, montants, identifiants, textes juridiques et tableaux.

Cet exercice utilise l’OCR avancé d’image, car il fournit un fichier TXT, un JSON structuré, le nombre de lignes et la confiance moyenne. Vous pouvez ainsi voir ce qui a été reconnu et où commencer la vérification.

Exemple de scan français créé pour le test. Il contient paragraphes, nombres, statuts et lignes de tableau à comparer après OCR.
Exemple de scan français créé pour le test. Il contient paragraphes, nombres, statuts et lignes de tableau à comparer après OCR.

Rendez le scan plus facile à reconnaître

Commencez par la source la plus nette. Gardez la page droite, évitez ombres et reflets, recadrez les marges vides trop grandes et conservez une résolution suffisante pour les petits caractères. Un scan net et frontal vaut généralement mieux qu’une photo volumineuse mais floue.

L’exemple conserve volontairement texte, nombres, statuts et lignes de tableau pour comparer chaque partie après reconnaissance. N’envoyez pas de pièce d’identité, contrat ou photo privée simplement pour tester un outil.

  • Préférez le scan original à une capture d’une capture.
  • Pour une photo mobile, aplatissez la page, utilisez une lumière régulière et évitez la perspective.
  • Si le fichier mélange les langues, choisissez la plus proche et vérifiez manuellement l’autre.
  • Testez une page difficile et représentative avant de traiter une archive entière.

Importez l’image, choisissez la langue et le prétraitement

Ouvrez l’OCR avancé d’image ci-dessus. Les captures viennent de l’interface de bureau réelle ; sur un écran étroit les contrôles passent en colonne, mais l’ordre reste identique.

  1. Choisissez une image.

    Sélectionnez mvtools-ocr-scan.png dans le champ image. La sélection ne lance pas encore la reconnaissance.

  2. Choisissez la langue OCR la plus proche.

    Cet exemple utilise le français. La langue modifie le modèle et l’interprétation des caractères ; contrôlez soigneusement les passages dans une autre langue.

  3. Activez le prétraitement si la prise de vue le justifie.

    Il est activé dans cet exemple. Il peut aider en cas de faible contraste, lumière irrégulière ou page photographiée, mais ne recrée pas un détail absent.

Figure 1 · Vérifiez le nom du fichier, choisissez la langue la plus proche et décidez si le prétraitement est utile.
Figure 1 · Vérifiez le nom du fichier, choisissez la langue la plus proche et décidez si le prétraitement est utile.

Lancez l’OCR et lisez le résultat

Cliquez sur Exécuter PaddleOCR et attendez la fin de la tâche. Ne soumettez pas plusieurs fois pendant le traitement. À la fin, lisez l’état, la langue, le nombre de lignes et la confiance avant de télécharger TXT ou JSON.

  1. Confirmez la fin de la tâche.

    COMPLETED signifie que les fichiers ont été produits ; cela ne garantit pas chaque caractère.

  2. Utilisez la confiance comme indice.

    Cet exemple atteint 99,7 %. Vérifiez d’abord les petits caractères peu contrastés, les nombres, les symboles et les bords des tableaux.

  3. Téléchargez les deux formats.

    TXT convient à la lecture et à la modification. JSON conserve confiance, cadres et détails structurés pour un contrôle approfondi.

Figure 2 · Un traitement réel en français a renvoyé 18 lignes depuis une image de 96 Ko, avec 99,7 % de confiance moyenne.
Figure 2 · Un traitement réel en français a renvoyé 18 lignes depuis une image de 96 Ko, avec 99,7 % de confiance moyenne.

Comparez la source avec le texte et la structure

Lisez le TXT en entier, puis ouvrez le JSON pour examiner confidence, box et polygon de chaque ligne. Comparez source et sortie côte à côte, en commençant par les zones les plus importantes pour votre tâche.

La page présente un aperçu de cette sortie. Cet aperçu ne remplace pas le contrôle des fichiers complets ; téléchargez le scan, le TXT et le JSON depuis l’exemple.

Figure 3 · L’aperçu TXT facilite une première lecture, mais les nombres, symboles et tableaux doivent être comparés à l’original.
Figure 3 · L’aperçu TXT facilite une première lecture, mais les nombres, symboles et tableaux doivent être comparés à l’original.
  • Texte : recherchez caractères manquants, répétés ou remplacés et espaces inattendus.
  • Nombres et symboles : contrôlez identifiants, dates, décimales, tirets et unités.
  • Structure : vérifiez lignes et colonnes, ordre des paragraphes, cachets, signatures et écriture manuscrite.
  • Objectif : confirmez que la sortie convient à la modification, la recherche ou l’archive ; gardez le scan original.
Exemple de scan français créé pour le test. Il contient paragraphes, nombres, statuts et lignes de tableau à comparer après OCR.
Exemple de scan français créé pour le test. Il contient paragraphes, nombres, statuts et lignes de tableau à comparer après OCR.
Figure 3 · L’aperçu TXT facilite une première lecture, mais les nombres, symboles et tableaux doivent être comparés à l’original.
Figure 3 · L’aperçu TXT facilite une première lecture, mais les nombres, symboles et tableaux doivent être comparés à l’original.

Comprenez les limites, la confidentialité et l’outil suivant

L’OCR avancé d’image accepte une image JPG, PNG, TIFF, BMP ou WebP jusqu’à 25 Mo, avec un délai de cinq minutes. L’OCR PDF accepte les PDF jusqu’à 100 Mo et 100 pages ; la conversion de PDF scanné vers Word accepte jusqu’à 100 Mo et 50 pages. Les PDF chiffrés ou endommagés peuvent échouer.

Les tâches envoient les fichiers au serveur. Ils sont généralement conservés 30 minutes puis nettoyés. Téléchargez rapidement, ne considérez pas le lien comme un stockage permanent et envoyez seulement des fichiers que vous êtes autorisé à traiter.

SituationAction suivante
Petits caractères, nombres ou tableaux incorrectsAméliorez netteté, orientation et lumière puis réessayez avec une page représentative.
Le PDF contient déjà du texte sélectionnableÉvitez généralement l’OCR ; utilisez la couche de texte existante pour éviter de nouvelles erreurs.
Vous avez besoin d’un PDF interrogeableUtilisez l’OCR PDF et contrôlez l’alignement de la couche texte avec les bonnes pages.
Vous avez besoin d’un brouillon modifiableUtilisez la conversion de PDF scanné vers Word et relisez le DOCX paragraphe par paragraphe.

Questions fréquentes

Une confiance élevée signifie-t-elle que le texte est exact ?

Non. Elle aide à prioriser la vérification, mais ne garantit ni le sens, ni les noms, ni les nombres, ni la mise en page.

Un PDF électronique avec texte sélectionnable a-t-il besoin d’OCR ?

Généralement non. L’OCR sert aux scans et pages image ; le relancer peut créer des erreurs.

Pourquoi un tableau peut-il revenir dans le mauvais ordre ?

L’OCR lit des zones visuelles et non la structure originale. Vérifiez les colonnes et utilisez un outil de tableur si vous avez besoin d’un vrai tableau.