MV Tools

Tutoriel d’extraction de tableaux

Extraire des tableaux d’images et de PDF scannés vers Excel

Un parcours illustré pour créer un brouillon de tableur vérifiable depuis un tableau en image et contrôler sa structure et ses valeurs.

Équipe éditoriale MV ToolsMis à jour 9 min de lecture

Ouvrir Image vers Excel

Choisir l’outil adapté à la source

Utilisez Image vers Excel pour une capture, un scan ou une photo contenant un tableau. Utilisez PDF vers Excel lorsque le tableau se trouve dans un PDF et que seules certaines pages sont utiles. Même un PDF avec texte sélectionnable peut avoir un ordre interne différent de sa mise en page : le classeur doit être contrôlé.

Ce tutoriel reprend le même tableau simple en PNG et en PDF image. Il comporte une ligne d’en-tête, cinq lignes de données et quatre colonnes. Les totaux connus sont 751 pour T1 et 787 pour T2, ce qui fournit des points de contrôle concrets.

Le même tableau original est fourni en PNG et en PDF image afin de comparer équitablement les deux méthodes.
Le même tableau original est fourni en PNG et en PDF image afin de comparer équitablement les deux méthodes.

Préparer une source lisible par l’OCR

Préférez l’export ou le scan original. Gardez la page droite, une résolution suffisante pour les petits caractères, et recadrez les contenus étrangers ou les grandes marges. Pour une photo, aplatissez la feuille et évitez reflets, ombres et perspective.

Choisissez la langue majoritaire. Tableaux sans bordures, cellules fusionnées ou multilignes, traits pâles, écriture manuscrite, devises et langues mélangées rendent la reconstruction des lignes et colonnes plus difficile.

  • Utilisez une source nette plutôt qu’une capture de capture.
  • Rendez visibles les en-têtes et les limites de grille.
  • Testez d’abord une page difficile représentative.
  • Ne chargez pas de données confidentielles uniquement pour essayer.

Extraire le PNG avec Image vers Excel

Ouvrez l’outil puis reprenez les réglages illustrés. Sur mobile, les commandes s’empilent mais conservent leur ordre.

  1. Sélectionnez le PNG localisé.

    Choisissez mvtools-table-sample.png ; la sélection ne lance pas encore le traitement.

  2. Adaptez langue et prétraitement.

    Choisissez Français et gardez le prétraitement actif ici. S’il dégrade une image déjà nette, comparez avec une exécution sans cette option.

  3. Confirmez la ligne d’en-tête.

    Tâche, Région, T1 et T2 sont des noms de colonnes. Désactivez l’option pour un titre de rapport ou une première donnée.

  4. Lancez une seule fois puis attendez.

    Évitez les soumissions répétées du même fichier pendant son traitement.

Figure 1 · Sélectionnez l’image, adaptez la langue OCR et choisissez le prétraitement et l’en-tête selon la source.
Figure 1 · Sélectionnez l’image, adaptez la langue OCR et choisissez le prétraitement et l’en-tête selon la source.

Lire le résultat de l’image

Cette exécution réelle a détecté 6 lignes, 4 colonnes et 24 cellules dans un PNG de 47 KB, avec 100.0% de confiance moyenne. Ce chiffre vient d’un exemple synthétique net, pas d’une prévision pour une facture photographiée.

Repérez colonnes décalées, lignes absentes et mauvais en-têtes. Le XLSX facilite le contrôle dans un tableur ; le JSON expose la structure et les détails de reconnaissance.

  1. Contrôlez les dimensions.

    La grille attendue est 6 × 4 ; un autre résultat impose de revoir la source ou les réglages.

  2. Priorisez avec la confiance.

    Vérifiez d’abord petits caractères, ponctuation, identifiants et zones peu contrastées.

  3. Comparez l’aperçu.

    Les quatre en-têtes et les cinq tâches doivent suivre l’ordre de la source.

    Figure 3 · L’aperçu limité à 20 lignes permet un premier contrôle de structure avant le XLSX ou le JSON complet.
    Figure 3 · L’aperçu limité à 20 lignes permet un premier contrôle de structure avant le XLSX ou le JSON complet.
Figure 2 · L’exécution réelle a produit une grille de 6 × 4, soit 24 cellules.
Figure 2 · L’exécution réelle a produit une grille de 6 × 4, soit 24 cellules.

Extraire des pages précises d’un PDF scanné

Le PDF contient le même tableau sur une page image. Sélectionnez Français, conservez prétraitement et en-tête, puis saisissez 1. Sur un document long, 1,3-5 ne traite que ces pages ; un champ vide traite tout le PDF dans la limite.

Une feuille est créée par page traitée. Cette exécution a créé 1 feuille avec 100.0% de confiance moyenne ; un tableau poursuivi sur plusieurs pages doit donc être regroupé manuellement.

  1. Testez d’abord des pages représentatives.

    Incluez en-têtes, nombres et mise en page la plus complexe.

  2. Respectez l’ordre voulu.

    Saisissez les pages dans l’ordre de traitement ; les doublons sont ignorés.

  3. Vérifiez pages et feuilles.

    Une page traitée doit donner une feuille dans cet exemple.

    Figure 5 · Une feuille a été créée pour l’unique page traitée.
    Figure 5 · Une feuille a été créée pour l’unique page traitée.
Figure 4 · La page 1 est demandée explicitement ; pages et plages servent à limiter un PDF plus long.
Figure 4 · La page 1 est demandée explicitement ; pages et plages servent à limiter un PDF plus long.

Auditer le classeur complet

Ouvrez le XLSX et comparez chaque cellule. Vérifiez les totaux 751 pour T1 et 787 pour T2, puis dates, séparateurs décimaux et de milliers, signes moins, zéros initiaux, identifiants, cellules vides et alignement.

L’OCR livre des valeurs reconnues, pas la logique d’origine. Rétablissez formules, types, en-têtes fusionnés et mise en forme si nécessaire, et conservez la source pour toute décision importante.

ConstatAction
Colonne en trop ou manquanteRecadrez les interférences, redressez ou renforcez les traits, puis retestez un tableau.
Nombre plausible mais fauxComparez les totaux et contrôlez les valeurs importantes caractère par caractère.
Cellules fusionnées ou multilignes déplacéesRétablissez manuellement la structure dans le classeur.
Tableau poursuivi à la page suivanteContrôlez chaque feuille avant de les réunir.

Connaître les limites et les fichiers temporaires

Image vers Excel accepte un JPG, PNG, TIFF, BMP ou WebP de 25 Mo maximum avec un délai par défaut de cinq minutes. PDF vers Excel accepte un PDF de 100 Mo et 50 pages maximum, refuse les fichiers chiffrés ou protégés et dispose de dix minutes. Les deux prennent en charge l’anglais, le chinois simplifié, le japonais, l’allemand, le français, l’espagnol et le portugais.

Les outils chargent temporairement la source et les résultats sur le serveur, normalement supprimés après 30 minutes. Téléchargez rapidement XLSX et JSON et gardez l’original. Les fichiers de cette page sont des exemples publics créés en interne, pas des tâches utilisateur conservées.

Questions fréquentes

Une confiance moyenne élevée garantit-elle toutes les cellules ?

Non. Elle aide à prioriser le contrôle, mais nombres, identifiants, totaux et structure doivent toujours être comparés à la source.

Faut-il marquer la première ligne comme en-tête ?

Uniquement si elle contient de vrais noms de colonnes, jamais pour un titre de rapport ou la première donnée.

Puis-je traiter seulement certaines pages du PDF ?

Oui. Saisissez des pages et plages comme 1,3-5, ou laissez vide pour toutes les pages dans la limite de 50.