Tutoriel d’extraction de tableaux
Extraire des tableaux d’images et de PDF scannés vers Excel
Un parcours illustré pour créer un brouillon de tableur vérifiable depuis un tableau en image et contrôler sa structure et ses valeurs.
Ouvrir Image vers ExcelChoisir l’outil adapté à la source
Utilisez Image vers Excel pour une capture, un scan ou une photo contenant un tableau. Utilisez PDF vers Excel lorsque le tableau se trouve dans un PDF et que seules certaines pages sont utiles. Même un PDF avec texte sélectionnable peut avoir un ordre interne différent de sa mise en page : le classeur doit être contrôlé.
Ce tutoriel reprend le même tableau simple en PNG et en PDF image. Il comporte une ligne d’en-tête, cinq lignes de données et quatre colonnes. Les totaux connus sont 751 pour T1 et 787 pour T2, ce qui fournit des points de contrôle concrets.
Préparer une source lisible par l’OCR
Préférez l’export ou le scan original. Gardez la page droite, une résolution suffisante pour les petits caractères, et recadrez les contenus étrangers ou les grandes marges. Pour une photo, aplatissez la feuille et évitez reflets, ombres et perspective.
Choisissez la langue majoritaire. Tableaux sans bordures, cellules fusionnées ou multilignes, traits pâles, écriture manuscrite, devises et langues mélangées rendent la reconstruction des lignes et colonnes plus difficile.
- Utilisez une source nette plutôt qu’une capture de capture.
- Rendez visibles les en-têtes et les limites de grille.
- Testez d’abord une page difficile représentative.
- Ne chargez pas de données confidentielles uniquement pour essayer.
Extraire le PNG avec Image vers Excel
Ouvrez l’outil puis reprenez les réglages illustrés. Sur mobile, les commandes s’empilent mais conservent leur ordre.
Sélectionnez le PNG localisé.
Choisissez mvtools-table-sample.png ; la sélection ne lance pas encore le traitement.
Adaptez langue et prétraitement.
Choisissez Français et gardez le prétraitement actif ici. S’il dégrade une image déjà nette, comparez avec une exécution sans cette option.
Confirmez la ligne d’en-tête.
Tâche, Région, T1 et T2 sont des noms de colonnes. Désactivez l’option pour un titre de rapport ou une première donnée.
Lancez une seule fois puis attendez.
Évitez les soumissions répétées du même fichier pendant son traitement.
Lire le résultat de l’image
Cette exécution réelle a détecté 6 lignes, 4 colonnes et 24 cellules dans un PNG de 47 KB, avec 100.0% de confiance moyenne. Ce chiffre vient d’un exemple synthétique net, pas d’une prévision pour une facture photographiée.
Repérez colonnes décalées, lignes absentes et mauvais en-têtes. Le XLSX facilite le contrôle dans un tableur ; le JSON expose la structure et les détails de reconnaissance.
Contrôlez les dimensions.
La grille attendue est 6 × 4 ; un autre résultat impose de revoir la source ou les réglages.
Priorisez avec la confiance.
Vérifiez d’abord petits caractères, ponctuation, identifiants et zones peu contrastées.
Comparez l’aperçu.
Les quatre en-têtes et les cinq tâches doivent suivre l’ordre de la source.
Figure 3 · L’aperçu limité à 20 lignes permet un premier contrôle de structure avant le XLSX ou le JSON complet.
Extraire des pages précises d’un PDF scanné
Le PDF contient le même tableau sur une page image. Sélectionnez Français, conservez prétraitement et en-tête, puis saisissez 1. Sur un document long, 1,3-5 ne traite que ces pages ; un champ vide traite tout le PDF dans la limite.
Une feuille est créée par page traitée. Cette exécution a créé 1 feuille avec 100.0% de confiance moyenne ; un tableau poursuivi sur plusieurs pages doit donc être regroupé manuellement.
Testez d’abord des pages représentatives.
Incluez en-têtes, nombres et mise en page la plus complexe.
Respectez l’ordre voulu.
Saisissez les pages dans l’ordre de traitement ; les doublons sont ignorés.
Vérifiez pages et feuilles.
Une page traitée doit donner une feuille dans cet exemple.
Figure 5 · Une feuille a été créée pour l’unique page traitée.
Auditer le classeur complet
Ouvrez le XLSX et comparez chaque cellule. Vérifiez les totaux 751 pour T1 et 787 pour T2, puis dates, séparateurs décimaux et de milliers, signes moins, zéros initiaux, identifiants, cellules vides et alignement.
L’OCR livre des valeurs reconnues, pas la logique d’origine. Rétablissez formules, types, en-têtes fusionnés et mise en forme si nécessaire, et conservez la source pour toute décision importante.
| Constat | Action |
|---|---|
| Colonne en trop ou manquante | Recadrez les interférences, redressez ou renforcez les traits, puis retestez un tableau. |
| Nombre plausible mais faux | Comparez les totaux et contrôlez les valeurs importantes caractère par caractère. |
| Cellules fusionnées ou multilignes déplacées | Rétablissez manuellement la structure dans le classeur. |
| Tableau poursuivi à la page suivante | Contrôlez chaque feuille avant de les réunir. |
Connaître les limites et les fichiers temporaires
Image vers Excel accepte un JPG, PNG, TIFF, BMP ou WebP de 25 Mo maximum avec un délai par défaut de cinq minutes. PDF vers Excel accepte un PDF de 100 Mo et 50 pages maximum, refuse les fichiers chiffrés ou protégés et dispose de dix minutes. Les deux prennent en charge l’anglais, le chinois simplifié, le japonais, l’allemand, le français, l’espagnol et le portugais.
Les outils chargent temporairement la source et les résultats sur le serveur, normalement supprimés après 30 minutes. Téléchargez rapidement XLSX et JSON et gardez l’original. Les fichiers de cette page sont des exemples publics créés en interne, pas des tâches utilisateur conservées.
Questions fréquentes
Une confiance moyenne élevée garantit-elle toutes les cellules ?
Non. Elle aide à prioriser le contrôle, mais nombres, identifiants, totaux et structure doivent toujours être comparés à la source.
Faut-il marquer la première ligne comme en-tête ?
Uniquement si elle contient de vrais noms de colonnes, jamais pour un titre de rapport ou la première donnée.
Puis-je traiter seulement certaines pages du PDF ?
Oui. Saisissez des pages et plages comme 1,3-5, ou laissez vide pour toutes les pages dans la limite de 50.