MV Tools

Anleitung zur Tabellenextraktion

Tabellen aus Bildern und gescannten PDFs nach Excel extrahieren

Ein bebilderter Ablauf für einen überprüfbaren Tabellenentwurf aus einer bildbasierten Tabelle – einschließlich Struktur- und Wertekontrolle.

MV Tools RedaktionAktualisiert 9 Min. Lesezeit

Bildtabelle nach Excel öffnen

Das Werkzeug passend zur Quelle wählen

Bildtabelle nach Excel eignet sich für Screenshots, Scans oder Fotos mit einer Tabelle. PDF-Tabelle nach Excel ist sinnvoll, wenn die Tabelle in einem PDF liegt und eventuell nur einzelne Seiten gebraucht werden. Auch bei auswählbarem PDF-Text kann die interne Reihenfolge vom sichtbaren Layout abweichen, daher bleibt die Arbeitsmappe prüfpflichtig.

Die Anleitung verwendet dieselbe einfache Tabelle als PNG und reines Bild-PDF. Sie enthält eine Kopfzeile, fünf Datenzeilen und vier Spalten. Die bekannten Summen 751 für Q1 und 787 für Q2 dienen später als konkrete Prüfpunkte.

Dieselbe selbst erstellte Tabelle liegt als PNG und Bild-PDF vor, damit beide Abläufe vergleichbar bleiben.
Dieselbe selbst erstellte Tabelle liegt als PNG und Bild-PDF vor, damit beide Abläufe vergleichbar bleiben.

Eine gut lesbare Quelle vorbereiten

Verwenden Sie möglichst Originalexport oder Originalscan. Halten Sie die Seite gerade, bewahren Sie genügend Auflösung für kleine Zeichen und schneiden Sie fremde Inhalte sowie große Ränder weg. Bei Fotos helfen eine flache Seite, gleichmäßiges Licht und wenig Perspektive.

Wählen Sie die Sprache der meisten Zellen. Randlose Tabellen, verbundene oder mehrzeilige Zellen, blasse Linien, Handschrift, Währungssymbole und Sprachmischungen erschweren die aus Positionen abgeleitete Zeilen- und Spaltenstruktur.

  • Nutzen Sie eine scharfe Quelle statt eines Screenshots vom Screenshot.
  • Sorgen Sie für sichtbare Überschriften und Rastergrenzen.
  • Testen Sie vor einem langen Bericht zuerst eine schwierige, repräsentative Seite.
  • Laden Sie keine vertraulichen Daten nur zum Ausprobieren hoch.

Das PNG mit Bildtabelle nach Excel extrahieren

Öffnen Sie das Werkzeug und übernehmen Sie die gezeigten Einstellungen. Auf kleinen Bildschirmen stehen die Bedienelemente untereinander, ihre Reihenfolge bleibt gleich.

  1. Lokales Beispiel-PNG auswählen.

    Wählen Sie mvtools-table-sample.png; die Auswahl startet noch keine Verarbeitung.

  2. Sprache und Vorverarbeitung abstimmen.

    Wählen Sie Deutsch und lassen Sie hier die Vorverarbeitung aktiv. Verschlechtert sie ein sauberes Bild, vergleichen Sie einen Lauf ohne diese Option.

  3. Die erste Zeile als Kopfzeile prüfen.

    Aufgabe, Region, Q1 und Q2 sind Spaltennamen. Bei einem Berichtstitel oder ersten Datensatz muss die Option aus bleiben.

  4. Einmal starten und abwarten.

    Senden Sie dieselbe Datei während der Verarbeitung nicht mehrfach ab.

Abbildung 1 · Bild auswählen, OCR-Sprache abstimmen und Vorverarbeitung sowie Kopfzeile passend zur Quelle setzen.
Abbildung 1 · Bild auswählen, OCR-Sprache abstimmen und Vorverarbeitung sowie Kopfzeile passend zur Quelle setzen.

Das Bildergebnis richtig lesen

Der echte Lauf erkannte aus einem 48 KB großen PNG 6 Zeilen, 4 Spalten und 24 Zellen bei 100.0% mittlerer Konfidenz. Dieses Ergebnis gehört zu einem sauberen synthetischen Beispiel und sagt nichts über fotografierte Belege voraus.

Prüfen Sie Vorschau auf verschobene Spalten, fehlende Zeilen und falsche Überschriften. XLSX eignet sich für die Tabellenprüfung; JSON zeigt Struktur und Erkennungsdetails.

  1. Abmessungen prüfen.

    Erwartet wird 6 × 4. Andere Werte sind ein Signal, Quelle oder Einstellungen zu prüfen.

  2. Konfidenz zur Priorisierung nutzen.

    Kleine Schrift, Satzzeichen, Kennungen und schwacher Kontrast sind zuerst zu kontrollieren.

  3. Sichtbare Vorschau vergleichen.

    Vier Überschriften und fünf Aufgaben müssen in Quellreihenfolge erscheinen.

    Abbildung 3 · Die Vorschau mit höchstens 20 Zeilen erlaubt eine erste Strukturprüfung vor der vollständigen XLSX- oder JSON-Datei.
    Abbildung 3 · Die Vorschau mit höchstens 20 Zeilen erlaubt eine erste Strukturprüfung vor der vollständigen XLSX- oder JSON-Datei.
Abbildung 2 · Der echte Lauf erkannte ein 6 × 4-Raster mit 24 Zellen.
Abbildung 2 · Der echte Lauf erkannte ein 6 × 4-Raster mit 24 Zellen.

Bestimmte Seiten eines Scan-PDFs extrahieren

Das PDF enthält dieselbe Tabelle als einseitiges Bild. Datei und Deutsch wählen, Vorverarbeitung und Kopfzeile aktiv lassen und 1 eingeben. Bei längeren Dateien begrenzt 1,3-5 die Verarbeitung; ein leeres Feld verarbeitet alle Seiten innerhalb des Limits.

Pro verarbeiteter Seite entsteht ein Tabellenblatt. Dieser Lauf erzeugte 1 Blatt bei 100.0% mittlerer Konfidenz. Seitenübergreifende Tabellen müssen anschließend manuell zusammengeführt werden.

  1. Zuerst repräsentative Seiten testen.

    Der Test sollte Überschriften, Zahlen und das schwierigste Layout enthalten.

  2. Gewünschte Reihenfolge bewahren.

    Seiten in Verarbeitungsreihenfolge eingeben; doppelte Angaben werden ignoriert.

  3. Seiten- und Blattzahl prüfen.

    In diesem Beispiel muss eine Seite genau ein Tabellenblatt ergeben.

    Abbildung 5 · Für die eine verarbeitete Seite wurde ein Tabellenblatt erstellt.
    Abbildung 5 · Für die eine verarbeitete Seite wurde ein Tabellenblatt erstellt.
Abbildung 4 · Für das einseitige Beispiel ist Seite 1 angegeben; längere PDFs lassen sich mit Seiten und Bereichen eingrenzen.
Abbildung 4 · Für das einseitige Beispiel ist Seite 1 angegeben; längere PDFs lassen sich mit Seiten und Bereichen eingrenzen.

Die Arbeitsmappe vollständig prüfen

Öffnen Sie XLSX und vergleichen Sie Zelle für Zelle. Q1 muss 751, Q2 muss 787 ergeben. Kontrollieren Sie außerdem Datum, Dezimal- und Tausendertrennzeichen, Minuszeichen, führende Nullen, IDs, Leerzellen und Ausrichtung.

OCR liefert erkannte Werte, nicht die ursprüngliche Logik. Formeln, Datentypen, verbundene Überschriften und Formatierung müssen bei Bedarf neu aufgebaut werden. Für wichtige Entscheidungen gehört die Quelle neben die Arbeitsmappe.

FeststellungMaßnahme
Spalte fehlt oder ist zusätzlich vorhandenStörenden Inhalt beschneiden, Ausrichtung oder Linien verbessern und eine Tabelle neu testen.
Zahl wirkt plausibel, ist aber falschSummen vergleichen und wichtige Werte Zeichen für Zeichen prüfen.
Verbundene oder mehrzeilige Zellen verrutschenDie beabsichtigte Struktur manuell wiederherstellen.
Tabelle läuft auf der nächsten Seite weiterJedes Blatt einzeln prüfen und erst danach zusammenführen.

Grenzen und temporäre Dateien kennen

Bildtabelle nach Excel akzeptiert eine JPG-, PNG-, TIFF-, BMP- oder WebP-Datei bis 25 MB bei fünf Minuten Standardzeitlimit. PDF-Tabelle nach Excel akzeptiert ein PDF bis 100 MB und 50 Seiten, weist verschlüsselte oder passwortgeschützte Dateien ab und hat zehn Minuten Zeitlimit. Unterstützt werden Englisch, vereinfachtes Chinesisch, Japanisch, Deutsch, Französisch, Spanisch und Portugiesisch.

Quelle und Ergebnisse werden auf den Server hochgeladen und normalerweise nach 30 Minuten bereinigt. Laden Sie XLSX und JSON rechtzeitig herunter und behalten Sie das Original. Die Übungsdateien dieser Seite sind selbst erstellte öffentliche Beispiele, keine gespeicherten Nutzeraufträge.

Häufige Fragen

Garantiert hohe mittlere Konfidenz korrekte Excel-Zellen?

Nein. Sie hilft bei der Prüfpriorität; Zahlen, Kennungen, Summen und Tabellenstruktur müssen mit der Quelle verglichen werden.

Soll die erste Zeile als Kopfzeile gelten?

Nur wenn sie echte Spaltennamen enthält, nicht bei einem Berichtstitel oder dem ersten Datensatz.

Kann ich nur ausgewählte PDF-Seiten verarbeiten?

Ja. Geben Sie Seiten und Bereiche wie 1,3-5 ein oder lassen Sie das Feld für alle Seiten innerhalb des 50-Seiten-Limits leer.