Optische Zeichenerkennung in eigescannten PDF-Dateien

Beispiele

Referenz

PDF TO OCR( ArchivNummer|DateiName$ ; Flags )
Die Funktion führt eine optische Zeichenerkennung mit der Datei durch. Bei der Datei muss essich um eine PDF-Datei mit Bildseiten handeln, d.h. jede einzelne Seite der PDF-Datei enthältein Bild. Solche Dateien entstehen üblicherweise, wenn Dokumente eingescannt werden. Die Anweisungerzeugt eine neue PDF-Datei, die neben dem reinem Bild zusätzlich den Text enthält.Es wird also eine durchsuchbare PDF-Datei erstellt. Das Format der neu erzeugten PDF-Dateiist PDF/A, also ein Archivformat. Die neu erstellte Datei erhält den gleichen Namen wie die alteDatei, ergänzt um den Zusatz “_ocr“.

Mit dem Flags-Parameter können zusätzliche Steueranweisungen angegeben werden. Der Parameterist bitkodiert, entsprechend können die einzelnen Ziffern der Steueranweisungen einfach addiertwerden:
1: Es wird keine Fortschrittsmeldung ausgegeben
2: Es wird eine Debug-OCR-Datei erstellt, die exakte Details über die Erkennung enthält.

Der Rückgabewert der Funktion ist -1 im Fehlerfalle (z.B. Datei nicht lesbar), 0, wenn die Dateikeine oder keine kompatiblen Bilddaten enthält oder 1 im Erfolgsfall.
Es muss beachtet werden, dass die optische Zeichenerkennung exakt ein Bild pro PDF-Seite verlangt.Wenn eine PDF-Seite mehrere Bilder enthält, so ist das Gesamtlayout nicht mehr ohneweiteres erkennbar und die Zeichenerkennung versagt. In diesem Falle wird 0 als Ergebnis geliefert.EineWeiterverarbeitung des Inhalts der Datei kann danach z.B. mit der Funktion TEXT FROM PDF$ erfolgen.

Siehe auch



Schatten