Alle ZipSeek-Anleitungen

PDF und OCR

Text in PDFs und gescannten Dokumenten auf dem Mac suchen

Durchsuchen Sie echten PDF-Text und gescannte Seiten per OCR und springen Sie direkt zur Seite oder Bildstelle.

Veröffentlicht Aktualisiert

Zwei PDFs können gleich aussehen und sich bei der Suche völlig unterschiedlich verhalten. Ein digital erzeugtes PDF enthält meist auswählbaren Text. Ein Scan besteht häufig nur aus Seitenbildern; für eine normale Volltextsuche gibt es dort keinen Text. Manche PDFs enthalten beides.

ZipSeek nutzt zunächst die vorhandene Textebene und kann gescannte Seiten oder eingebettete Bilder per OCR direkt auf dem Mac erkennen. Ein Treffer behält die Seitenzahl und – wenn Koordinaten vorliegen – den genauen Bereich auf der Seite.

Text und Scans in einem Durchgang

Wählen Sie ein PDF, ein Archiv oder einen Dokumentordner und geben Sie den Suchbegriff ein. Aktivieren Sie „Text in Bildern“, wenn Scans vorkommen können. Besteht die Sammlung ausschließlich aus PDFs mit sauberer Textebene, sparen Sie mit deaktivierter OCR zusätzliche Erkennungszeit.

Ein erfolgloser Texttreffer löst nicht blind OCR auf jeder Seite aus. Seiten mit brauchbarer Textebene verwenden diese; nur Seiten ohne verwertbaren Text und relevante Bildinhalte werden zu OCR-Kandidaten.

  • Eine kurze, eindeutige Wortfolge ist in großen Beständen hilfreicher als ein häufiges Einzelwort.
  • Wählen Sie zusätzlich Bildformate, wenn auch einzelne Scans durchsucht werden sollen.
  • Der Statusbereich zeigt den OCR-Fortschritt getrennt von der normalen Dokumentanalyse.

Vom Treffer direkt zur Seite

Ein ausgewählter PDF-Treffer öffnet die Vorschau auf der richtigen Seite. Normaler Text wird im Seiteninhalt markiert; OCR-Treffer erscheinen über den erkannten Rechtecken. Vor und Zurück wechseln zwischen einzelnen Vorkommen, nicht nur zwischen Textzeilen.

OCR interpretiert Pixel und ist nicht unfehlbar. Geringe Auflösung, Schräglage, Handschrift, blasse Kopien, ungewöhnliche Schriften und dichte Tabellen können die Erkennung verschlechtern. Wichtige Aussagen sollten immer mit der gerenderten Seite abgeglichen werden.

OCR bleibt auf dem Mac

Die Erkennung läuft mit macOS Vision lokal. Dokumente, Suchbegriffe und OCR-Texte werden nicht an einen externen KI-Dienst übertragen. Wiederverwendbare Ergebnisse landen in einem begrenzten lokalen Cache; ändert sich die Quelldatei, wird der alte Inhalt nicht weiterverwendet.

Für ein einziges sauberes PDF reicht die Suche in Vorschau. ZipSeek wird interessant, wenn dieselbe Abfrage viele PDFs, Bilder, Office-Dateien und Archive erfassen soll.