Deux PDF visuellement identiques peuvent réagir très différemment à une recherche. Un PDF produit numériquement contient en général du texte sélectionnable. Un scan peut n'être qu'une série d'images : une recherche plein texte classique n'a alors rien à interroger. Certains PDF mélangent les deux.
ZipSeek utilise d'abord la couche de texte existante et peut reconnaître localement les pages scannées ou images intégrées. Chaque résultat conserve le numéro de page et, lorsque l'OCR fournit des coordonnées, la zone précise sur la page.
Une seule recherche pour le texte et les scans
Sélectionnez un PDF, une archive ou un dossier de documents, puis saisissez votre expression. Activez « Texte dans les images » si des scans sont possibles. Si tous les PDF disposent d'une bonne couche de texte, désactiver l'OCR évite du travail supplémentaire.
Un échec de la recherche textuelle ne déclenche pas aveuglément l'OCR sur toutes les pages. Les pages disposant de texte l'utilisent ; seules les pages sans texte exploitable et les images pertinentes deviennent candidates à la reconnaissance.
- Dans un grand corpus, préférez une expression courte et distinctive à un mot courant.
- Ajoutez les formats d'image si des scans séparés peuvent contenir la réponse.
- La zone d'état distingue la progression de l'OCR de l'analyse documentaire classique.
Du résultat à la bonne page
La sélection d'un résultat PDF ouvre l'aperçu directement sur la page correspondante. Le texte natif est surligné ; les résultats OCR utilisent les rectangles reconnus. Les commandes précédente et suivante passent d'une occurrence à l'autre, pas simplement d'une ligne à l'autre.
L'OCR interprète des pixels. Basse résolution, inclinaison, écriture manuscrite, photocopie pâle, police inhabituelle et tableaux denses réduisent sa fiabilité. Toute information importante doit être vérifiée sur la page rendue.
L'OCR reste sur le Mac
La reconnaissance s'effectue avec macOS Vision, sur l'appareil. Documents, requêtes et texte reconnu ne sont pas envoyés à un service d'IA externe. Les résultats réutilisables sont conservés dans un cache local limité ; dès que la source change, l'ancien contenu n'est plus utilisé.
Pour un seul PDF propre, la recherche de l'app Aperçu suffit. ZipSeek devient utile lorsque la même requête doit couvrir plusieurs PDF, images, documents Office et archives.