兩份看起來一樣的 PDF,搜尋表現可能完全不同。數位產生的 PDF 通常帶有可選取的文字層;掃描檔可能只有一張張頁面影像,一般全文搜尋自然找不到其中的字。混合型 PDF 還可能同時包含兩者。
ZipSeek 會優先讀取既有文字層,也能用 Mac 本機 OCR 辨識掃描頁與嵌入圖片。結果會保留頁碼;有字詞座標時,還會標出頁面上的實際區域。
一次搜尋同時涵蓋內文與掃描頁
選擇 PDF、壓縮檔或整個文件資料夾,輸入關鍵字。資料中可能有掃描檔時,開啟「圖片中的文字」;若確定所有 PDF 都有正常文字層,可關閉 OCR,省下額外辨識時間。
ZipSeek 不會因為文字查詢沒命中就盲目 OCR 每一頁。已有可用文字層的頁面先讀原生文字,缺少文字或含有重要圖片文字的頁面才需要辨識。
- 大量文件中,使用短而獨特的詞組比單一常見字更有效。
- 獨立圖片也可能有答案時,一併勾選圖片類型。
- OCR 執行時可在底部狀態區查看辨識進度。
從結果直接回到原頁
選擇 PDF 結果後,右側預覽會跳到命中頁。原生文字會在頁面文字中醒目標示,OCR 結果則以辨識到的矩形標出位置。上一個與下一個按鈕會逐一移動到實際命中,而不只是切換整行。
文字辨識本質上是對像素的判讀。低解析度、歪斜、手寫、淡色影印與密集表格都會影響準確率,重要內容仍應回到原頁核對。
OCR 資料留在這台 Mac
辨識使用 macOS Vision 在本機完成,不會把文件、搜尋詞或 OCR 文字傳到外部 AI 服務。可重用結果會進入有容量上限的本機快取;檔案內容改變後,舊結果不會繼續使用。
若只需要搜尋一份文字清楚的 PDF,預覽程式的 Command-F 已經足夠。ZipSeek 更適合讓同一個關鍵字同時涵蓋多份 PDF、掃描檔、圖片、Office 文件與壓縮檔。