全部 ZipSeek 指南

PDF 与 OCR

如何在 Mac 上搜索 PDF 和扫描文档里的文字

同时搜索 PDF 原生文字和扫描页 OCR,并直接定位到匹配的页码或图片区域。

发布于 更新于

两份看起来一样的 PDF,搜索效果可能完全不同。电子生成的 PDF 通常带有可选中的文字层;扫描件可能只有一张张页面图片,普通全文搜索自然找不到其中的字。混合型 PDF 还可能同时包含两种内容。

ZipSeek 会优先读取现有文字层,并可用 Mac 本机 OCR 识别扫描页和嵌入图片。结果会保留页码;识别到坐标时,还会标出页面上的实际区域。

一次搜索同时覆盖正文和扫描页

选择一份 PDF、一个压缩包或一整个文档文件夹,输入关键词。资料里可能有扫描件时,开启“图片中的文字”;确认所有 PDF 都有正常文字层时,可以关闭 OCR,避免额外识别时间。

ZipSeek 不会因为一次文字搜索没命中就盲目 OCR 每一页。已有可用文字层的页面先走原生文本,缺少文字或包含重要图片文字的页面才需要识别。

  • 大量文件中优先使用短而独特的词组,不要只搜一个常见字。
  • 独立图片也可能有答案时,同时勾选图片类型。
  • OCR 进行时可在底部状态区域查看识别进度。

从结果直接回到原页

选择 PDF 结果后,右侧预览会跳到命中页。原生文字会在页面文本中高亮,OCR 结果则用识别到的矩形标出位置。上一处和下一处按钮按具体命中移动,而不只是按整行切换。

文字识别本质上是对像素的判断。低分辨率、倾斜、手写体、浅色复印件和密集表格都会影响准确率,重要内容仍应回到原页核对。

OCR 数据留在这台 Mac

识别使用 macOS Vision 在本机完成,不会把文档、搜索词或 OCR 文字发送到外部 AI 服务。可复用结果会进入有容量上限的本地缓存;文件内容发生变化后,旧结果不会继续复用。

如果只需要搜索一份文字清晰的 PDF,预览的 Command-F 已经足够。ZipSeek 更适合让同一个关键词同时覆盖多份 PDF、扫描件、图片、Office 文件和压缩包。