Dois PDFs podem parecer iguais e se comportar de forma bem diferente na busca. Um PDF digital geralmente contém texto selecionável; uma digitalização pode ser apenas uma sequência de imagens, sem texto para a pesquisa comum. Alguns documentos misturam os dois casos.
O ZipSeek usa primeiro a camada de texto e pode reconhecer no próprio Mac páginas digitalizadas ou imagens incorporadas. O resultado preserva a página e, quando o OCR oferece coordenadas, a área exata.
Uma pesquisa para texto e digitalizações
Escolha um PDF, arquivo compactado ou pasta e digite a expressão. Ative “Texto em imagens” se houver digitalizações. Se todos os PDFs tiverem uma boa camada de texto, desativar o OCR evita trabalho extra.
Uma consulta sem resultado não dispara OCR cegamente em todas as páginas. O texto nativo é aproveitado onde existe; apenas páginas sem texto útil e imagens relevantes entram no reconhecimento.
- Em acervos grandes, use uma expressão curta e específica.
- Inclua formatos de imagem se houver digitalizações avulsas.
- A área de status separa o andamento do OCR da análise normal dos documentos.
Do resultado à página certa
Ao selecionar um resultado, a prévia abre a página correspondente. O texto nativo aparece destacado e o OCR usa os retângulos reconhecidos. Os controles anterior e seguinte percorrem ocorrências individuais, não apenas linhas.
OCR interpreta pixels. Baixa resolução, inclinação, escrita à mão, cópias fracas, fontes incomuns e tabelas densas podem reduzir a precisão. Confira informações importantes na página renderizada.
O OCR fica no Mac
O reconhecimento usa o macOS Vision localmente. Documentos, consultas e texto reconhecido não são enviados para um serviço externo. Resultados reutilizáveis entram em um cache local limitado e deixam de ser usados quando o arquivo muda.
Para um único PDF limpo, Command-F no Pré-Visualização basta. O ZipSeek é mais útil quando a mesma consulta precisa abranger vários PDFs, imagens, documentos do Office e arquivos compactados.