BestPDFInTheWorld
Converter · Premium

OCR de PDF digitalizado

Um PDF digitalizado é uma pilha de fotografias: não se pesquisa, não se copia, não se selecciona uma linha. O OCR lê o que está nas imagens e devolve o mesmo documento com uma camada de texto invisível por cima, ou, se preferir, só o texto em bruto num ficheiro .txt. Tudo corre no seu browser: o documento digitalizado nunca sai do computador, o que é raro numa ferramenta de OCR.

Como se usa

Três passos, sem instalar nada.

Todo o trabalho acontece no seu computador, do início ao fim.

1

Escolher o ficheiro

Arraste o PDF digitalizado para a janela da ferramenta, ou uma imagem de um documento.

2

Escolher a língua

Português, inglês ou espanhol. É a língua do documento, não a da interface, e escolher mal degrada muito o resultado.

3

Descarregar o resultado

Um PDF pesquisável com as páginas originais, ou o texto em bruto em .txt.

O que é um PDF pesquisável, exactamente?

É o documento original, com as páginas tal como estavam, mais uma camada de texto por cima que o leitor não desenha. Não se vê nada de novo na página, mas a pesquisa do leitor de PDF encontra as palavras, o rato selecciona linhas e o copiar e colar funciona. É também assim que os motores de busca e os arquivos internos passam a encontrar o documento.

Os meus documentos são enviados para algum servidor?

Não, e nesta ferramenta isso vale mais do que em qualquer outra. O reconhecimento de texto é o serviço que mais habitualmente obriga a enviar o ficheiro para uma máquina alheia, e um digitalizado costuma ser precisamente aquilo que não se quer enviar: um contrato, um recibo, uma carta do médico. Aqui, o motor de reconhecimento é descarregado para o seu browser e trabalha na sua máquina.

Porque é que a primeira utilização demora mais?

Porque na primeira vez o browser descarrega o motor de reconhecimento e o modelo da língua que escolheu, que juntos são vários megabytes. Fica guardado no browser: das vezes seguintes arranca logo. Se mudar de língua, descarrega o modelo dessa língua, e só desse.

Quanto tempo demora um documento?

Depende da máquina e da qualidade escolhida, mas conte com alguns segundos por página. A ferramenta mostra o progresso página a página, para saber que está a andar. Documentos de muitas páginas demoram mesmo: não é engano, é o preço de reconhecer letra por letra.

Os seus ficheiros nunca saem do browser. O motor de reconhecimento é que vem ter com eles, e não o contrário.
Limites honestos

O resultado é tão bom quanto o digitalizado.

Uma página tirada direita, com boa luz e resolução decente lê-se quase toda bem. Uma fotografia tirada de lado, com sombra a meio, ou digitalizada em baixa resolução, dá texto com erros, e por vezes muitos. Se puder repetir a digitalização, repita: rende mais do que qualquer opção desta ferramenta.

Só reconhece as três línguas que tem modelo.

Português, inglês e espanhol. Um documento em francês ou em alemão vai ser lido com o modelo que escolher, e o resultado será mau. Um documento com duas línguas misturadas lê-se pela que escolher, e a outra sai pior.

Não lê escrita à mão.

Isto reconhece letra impressa. Uma assinatura, uma nota manuscrita na margem ou um formulário preenchido à mão não são reconhecidos, e o que sair daí é ruído.

A camada de texto é uma aproximação.

As palavras ficam sobre as palavras da imagem, mas a caixa de selecção pode ficar ligeiramente desalinhada, sobretudo em letra muito pequena ou em páginas tortas. Isso não afecta a pesquisa: afecta o rectângulo que o leitor realça quando encontra a palavra.

Tabelas e colunas podem sair desordenadas.

O reconhecimento lê linhas de texto, não a estrutura da página. Um documento em duas colunas, ou uma tabela densa, sai muitas vezes com a ordem trocada no ficheiro .txt. No PDF pesquisável isso não se nota, porque cada palavra fica no sítio dela.

Dúvidas

Perguntas sobre OCR de PDF.

Preciso de criar conta para usar o OCR?

Sim, esta é uma ferramenta Premium e é preciso subscrever e iniciar sessão.

Posso usar uma fotografia em vez de um PDF?

Pode. A ferramenta aceita PNG, JPEG e WebP, além de PDF. Uma fotografia direita e bem iluminada dá resultado; uma fotografia tirada de lado dá pouco.

O meu PDF já tem texto. Preciso de OCR?

Não. Se consegue seleccionar uma palavra no seu leitor de PDF, o texto já lá está: use antes o Extrair texto, que é imediato e não inventa nada. O OCR serve para os documentos onde não consegue seleccionar nada.

Que qualidade devo escolher?

A Normal serve a maior parte dos casos. A Alta ajuda em letra pequena ou em digitalizações fracas, e demora bastante mais. A Rápida serve para ver depressa se vale a pena tratar o documento.

Os meus ficheiros ficam guardados nos vossos servidores?

Não. Como nada é enviado, nada fica guardado fora do seu browser.

Um digitalizado
que não se pesquisa?

Abra a ferramenta e experimente. Sem instalar nada, sem enviar nada para lado nenhum.

Abrir o OCR