OCR de PDF digitalizado
Um PDF digitalizado é uma pilha de fotografias: não se pesquisa, não se copia, não se selecciona uma linha. O OCR lê o que está nas imagens e devolve o mesmo documento com uma camada de texto invisível por cima, ou, se preferir, só o texto em bruto num ficheiro .txt. Tudo corre no seu browser: o documento digitalizado nunca sai do computador, o que é raro numa ferramenta de OCR.
Três passos, sem instalar nada.
Todo o trabalho acontece no seu computador, do início ao fim.
Escolher o ficheiro
Arraste o PDF digitalizado para a janela da ferramenta, ou uma imagem de um documento.
Escolher a língua
Português, inglês ou espanhol. É a língua do documento, não a da interface, e escolher mal degrada muito o resultado.
Descarregar o resultado
Um PDF pesquisável com as páginas originais, ou o texto em bruto em .txt.
O que é um PDF pesquisável, exactamente?
É o documento original, com as páginas tal como estavam, mais uma camada de texto por cima que o leitor não desenha. Não se vê nada de novo na página, mas a pesquisa do leitor de PDF encontra as palavras, o rato selecciona linhas e o copiar e colar funciona. É também assim que os motores de busca e os arquivos internos passam a encontrar o documento.
Os meus documentos são enviados para algum servidor?
Não, e nesta ferramenta isso vale mais do que em qualquer outra. O reconhecimento de texto é o serviço que mais habitualmente obriga a enviar o ficheiro para uma máquina alheia, e um digitalizado costuma ser precisamente aquilo que não se quer enviar: um contrato, um recibo, uma carta do médico. Aqui, o motor de reconhecimento é descarregado para o seu browser e trabalha na sua máquina.
Porque é que a primeira utilização demora mais?
Porque na primeira vez o browser descarrega o motor de reconhecimento e o modelo da língua que escolheu, que juntos são vários megabytes. Fica guardado no browser: das vezes seguintes arranca logo. Se mudar de língua, descarrega o modelo dessa língua, e só desse.
Quanto tempo demora um documento?
Depende da máquina e da qualidade escolhida, mas conte com alguns segundos por página. A ferramenta mostra o progresso página a página, para saber que está a andar. Documentos de muitas páginas demoram mesmo: não é engano, é o preço de reconhecer letra por letra.
O resultado é tão bom quanto o digitalizado.
Uma página tirada direita, com boa luz e resolução decente lê-se quase toda bem. Uma fotografia tirada de lado, com sombra a meio, ou digitalizada em baixa resolução, dá texto com erros, e por vezes muitos. Se puder repetir a digitalização, repita: rende mais do que qualquer opção desta ferramenta.
Só reconhece as três línguas que tem modelo.
Português, inglês e espanhol. Um documento em francês ou em alemão vai ser lido com o modelo que escolher, e o resultado será mau. Um documento com duas línguas misturadas lê-se pela que escolher, e a outra sai pior.
Não lê escrita à mão.
Isto reconhece letra impressa. Uma assinatura, uma nota manuscrita na margem ou um formulário preenchido à mão não são reconhecidos, e o que sair daí é ruído.
A camada de texto é uma aproximação.
As palavras ficam sobre as palavras da imagem, mas a caixa de selecção pode ficar ligeiramente desalinhada, sobretudo em letra muito pequena ou em páginas tortas. Isso não afecta a pesquisa: afecta o rectângulo que o leitor realça quando encontra a palavra.
Tabelas e colunas podem sair desordenadas.
O reconhecimento lê linhas de texto, não a estrutura da página. Um documento em duas colunas, ou uma tabela densa, sai muitas vezes com a ordem trocada no ficheiro .txt. No PDF pesquisável isso não se nota, porque cada palavra fica no sítio dela.
Perguntas sobre OCR de PDF.
Preciso de criar conta para usar o OCR?
Sim, esta é uma ferramenta Premium e é preciso subscrever e iniciar sessão.
Posso usar uma fotografia em vez de um PDF?
Pode. A ferramenta aceita PNG, JPEG e WebP, além de PDF. Uma fotografia direita e bem iluminada dá resultado; uma fotografia tirada de lado dá pouco.
O meu PDF já tem texto. Preciso de OCR?
Não. Se consegue seleccionar uma palavra no seu leitor de PDF, o texto já lá está: use antes o Extrair texto, que é imediato e não inventa nada. O OCR serve para os documentos onde não consegue seleccionar nada.
Que qualidade devo escolher?
A Normal serve a maior parte dos casos. A Alta ajuda em letra pequena ou em digitalizações fracas, e demora bastante mais. A Rápida serve para ver depressa se vale a pena tratar o documento.
Os meus ficheiros ficam guardados nos vossos servidores?
Não. Como nada é enviado, nada fica guardado fora do seu browser.
Ferramentas relacionadas
Um digitalizado
que não se pesquisa?
Abra a ferramenta e experimente. Sem instalar nada, sem enviar nada para lado nenhum.
Abrir o OCR