OCR de PDF escaneado
Un PDF escaneado es un montón de fotografías: no se busca, no se copia, no se selecciona una línea. El OCR lee lo que hay en esas imágenes y devuelve el mismo documento con una capa de texto invisible encima o, si lo prefieres, solo el texto en bruto en un archivo .txt. Todo funciona en tu navegador: el escaneado nunca sale del ordenador, algo raro en una herramienta de OCR.
Tres pasos, sin instalar nada.
Todo el trabajo ocurre en tu ordenador, de principio a fin.
Elegir el archivo
Arrastra el PDF escaneado a la ventana de la herramienta, o una imagen de un documento.
Elegir el idioma
Portugués, inglés o español. Es el idioma del documento, no el de la interfaz, y elegir mal empeora mucho el resultado.
Descargar el resultado
Un PDF con búsqueda y las páginas originales, o el texto en bruto en .txt.
¿Qué es exactamente un PDF con búsqueda?
Es el documento original, con las páginas tal cual estaban, más una capa de texto encima que el lector no dibuja. No se ve nada nuevo en la página, pero la búsqueda del lector de PDF encuentra las palabras, el ratón selecciona líneas y copiar y pegar funciona. Es también así como los buscadores y los archivos internos empiezan a encontrar el documento.
¿Mis documentos se envían a algún servidor?
No, y aquí eso importa más que en cualquier otra herramienta. El reconocimiento de texto es el servicio que más a menudo obliga a subir el archivo a una máquina ajena, y un escaneado suele ser justo lo que no quieres subir: un contrato, un recibo, una carta del médico. Aquí el motor de reconocimiento se descarga a tu navegador y trabaja en tu máquina.
¿Por qué la primera vez tarda más?
Porque la primera vez el navegador descarga el motor de reconocimiento y el modelo del idioma elegido, que juntos son varios megabytes. Luego queda guardado en el navegador: las siguientes veces arranca al momento. Si cambias de idioma, descarga el modelo de ese idioma, y solo ese.
¿Cuánto tarda un documento?
Depende de la máquina y de la calidad elegida, pero cuenta con unos segundos por página. La herramienta muestra el progreso página a página, para que veas que avanza. Los documentos largos tardan de verdad: es el precio de leer letra a letra.
El resultado es tan bueno como el escaneado.
Una página recta, con buena luz y resolución decente se lee casi entera bien. Una fotografía torcida, con sombra en medio, o escaneada a baja resolución, da texto con errores, y a veces muchos. Si puedes repetir el escaneado, hazlo: rinde más que cualquier opción de esta herramienta.
Solo reconoce los tres idiomas de los que tiene modelo.
Portugués, inglés y español. Un documento en francés o en alemán se leerá con el modelo que elijas, y el resultado será malo. Un documento con dos idiomas mezclados se lee con el que elijas, y el otro sale peor.
No lee escritura a mano.
Esto reconoce letra impresa. Una firma, una nota manuscrita al margen o un formulario rellenado a mano no se reconocen, y lo que salga de ahí es ruido.
La capa de texto es una aproximación.
Las palabras quedan sobre las palabras de la imagen, pero el recuadro de selección puede quedar algo desalineado, sobre todo con letra muy pequeña o en páginas torcidas. Eso no afecta a la búsqueda: afecta al rectángulo que el lector resalta cuando encuentra la palabra.
Las tablas y las columnas pueden salir desordenadas.
El reconocimiento lee líneas de texto, no la estructura de la página. Un documento a dos columnas, o una tabla densa, sale muchas veces con el orden cambiado en el archivo .txt. En el PDF con búsqueda eso no se nota, porque cada palabra queda en su sitio.
Preguntas sobre el OCR de PDF.
¿Necesito cuenta para usar el OCR?
Sí, esta es una herramienta Premium y hace falta suscribirse e iniciar sesión.
¿Puedo usar una fotografía en vez de un PDF?
Sí. La herramienta acepta PNG, JPEG y WebP, además de PDF. Una fotografía recta y bien iluminada da resultado; una torcida da poco.
Mi PDF ya tiene texto. ¿Necesito OCR?
No. Si puedes seleccionar una palabra en tu lector de PDF, el texto ya está ahí: usa mejor Extraer texto, que es inmediato y no inventa nada. El OCR sirve para los documentos donde no puedes seleccionar nada.
¿Qué calidad debo elegir?
La Normal sirve para la mayoría de los casos. La Alta ayuda con letra pequeña o escaneados flojos, y tarda bastante más. La Rápida sirve para ver deprisa si merece la pena tratar el documento.
¿Mis archivos quedan guardados en vuestros servidores?
No. Como nada se envía, nada queda guardado fuera de tu navegador.
Herramientas relacionadas
¿Un escaneado
que no se puede buscar?
Abre la herramienta y pruébala. Sin instalar nada, sin enviar nada a ningún sitio.
Abrir el OCR