Como transformar fotografias num PDF pesquisável
- Adicione as suas imagens. Arraste fotografias em JPG, PNG ou WebP para a ferramenta, ou toque para as escolher. Cada página aparece como um cartão — arraste a pega para reordenar, ou remova as que não quer.
- Escolha o idioma. Escolha o idioma em que os documentos estão escritos. Os dados de reconhecimento para esse idioma são transferidos uma vez (o tamanho aparece junto ao seletor) — as suas imagens continuam a nunca sair do seu dispositivo.
- Reconhecer. Toque em Reconhecer texto e veja o cartão de cada página passar de à espera a concluída, com uma contagem de palavras em tempo real. Pode cancelar a meio; nada fica guardado.
- Verifique e transfira. O texto reconhecido é mostrado por página, para o poder verificar antes de confiar nele. Dê um nome ao ficheiro final e depois transfira o PDF pesquisável, obtenha o .txt simples ou copie tudo para a área de transferência.
O que faz
- OCR real no seu browser — os ficheiros nunca são enviados para lado nenhum
- Várias fotografias tornam-se um único PDF de várias páginas, na ordem que escolher
- Camada de texto invisível: o PDF parece a sua fotografia, mas é pesquisável e o texto pode ser copiado
- 15 idiomas de reconhecimento, transferidos quando necessário
- Também exporta o texto reconhecido em formato simples como ficheiro .txt
O que é, na prática, um PDF pesquisável
A fotografia de um recibo é apenas pixels — não pode pesquisá-la, selecionar o total ou copiar o nome do estabelecimento. Um PDF pesquisável acrescenta uma segunda camada, invisível, por cima da imagem: o texto reconhecido, posicionado onde aparece na fotografia. A página continua a parecer exatamente a sua fotografia, mas o Preview, o Adobe Reader, o Spotlight e qualquer sistema de documentos já a conseguem ler.
Esta ferramenta cria esse ficheiro no seu browser. Descodifica as suas imagens, executa o motor de reconhecimento de código aberto Tesseract compilado para WebAssembly, e monta um PDF com pdf-lib — tudo dentro da página que está a ver. Nada é transmitido. É esse o objetivo: recibos, contratos, cartas médicas e documentos de identificação são exatamente os ficheiros que não deve entregar a um site de conversão qualquer em troca de OCR grátis.
Quando usar
- Fotografias de documentos em papel que quer conseguir encontrar mais tarde — recibos, garantias, cartas, formulários.
- Digitalizações que saíram de um scanner como simples imagens.
- Qualquer coisa que não colaria num site desconhecido.
Porque a posição importa na camada de texto
As palavras reconhecidas não são apenas adicionadas ao ficheiro — cada uma é colocada de forma invisível nas coordenadas onde aparece na fotografia. É isso que faz a seleção parecer natural: arraste sobre a imagem e o destaque acompanha as linhas impressas, procure uma palavra e o visualizador salta para o local certo na página. A geometria é aproximada, tal como acontece em ficheiros produzidos por digitalizadores de escritório, e isso não é problema para encontrar e copiar texto.
Limitações, com franqueza
O OCR feito no dispositivo é mais lento do que um parque de servidores, e lê texto impresso, não escrita à mão. Texto muito pequeno ou desfocado pode sair errado — a exportação em .txt torna fácil verificar. As imagens são reduzidas para cerca de 2500 px no lado maior para agilizar o reconhecimento; a imagem incorporada na página mantém até 4000 px, o que imprime bem em tamanho A4.
Se faz isto com frequência
Esta ferramenta é um conversor pontual. Se o rolo de fotografias do seu telemóvel é onde os documentos desaparecem, é exatamente esse o problema que o Paperlock resolve: digitaliza, lê e arquiva os seus papéis no seu iPhone — com a mesma regra de que nada sai do seu dispositivo sem estar encriptado.