CanDoYa
PT-PT

PDF para Texto

Funciona inteiramente no navegador - sem carregar nada, sem registo.

Escolhe um PDF digital para extrair o texto selecionável.

Partilhe esta ferramenta

Como converter PDF para texto?

Usa este conversor PDF para texto para extrair o texto selecionável que já está guardado num PDF digital e depois copia-o ou descarrega um ficheiro TXT. O processamento corre no teu navegador, por isso o documento não é carregado para nenhum servidor. PDFs digitalizados, com imagens apenas, precisam de OCR, e esta ferramenta específica não faz OCR.

Como utilizar

  1. 1Escolhe um PDF digital. Arrasta um único PDF para a ferramenta ou seleciona-o no teu dispositivo. Para melhores resultados, confirma que consegues selecionar palavras no teu visualizador de PDF habitual.
  2. 2Extrai a camada de texto. Clica em Extrair texto. O PDF.js lê cada página localmente e mostra o progresso sem enviar o ficheiro para um servidor.
  3. 3Revê o texto simples. Confirma parágrafos, colunas, tabelas e símbolos em relação ao original. A ordem de leitura no PDF pode ser diferente da ordem visual da página.
  4. 4Copia ou descarrega. Edita o resultado se necessário, copia-o para a área de transferência ou guarda-o como ficheiro TXT em UTF-8.

Para quem é

Este conversor usa Mozilla PDF.js para ler a camada de texto existente de cada página no teu dispositivo. Mantém a ordem das páginas e as quebras de linha reportadas, e devolve um resultado em texto simples que podes editar. Imagens, tipos de letra, colunas, tabelas e formatação visual não são preservados no ficheiro TXT.

Há uma fronteira importante: um PDF digital guarda caracteres que o software consegue selecionar e pesquisar. Uma digitalização pode guardar apenas a fotografia de uma página. Extrair o primeiro tipo é análise de texto; ler o segundo exige OCR - reconhecimento ótico de caracteres. Esta ferramenta faz apenas a primeira parte.

Perguntas frequentes

Os meus ficheiros PDF são enviados para um servidor?

Não. O teu navegador lê o PDF selecionado localmente com PDF.js, e o ficheiro não é enviado para a CanDoYa. O código do motor PDF pode descarregar quando usas a ferramenta pela primeira vez, mas o teu documento não faz parte desse pedido.

Este conversor PDF para texto é gratuito?

Sim. Podes extrair, editar, copiar e descarregar texto sem conta, marca de água ou pagamento. O trabalho corre no teu dispositivo, por isso não há fila de conversão num servidor nem ficheiro carregado que tenhas de ir recuperar mais tarde.

Quais são os limites de tamanho e de páginas do PDF?

A ferramenta aceita um PDF até 100 MB e 2.000 páginas. A memória disponível e a velocidade do dispositivo podem impor um limite prático mais baixo, sobretudo em telemóveis. Divide um documento muito grande em PDFs mais pequenos se o navegador não conseguir terminar.

Esta ferramenta consegue extrair texto de um PDF digitalizado?

Não quando a digitalização contém apenas imagens das páginas. Este conversor lê texto selecionável existente e não faz OCR. Um PDF digitalizado precisa de uma ferramenta OCR que reconheça caracteres a partir de píxeis. Alguns PDFs mistos têm texto selecionável em certas páginas mas não em outras; o resultado assinala páginas sem texto.

Porque é que o texto extraído fica com a ordem errada?

As páginas PDF posicionam fragmentos de texto em coordenadas e podem não guardar uma ordem clara de parágrafos ou colunas. O PDF.js segue os itens de texto e as quebras de linha do documento, o que pode diferir da ordem visual de leitura em esquemas com várias colunas, tabelas, cabeçalhos ou formulários complexos.

O PDF para texto preserva formatação e imagens?

Não. Os ficheiros TXT contêm apenas caracteres simples, por isso tipos de letra, cores, imagens, hiperligações, colunas e contornos de tabelas não são preservados. As quebras de linha vêm da camada de texto do PDF e podem precisar de edição depois da extração.

Porque é que um PDF protegido por palavra-passe é rejeitado?

O navegador não consegue ler um documento encriptado sem a respetiva palavra-passe. Abre o PDF num visualizador de confiança, introduz a palavra-passe e guarda uma cópia desbloqueada, se tiveres permissão. Depois adiciona essa cópia ao conversor.

Que idiomas podem ser extraídos de um PDF?

O analisador não está limitado a um só idioma. Pode devolver texto Unicode em qualquer escrita quando o PDF contém um mapa de caracteres correto e texto selecionável. Se um documento usar mapeamentos de fontes em falta ou personalizados, os caracteres copiados podem continuar incompletos ou incorretos.