CanDoYa
PT-PT

Imagem para Texto

Funciona inteiramente no navegador - sem carregar nada, sem registo.

Escolhe uma imagem nítida com texto para começar.

Partilhe esta ferramenta

Como funciona um conversor de imagem para texto?

Um conversor de imagem para texto utiliza reconhecimento ótico de caracteres (OCR) para identificar texto impresso numa fotografia ou digitalização e devolver texto editável. Este serviço executa o Tesseract WebAssembly diretamente no teu navegador, cobre as línguas usadas em todos os 40 mercados CanDoYa e permite copiar ou descarregar o resultado sem enviar a imagem original.

Como utilizar

  1. 1Escolhe uma imagem nítida. Arrasta um ficheiro JPEG, PNG, WebP, BMP ou GIF estático até 15 MB e 24 megapíxeis, ou usa o exemplo incluído.
  2. 2Seleciona o idioma do texto. Escolhe o idioma realmente impresso na imagem. Os dados correspondentes do Tesseract são descarregados ao iniciar a extração.
  3. 3Extrai e confirma. Executa o OCR, compara nomes e números com a imagem original, corrige eventuais erros e copia ou descarrega o texto em ficheiro TXT UTF-8.

Para quem é

Este conversor utiliza o Tesseract.js 7, uma versão para navegador do motor open-source Tesseract OCR. O código, o núcleo WebAssembly e os dados do idioma escolhido só são carregados quando inicias a extração. O reconhecimento é feito num processo em segundo plano, mantendo a página responsiva enquanto o teu dispositivo processa a imagem.

A precisão do OCR depende mais da qualidade da imagem do que do formato do ficheiro. Texto impresso na vertical, iluminação uniforme, foco nítido, contraste forte e boa resolução ajudam a obter melhores resultados. Capturas pequenas podem beneficiar de ampliação, enquanto páginas inclinadas, fontes decorativas, colunas, manuscritos, reflexos ou fotos desfocadas podem exigir correção manual.

Perguntas frequentes

A minha imagem é enviada para um servidor?

Não. O ficheiro é processado localmente por um processo em segundo plano do Tesseract no teu navegador. O navegador descarrega ficheiros públicos do motor OCR e dos idiomas a partir de servidores externos, mas esses pedidos não incluem a tua imagem. A CanDoYa não recebe nem armazena a imagem original nem o texto extraído.

Este conversor de imagem para texto é gratuito?

Sim. Não exige conta, pagamento, marcas de água, créditos de página ou taxas para descarregar resultados. O processamento é feito no teu dispositivo. O download inicial do motor OCR e dos dados de idioma utiliza a tua ligação à internet, e modelos de idioma maiores podem ter impacto em ligações limitadas.

Que formatos e limites de imagem são suportados?

Podes processar um ficheiro JPEG, PNG, WebP, BMP ou GIF estático até 15 MB e 24 megapíxeis. Estes limites ajudam a evitar falhas de memória em telemóveis e portáteis. Só processa imagens; para reconhecer páginas PDF completas, usa uma ferramenta OCR dedicada para PDF digitalizado.

Quão precisa é a conversão de imagem para texto por OCR?

Texto impresso limpo pode ser reconhecido com boa precisão, mas nenhum resultado de OCR é garantido. Foco nítido, letras grandes, contraste forte, página direita e idioma correto melhoram a precisão. Manuscritos, fontes invulgares, reflexos, desfocagem, tabelas, colunas e direções de leitura mistas podem causar erros ou linhas trocadas.

Consegue extrair notas manuscritas?

Pode reconhecer letra de imprensa muito clara, mas esta ferramenta baseada em Tesseract foi desenhada principalmente para texto impresso. Escrita cursiva e letras irregulares são muito menos fiáveis. Considera o resultado de manuscritos como rascunho e compara sempre cada palavra, data e número com a imagem original.

Que idioma devo escolher?

Escolhe o idioma usado nas letras da imagem, não o idioma do navegador. A lista cobre os idiomas usados nos 40 mercados CanDoYa, incluindo chinês simplificado e tradicional em separado. Se a página tiver vários idiomas, seleciona o dominante; esta versão carrega um modelo de reconhecimento por extração.

Porque demora mais na primeira extração?

O navegador precisa de carregar o código Tesseract.js, o núcleo WebAssembly e os dados treinados do idioma selecionado. A cache do navegador pode acelerar utilizações seguintes, mas modo privado, limpeza de armazenamento, novo idioma ou eliminação da cache podem obrigar a novo download.

Posso usar o texto extraído sem rever?

Deves rever primeiro, especialmente nomes, valores, datas, pontuação e caracteres semelhantes como O e 0 ou l e 1. A confiança apresentada é uma estimativa geral do Tesseract. Não certifica cada palavra nem preserva o layout visual do original.