CanDoYa
LV

Attēls tekstā pārveidotājs

Darbojas tikai tavā pārlūkā - bez augšupielādes un reģistrācijas.

Sāciet ar attēlu, kurā skaidri redzams drukāts teksts.

Kopīgot šo rīku

Kā darbojas attēla tekstā pārveidotājs?

Attēla tekstā pārveidotājs izmanto optisko rakstzīmju atpazīšanu (OCR), lai noteiktu drukātas rakstzīmes fotoattēlā vai skenējumā un pārvērstu tās rediģējamā tekstā. Šis rīks izmanto Tesseract WebAssembly tieši jūsu pārlūkā, aptver valodas, kas lietotas visās 40 CanDoYa lokalizācijās, un ļauj kopēt vai lejupielādēt rezultātu, neaugšupielādējot oriģinālo attēlu.

Kā lietot

  1. 1Izvēlieties skaidru attēlu. Pievienojiet JPEG, PNG, WebP, BMP vai neanimētu GIF līdz 15 MB un 24 megapikseļiem vai ielādējiet iebūvēto piemēru.
  2. 2Norādiet teksta valodu. Izvēlieties valodu, kas tiešām redzama attēlā. Atbilstošie Tesseract valodas dati tiks lejupielādēti, sākot atpazīšanu.
  3. 3Atpazīstiet un pārbaudiet. Veiciet OCR, salīdziniet vārdus un skaitļus ar oriģinālu, izlabojiet kļūdas un kopējiet tekstu vai lejupielādējiet UTF-8 TXT failu.

Kam noder

Šis pārveidotājs izmanto Tesseract.js 7 - atvērtā koda Tesseract OCR dzinēja pārlūka versiju. Kods, WebAssembly kodols un izvēlētās valodas dati tiek ielādēti tikai pēc atpazīšanas sākuma. Tesseract atpazīšanu veic savā fonā strādājošā procesā, tāpēc lapa paliek atsaucīga, kamēr jūsu ierīce apstrādā attēlu.

OCR precizitāte vairāk atkarīga no paša attēla kvalitātes, nevis faila formāta. Labākus rezultātus dod taisns, vienmērīgi apgaismots, asi fokusēts un kontrastains drukāts teksts ar pietiekamu izšķirtspēju. Mazus ekrānattēlus var uzlabot, palielinot izšķirtspēju, bet šķībi skenējumi, dekoratīvi fonti, slejas, rokraksts, atspīdumi un izplūduši fotoattēli biežāk prasa manuālu labošanu pēc atpazīšanas.

Biežāk uzdotie jautājumi

Vai mans attēls tiek augšupielādēts serverī?

Nē. Izvēlētais fails tiek atvērts un atpazīts jūsu ierīcē ar Tesseract fonā strādājošo procesu. Pārlūks lejupielādē publiskus OCR dzinēja un valodas failus no ārējiem resursiem, taču šajos pieprasījumos jūsu attēls nav iekļauts. CanDoYa nesaņem un neglabā ne oriģinālo attēlu, ne atpazīto tekstu.

Vai attēla tekstā pārveidotājs ir bez maksas?

Jā. Nav nepieciešams konts, maksājums, ūdenszīme, lapu limits vai maksa par rezultāta lejupielādi. Apstrādi veic jūsu ierīce. Sākotnējā OCR dzinēja un valodas datu lejupielāde izmanto jūsu internetu, un lielāki valodas modeļi var būt nozīmīgi, ja pieslēgums ir ar datu apjoma ierobežojumu.

Kādi attēlu limiti un formāti tiek atbalstīti?

Var apstrādāt vienu JPEG, PNG, WebP, BMP vai neanimētu GIF līdz 15 MB un 24 megapikseļiem. Šie limiti palīdz izvairīties no atmiņas kļūdām telefonos un klēpjdatoros. Rīks paredzēts tikai attēliem - ja nepieciešams atpazīt pilnas PDF lapas, izmantojiet īpašu PDF OCR risinājumu.

Cik precīza ir OCR attēla tekstā pārveide?

Skaidru drukātu tekstu var atpazīt labi, taču garantijas nav. Asums, lieli burti, augsts kontrasts, taisna lapa un pareiza valoda uzlabo precizitāti. Rokraksts, neparasti fonti, atspīdumi, izplūdums, tabulas, slejas un jaukti lasīšanas virzieni var radīt kļūdas vai mainīt rindu secību.

Vai var atpazīt rokrakstu?

Var atpazīt ļoti skaidru, drukātam tekstam līdzīgu rokrakstu, bet šis Tesseract rīks paredzēts galvenokārt drukātam tekstam. Kursīvs un mainīgas formas burti ir daudz mazāk uzticami. Rokraksta rezultātu uzskatiet par melnrakstu un pārbaudiet katru svarīgu vārdu, datumu un skaitli ar oriģinālu.

Kādu teksta valodu jāizvēlas?

Izvēlieties valodu, kas lietota attēlā, nevis pārlūka valodu. Sarakstā ir visas valodas, kas lietotas 40 CanDoYa lokalizācijās, tostarp atsevišķi vienkāršotā un tradicionālā ķīniešu. Ja attēlā ir vairākas valodas, izvēlieties dominējošo - šī versija katrā reizē izmanto vienu atpazīšanas modeli.

Kāpēc pirmais atpazīšanas mēģinājums ir ilgāks?

Pārlūks vispirms lejupielādē Tesseract.js kodu, saderīgu WebAssembly kodolu un izvēlētās valodas apmācītos datus. Pārlūka kešatmiņa var paātrināt nākamos mēģinājumus, bet privātais režīms, kešatmiņas tīrīšana, jauna valoda vai kešatmiņas dzēšana var prasīt atkārtotu lejupielādi.

Vai var izmantot iegūto tekstu bez pārbaudes?

Pārskatiet to vispirms, īpaši vārdus, summas, datumus, pieturzīmes un līdzīgus simbolus, piemēram, O un 0 vai l un 1. Redzamā precizitāte ir vispārējs Tesseract novērtējums. Tā negarantē katru vārdu un nesaglabā precīzu izkārtojumu kā attēlā.