CanDoYa
ET

Pildilt tekstiks konverter

Töötab täielikult sinu brauseris - midagi ei laadita üles, kontot pole vaja.

Alustamiseks vali pilt, millel on selge trükitud tekst.

Jaga seda tööriista

Kuidas töötab pildilt tekstiks konverter?

Pildilt tekstiks konverter kasutab optilist märgituvastust (OCR), et tuvastada fotol või skannil trükitud tähemärgid ja muuta need redigeeritavaks tekstiks. See tööriist käitab Tesseract WebAssemblyt otse sinu brauseris, katab keeled, mida kasutatakse kõigis 40 CanDoYa lokaadis, ning võimaldab tulemust kohe kopeerida või alla laadida - lähtepilt jääb sinu seadmesse.

Kuidas kasutada

  1. 1Vali selge pilt. Lohista JPEG, PNG, WebP, BMP või mitteanimeeritud GIF kuni 15 MB ja 24 megapikslit või kasuta sisseehitatud näidist.
  2. 2Vali teksti keel. Vali keel, milles tekst pildil on trükitud. Vastav Tesseract keeleandmestik laaditakse alla, kui alustad tuvastust.
  3. 3Ekstrakti ja kontrolli. Käivita OCR, võrdle nimesid ja numbreid originaaliga, paranda vajadusel vead ning kopeeri tekst või laadi see alla UTF-8 TXT-failina.

Kellele see sobib

See konverter kasutab Tesseract.js 7, mis on avatud lähtekoodiga Tesseract OCR mootori brauseriversioon. Kood, WebAssembly tuum ja valitud keeleandmed laaditakse alles siis, kui alustad tekstituvastust. Tesseract töötab oma taustaprotsessis, nii et leht jääb kasutatavaks, kuni sinu seade pilti töötleb.

OCR-i täpsus sõltub rohkem algpildi kvaliteedist kui failiformaadist. Parima tulemuse annab sirge, selge, hästi valgustatud ja kontrastne trükitud tekst, mis on terav ja piisava detailsusega. Väikseid ekraanipilte võib aidata suurendamine, samas kui viltused lehed, dekoratiivsed fondid, veerud, käsikiri, peegeldused ja udused fotod vajavad sageli käsitsi parandamist.

Korduvad küsimused

Kas mu pilt saadetakse serverisse?

Ei. Valitud fail dekodeeritakse ja tuvastatakse ainult sinu seadmes Tesseracti taustaprotsessis. Brauser laadib avalikest allikatest OCR-i mootori ja keelefailid, kuid nende päringutega sinu pilti ei saadeta. CanDoYa ei saa ega salvesta lähtepilti ega tuvastatud teksti.

Kas see pildilt tekstiks konverter on tasuta?

Jah. Kontot, makset, vesimärki ega tulemuse allalaadimise tasu pole. Kogu töö teeb sinu seade. Esmane OCR-i ja keelefaili allalaadimine kasutab sinu internetiühendust ning suuremad keelemudelid võivad olla olulised piiratud ühenduse korral.

Millised on pildi piirangud ja failitüübid?

Töödelda saab ühte JPEG, PNG, WebP, BMP või mitteanimeeritud GIF pilti kuni 15 MB ja 24 megapikslit. Need piirangud aitavad vältida mälutõrkeid telefonides ja sülearvutites. Tööriist töötab ainult piltidega - kui vajad PDF-i lehtede tuvastust, kasuta spetsiaalset PDF OCR-i.

Kui täpne on OCR pildilt tekstiks teisendamisel?

Selge trükitud tekst tuvastatakse tavaliselt hästi, kuid täielikku täpsust ei saa garanteerida. Terav fookus, suured tähed, tugev kontrast, sirge leht ja õige keelevalik parandavad tulemust. Käsikiri, ebatavalised fondid, peegeldused, udusus, tabelid, veerud ja segatud lugemissuunad võivad põhjustada vigu või ridade ümberpaigutusi.

Kas saab tuvastada käsitsi kirjutatud märkmeid?

Väga selge trükitähestikus käsikiri võib osaliselt tuvastuda, kuid see Tesseractil põhinev tööriist on mõeldud eelkõige trükitud tekstile. Voolkirja ja ebakorrapäraseid tähti ei pruugi õigesti tuvastada. Käsikirja tulemusi tuleks alati originaaliga hoolikalt võrrelda.

Millise keele peaksin valima?

Vali keel, milles pildi tekst on, mitte brauseri keel. Loend katab kõik keeled, mida kasutatakse kõigis 40 CanDoYa lokaadis, sh lihtsustatud ja traditsiooniline hiina keel eraldi. Kui pildil on mitu keelt, vali neist peamine; korraga kasutatakse üht keelemudelit.

Miks esimene tuvastus võtab kauem?

Brauser peab esmalt laadima Tesseract.js koodi, sobiva WebAssembly tuuma ja valitud keele treeningandmed. Brauseri vahemälu võib muuta järgmised korrad kiiremaks, kuid privaatrežiim, vahemälu tühjendamine, uue keele valik või vahemälu kustutamine võib põhjustada uue allalaadimise.

Kas saan tuvastatud teksti kohe kasutada?

Vaata tulemus alati üle, eriti nimed, summad, kuupäevad, kirjavahemärgid ja sarnased tähed nagu O ja 0 või l ja 1. Näidatud täpsusprotsent on Tesseracti üldine hinnang. See ei kinnita iga sõna ega säilita algset kujundust.