CanDoYa
FI

Kuva tekstiksi -muunnin

Toimii kokonaan selaimessasi - ei lähetyksiä, ei rekisteröitymistä.

Valitse kuva, jossa on selkeä painettu teksti, aloittaaksesi.

Jaa tämä työkalu

Miten kuva tekstiksi -muunnin toimii?

Kuva tekstiksi -muunnin hyödyntää optista tekstintunnistusta (OCR) löytääkseen kuvasta painetut merkit ja palauttaa muokattavan tekstin. Tämä työkalu käyttää Tesseract WebAssemblyä selaimessasi, kattaa kaikkien 40 CanDoYa-alueen kielten käytössä olevat kielet ja mahdollistaa tuloksen kopioinnin tai lataamisen ilman, että lähdekuvaa lähetetään laitteeltasi.

Näin se toimii

  1. 1Valitse selkeä kuva. Pudota JPEG-, PNG-, WebP-, BMP- tai ei-animoitu GIF-tiedosto (enintään 15 Mt ja 24 megapikseliä) tai lataa esimerkkikuva.
  2. 2Valitse tekstin kieli. Valitse kieli, jolla teksti on painettu kuvaan. Sopiva Tesseract-kielimalli ladataan, kun tunnistus käynnistyy.
  3. 3Tunnista ja tarkista. Suorita OCR, vertaa nimet ja numerot alkuperäiseen, korjaa mahdolliset virheet ja kopioi teksti tai lataa se UTF-8 TXT -tiedostona.

Kenelle

Tämä muunnin käyttää Tesseract.js 7:ää, selainversiota avoimen lähdekoodin Tesseract OCR -moottorista. Koodi, WebAssembly-ydin ja valittu kielimalli ladataan vasta, kun käynnistät tekstintunnistuksen. Tesseract suorittaa tunnistuksen omassa taustaprosessissaan, joten sivu pysyy käytettävänä samalla kun laitteesi käsittelee kuvaa.

OCR:n tarkkuus riippuu enemmän lähdekuvan laadusta kuin tiedostomuodosta. Selkeä painettu teksti, tasainen valaistus, tarkka kuva, hyvä kontrasti ja riittävä pikselimäärä parantavat tulosta. Pieniä kuvakaappauksia voi parantaa suurentamalla, kun taas vino asettelu, koristeelliset fontit, sarakkeet, käsiala, heijastukset ja epätarkat kamerakuvat vaativat usein manuaalista korjausta.

Usein kysyttyä

Lähetetäänkö kuva palvelimelle?

Ei. Valittu tiedosto puretaan ja tunnistetaan laitteellasi Tesseractin taustaprosessissa. Selain lataa julkiset OCR-moottorin ja kielimallien tiedostot ulkoisilta palvelimilta, mutta näihin pyyntöihin ei sisälly kuvaasi. CanDoYa ei saa eikä tallenna lähdekuvaa tai poimittua tekstiä.

Onko tämä kuva tekstiksi -muunnin ilmainen?

Kyllä. Käyttö ei vaadi tiliä, maksua, vesileimaa, sivukohtaisia rajoja tai latausmaksuja. Laitteesi suorittaa tunnistuksen. OCR-moottorin ja kielimallin lataus käyttää internet-yhteyttä, ja suuret kielimallit voivat vaikuttaa mobiilidatan kulutukseen.

Mitkä kuva­muodot ja rajat käyvät?

Voit käsitellä yhden JPEG-, PNG-, WebP-, BMP- tai ei-animoidun GIF-kuvan (enintään 15 Mt ja 24 megapikseliä). Nämä rajat vähentävät muistivirheitä erityisesti puhelimilla ja kannettavilla. Työkalu tukee vain kuvia - käytä erillistä PDF-OCR-työkalua, jos haluat tunnistaa kokonaisia PDF-sivuja.

Kuinka tarkkaa kuvan tekstintunnistus on?

Selkeä painettu teksti tunnistuu yleensä hyvin, mutta mikään OCR-tulos ei ole taattu. Tarkka, isokokoinen, kontrastikas ja suorassa oleva teksti sekä oikea kielivalinta parantavat tarkkuutta. Käsiala, erikoisfontit, heijastukset, epätarkkuus, taulukot, sarakkeet ja sekakieliset sivut voivat aiheuttaa virheitä tai rivien järjestyksen vaihtumista.

Voiko kuvasta poimia käsinkirjoitettua tekstiä?

Hyvin selkeä tikkukirjoitettu käsiala voi tunnistua, mutta tämä Tesseract-pohjainen työkalu on tarkoitettu pääasiassa painetulle tekstille. Kaunokirjoitus ja vaihtelevat kirjainmuodot ovat epäluotettavia. Käsinkirjoitetun tuloksen kohdalla tarkista kaikki tärkeät sanat, päivämäärät ja numerot alkuperäisestä kuvasta.

Mikä tekstin kieli pitää valita?

Valitse kieli, jolla teksti on kuvassa, ei selaimesi kieli. Lista kattaa kaikki kielet, joita käytetään 40 CanDoYa-alueella, mukaan lukien erikseen yksinkertaistettu ja perinteinen kiina. Jos sivulla on useita kieliä, valitse pääkieli - tässä versiossa käytetään yhtä kielimallia kerrallaan.

Miksi ensimmäinen tunnistus kestää kauemmin?

Selain lataa ensin Tesseract.js-ohjelmakoodin, yhteensopivan WebAssembly-ytimen ja valitun kielimallin. Selaimen välimuisti nopeuttaa seuraavia kertoja, mutta yksityinen tila, tallennuksen tyhjennys, uusi kieli tai välimuistin tyhjennys voi vaatia uuden latauksen.

Voiko poimittua tekstiä käyttää ilman tarkistusta?

Tarkista ensin, erityisesti nimet, summat, päivämäärät, välimerkit ja helposti sekoittuvat merkit kuten O ja 0 tai l ja 1. Näytetty luottamusprosentti on Tesseractin yleisarvio. Se ei takaa jokaisen sanan oikeellisuutta eikä säilytä alkuperäistä asettelua.