CanDoYa
SV

PDF till text

Körs helt i din webbläsare - inget laddas upp, ingen registrering.

Välj en digital PDF för att extrahera markerbar text.

Dela det här verktyget

Hur gör man PDF till text?

Använd det här verktyget för att extrahera den markerbara text som redan finns lagrad i en digital PDF, och kopiera den eller ladda ner en TXT-fil. Bearbetningen sker i din webbläsare, så dokumentet laddas inte upp. Skannade PDF:er som bara består av bilder kräver OCR, och det här verktyget gör inte OCR.

Så använder du verktyget

  1. 1Välj en digital PDF. Släpp en PDF i verktyget eller välj en från din enhet. För bästa resultat, kontrollera att du kan markera ord i din vanliga PDF-läsare.
  2. 2Extrahera textlagret. Klicka på Extrahera text. PDF.js läser varje sida lokalt och visar förloppet utan att skicka filen till en server.
  3. 3Granska ren text. Kontrollera stycken, kolumner, tabeller och symboler mot originalet. PDF:ens läsordning kan skilja sig från den visuella sidordningen.
  4. 4Kopiera eller ladda ner. Redigera resultatet vid behov, kopiera det till urklipp eller spara det som en UTF-8 TXT-fil.

Vem passar det för

Det här verktyget använder Mozilla PDF.js för att läsa varje sidas befintliga textlager på din enhet. Det behåller sidordningen och rapporterade radbrytningar och ger dig sedan ett redigerbart resultat i ren text. Bilder, typsnitt, kolumner, tabeller och visuell formatering bevaras inte i TXT-utdata.

Det finns en viktig gräns: en digital PDF innehåller tecken som programvara kan markera och söka i. En skanning kan bara innehålla ett foto av en sida. Att extrahera den första typen är texttolkning; att läsa den andra kräver optisk teckenigenkänning. Det här verktyget gör bara det första.

Vanliga frågor

Laddas mina PDF-filer upp till en server?

Nej. Din webbläsare läser den valda PDF-filen lokalt med PDF.js, och filen skickas inte till CanDoYa. Själva PDF-motorkoden kan hämtas när du använder verktyget första gången, men ditt dokument ingår inte i den förfrågan.

Är den här PDF till text-konverteraren gratis?

Ja. Du kan extrahera, redigera, kopiera och ladda ner text utan konto, vattenstämpel eller betalning. Arbetet körs på din enhet, så det finns ingen serverkö för konvertering och ingen uppladdad fil att hämta senare.

Vad är gränsen för PDF-storlek och antal sidor?

Verktyget accepterar en PDF på upp till 100 MB och 2 000 sidor. Tillgängligt minne och enhetshastighet kan ge en lägre praktisk gräns, särskilt på telefoner. Dela upp ett mycket stort dokument i mindre PDF:er om webbläsaren inte hinner klart.

Kan det här verktyget extrahera text från en skannad PDF?

Inte när skanningen bara innehåller sidbilder. Det här verktyget läser befintlig markerbar text och gör ingen OCR. En skannad PDF behöver ett OCR-verktyg som känner igen tecken från pixlar. Vissa blandade PDF:er innehåller markerbar text på vissa sidor men inte på andra; resultatet visar sidor utan text.

Varför hamnar den extraherade texten i fel ordning?

PDF-sidor placerar textfragment vid koordinater och kanske inte lagrar en tydlig ordning för stycken eller kolumner. PDF.js följer dokumentets textobjekt och radbrytningar, vilket kan skilja sig från den visuella läsordningen i flerkolumnslayouter, tabeller, sidhuvuden eller komplexa formulär.

Bevarar PDF till text formatering och bilder?

Nej. TXT-filer innehåller bara vanliga tecken, så typsnitt, färger, bilder, länkar, kolumner och tabellkanter bevaras inte. Radbrytningar kommer från PDF:ens textlager och kan behöva justeras efter extraheringen.

Varför nekas en lösenordsskyddad PDF?

Webbläsaren kan inte läsa ett krypterat dokument utan lösenordet. Öppna PDF:en i en betrodd läsare, ange lösenordet och spara en olåst kopia om du har behörighet. Lägg sedan till den kopian i verktyget.

Vilka språk kan extraheras ur en PDF?

Tolken är inte bunden till ett enda språk. Den kan returnera Unicode-text i vilket skriftsystem som helst när PDF:en innehåller en korrekt teckenkarta och markerbar text. Om dokumentet använder saknade eller egna fontmappningar kan kopierade tecken ändå bli ofullständiga eller felaktiga.