OCR för PDF

Välj en skannad PDF

Endast PDF · 20 MB · 40 sidor

eller släpp en PDF här

Använd verktyget när en PDF innehåller bilder av skannade sidor i stället för markerbar text. Sidorna renderas och läses med optisk teckenigenkänning (OCR) i webbläsaren. Därefter visas den identifierade texten så att du kan granska, kopiera eller spara den som en .txt-fil. Käll-PDF:en stannar på din enhet. Verktyget skapar inte en sökbar PDF och bevarar inte sidlayouten. OCR-resultatet kan dessutom innehålla fel.

Så hämtar du text från en skannad PDF

  1. 1

    Välj dokumentets språk

    Välj huvudspråket i den tryckta texten. Valet avgör vilken OCR-modell webbläsaren använder.

  2. 2

    Öppna PDF-filen

    Välj en PDF på högst 20 MB och 40 sidor. Källfilen stannar i webbläsaren och skickas inte till vår server.

  3. 3

    Vänta på textigenkänningen

    Webbläsaren renderar varje sida och läser den med vald OCR-modell. Modellfilerna kan behöva hämtas innan igenkänningen startar.

  4. 4

    Kontrollera resultatet

    Jämför namn, siffror och viktiga avsnitt med originalsidorna. OCR är ett hjälpmedel, inte en tillförlitlig avskrift för kritiska ändamål.

  5. 5

    Kopiera eller hämta texten

    Kopiering och lokal TXT-hämtning håller resultatet i webbläsaren. Bara den valfria hämtningssidan överför den härledda textfilen till en skyddad länk.

Det här skapar verktyget

Resultatet är oformaterad text med en sidmarkör före den identifierade texten från varje sida. Verktyget:

  • lägger inte till ett dolt textlager i PDF-filen
  • återskapar inte spalter, tabeller, formulär eller originalets typografi
  • bevarar inte sidans visuella layout
  • översätter inte dokumentet
  • kontrollerar inte att den identifierade texten är korrekt

Om du behöver behålla de skannade sidorna och lägga sökbar text bakom dem ska du använda ett särskilt program för sökbara PDF-filer eller ett OCR-program för datorn.

Dokument som fungerar bäst

OCR är avsett för tryckt text. En rak, skarp skanning med tydlig kontrast är lättare att känna igen än ett suddigt foto, ett blekt fax eller en skadad sida. Dekorativa typsnitt, handskrift, matematisk notation, tätt placerade spalter och komplicerade tabeller kan ge bristfällig eller felordnad text.

Verktyget tar emot PDF-filer på högst 20 MB och 40 sidor. Igenkänningen sker sida för sida och kan använda mycket minne, särskilt för stora eller högupplösta sidor. Om webbläsarens minne inte räcker till kan du dela PDF-filen i mindre delar och behandla dem var för sig.

OCR-språk som stöds

Du kan välja engelska, spanska, franska, tyska, italienska, portugisiska, nederländska, ryska, japanska, förenklad kinesiska, koreanska eller arabiska.

Välj dokumentets huvudspråk innan du öppnar filen. En sida som blandar språk eller skriftsystem kan behöva behandlas flera gånger, och snarlika tecken kan ändå förväxlas.

Granska den identifierade texten

Jämför alltid resultatet med original-PDF:en innan du använder det. Var särskilt uppmärksam på:

  • namn, adresser och identifikationsnummer
  • datum, belopp, decimaltecken och minustecken
  • juridiska, medicinska, ekonomiska eller säkerhetsrelaterade instruktioner
  • sidbrytningar och läsordning i dokument med flera spalter

Behandla inte OCR-resultatet som en auktoritativ kopia av ett viktigt dokument.

Filhantering och hämtningar

Käll-PDF:en läses lokalt i webbläsaren. Den placeras inte i trattens webbadress och skickas inte till vår server. Webbläsaren kan hämta biblioteken för PDF-rendering och OCR samt vald språkmodell från den konfigurerade biblioteksleverantören.

Kopiering håller den identifierade texten i webbläsaren och skriver den till urklipp. Hämta TXT lokalt skapar och sparar .txt-filen utan att överföra den. Endast om du väljer Skapa en hämtningssida överförs den härledda TXT-filen för att skapa en skyddad länk, där filen kan sparas i upp till 7 dagar. Den lokala hämtningen är fortfarande tillgänglig om den valfria överföringen misslyckas.

Vanliga frågor

Nej. Käll-PDF:en stannar i webbläsaren medan sidorna renderas och känns igen. Webbläsaren kan hämta nödvändiga bibliotek och vald språkmodell. Den lokala hämtningen överför inte heller texten; bara den valfria hämtningssidan överför den härledda TXT-filen.

Nej. Resultatet är oformaterad text grupperad efter sida. Verktyget ändrar inte original-PDF:en, lägger inte till ett dolt textlager och bevarar inte layouten.

Du bör jämföra det med originalsidorna. OCR kan förväxla tecken, utelämna text och ändra läsordningen. Kontrollera varje detalj innan resultatet används för juridiskt, medicinskt, ekonomiskt, säkerhetsrelaterat eller annat kritiskt arbete.

Det är utformat för tryckt text. Handskrift, ekvationer och dekorativa typsnitt kan ge otillförlitliga resultat. Tecken i en tabell kan kännas igen, men rad- och kolumnstrukturen bevaras inte i den oformaterade texten.

Engelska, spanska, franska, tyska, italienska, portugisiska, nederländska, ryska, japanska, förenklad kinesiska, koreanska och arabiska. Välj huvudspråk innan du öppnar PDF-filen.

PDF-filen får vara högst 20 MB och 40 sidor. Stora eller detaljrika sidor kan ändå överskrida webbläsarens tillgängliga minne; dela då dokumentet i mindre filer.

Hämta TXT lokalt skapar .txt-filen och sparar den direkt på enheten utan överföring. Om du skapar en hämtningssida överförs endast denna härledda TXT-fil till en skyddad länk och kan sparas där i upp till 7 dagar.

Relaterade verktyg

Verktyget finns på andra språk