PDF till HTML-omvandlare

Markdown-indata
Nästa

Den här omvandlaren läser texten i din PDF och packar in den i en ren, minimal HTML-fil: en <section> per sida, en <h2>-sidrubrik och <p>-stycken. Den körs helt i din webbläsare med PDF.js, så filen laddas aldrig upp. Resultatet är enkel HTML med enbart text som du kan öppna, redigera eller klistra in i ett CMS och sedan formge med din egen CSS. Den är byggd för att få texten i en PDF på webben, inte för att återskapa en formgiven sida.

Så omvandlar du PDF till HTML

  1. 1

    Välj din PDF

    Släpp en textbaserad PDF i rutan eller klicka för att bläddra. Allt stannar i din webbläsare.

  2. 2

    Omvandla till HTML

    PDF.js läser varje sida och extraherar dess text, och grupperar rader till stycken.

  3. 3

    Granska HTML-koden

    Den genererade koden visas i en förhandsgranskningsruta så att du kan kontrollera resultatet.

  4. 4

    Ladda ner filen

    Spara en enda `.html`-fil med ett avsnitt per sida, redo att redigeras eller formges om.

Så ser utdata ut

Omvandlaren skapar en giltig HTML5-fil med en minimal struktur:

Element Var det kommer ifrån
<!DOCTYPE html>-stomme Ett standardmässigt HTML5-hölje med teckenuppsättningen UTF-8
<title> Filnamnet på din PDF
<section data-page> Ett block per PDF-sida
<h2>Sida N</h2> En rubrik som markerar början på varje sida
<p> Textrader grupperade till stycken efter det vertikala mellanrummet

Vad den inte gör

Det här är ett verktyg för textutvinning, inte en layoutmotor. Med avsikt innehåller utdata inte:

  • Bilder, logotyper eller figurer från PDF-filen.
  • Tabeller, punktlistor eller numrerade listor som HTML-<table>/<ul>/<ol>.
  • Ursprungliga typsnitt, färger, kolumner eller positionering.
  • Någon CSS eller inline-stil.

Du får orden i läsordning, inpackade i semantiska stycken, och inget mer. Lägg till din egen CSS efteråt.

Bästa resultat

  • Använd en textbaserad PDF (en där du kan markera text i en läsare). Inskannade eller rena bild-PDF:er saknar textlager; det finns ingen OCR här, så utdata blir tom för de sidorna.
  • Kör filen genom prettier --parser html eller ett formateringsverktyg för att städa upp mellanrummen innan du checkar in den.
  • Ska den till WordPress? Klistra in HTML-koden i kod-/HTML-blocket, inte i den visuella redigeraren, som skulle packa om den.

Inte ett layoutverktyg

Förvänta dig inte att HTML-koden ser ut som PDF-filen. Webben är flytande, en PDF-sida är fast. Använd verktyget när du vill ha innehållet på webben och formge det sedan om med din egen webbplats CSS.

Vanliga frågor

Nej. Verktyget extraherar texten och placerar den i enkla stycken. Typsnitt, färger, kolumner och positionering återskapas inte. Formge utdata med din egen CSS.

Nej. Endast texten extraheras. Bilder, logotyper och figurer förs inte över till HTML.

Endast om PDF-filen har ett riktigt textlager. Inskannade eller fotograferade sidor är bilder utan markerbar text, och det finns ingen OCR här, så de sidorna ger ingen text.

Nej. Hela omvandlingen körs i din webbläsare med PDF.js. PDF-filen lämnar aldrig din enhet, så den är säker för konfidentiella dokument.

Relaterade verktyg

Verktyget finns på andra språk