HTML till textomvandlare

E-post i vanlig text, textanalys och verktyg för ordräkning kräver alla att HTML omvandlas till den läsbara sträng en människa faktiskt ser, utan några markupartefakter. Klistra in HTML så tar det här verktyget bort alla taggar, avkodar entiteter (&&), slår samman sekvenser av blanksteg som uppstått av indrag och genererar ett rent, lättläst textblock som är klart för analys eller för text/plain-delen i ett flerdelat e-postmeddelande.

Så här extraherar du HTML till text

  1. 1

    Klistra in HTML

    Valfri storlek – ett kodavsnitt, ett formaterat e-postinnehåll eller en hel sida.

  2. 2

    Konvertera

    Ett klick: alla taggar och attribut tas bort och entiteter avkodas.

  3. 3

    Kontrollera radbrytningarna

    Stycken, listpunkter och tabellrader blir separata rader, så att texten behåller sin struktur.

  4. 4

    Kopiera texten

    Utdata är ren Unicode-text som tryggt kan matas till en ordräknare, en e-postmall eller en sentimentmodell.

Hur konverteringen hanterar komplexa taggar

Att omvandla HTML till text är mer än bara string.replace(/<[^>]+>/, ""): en naiv regex lämnar entitetskoder och indragsmellanslag kvar och vet inte att </p> bör inleda en ny rad.

Blocktaggar kontra inline-taggar

Taggar på blocknivå (<br>, och avslutande taggar </p>, </div>, </h1> till </h6>, </li>, </tr>) skapar var och en en radbrytning. Inline-taggar (<a>, <span>, <strong>) lämnar inget mellanrum, så att ord inte smälter samman.

Specifik hantering per tagg

Tagg Hantering
<br> En radbrytning
</p>, </div>, </h1> till </h6> En radbrytning per avslutande tagg
</li>, </tr> En radbrytning; inga punkter eller tabellcellseparatorer läggs till
<a href="url">text</a> text; attributet href tas bort
<img alt="text"> Inget, taggen har ingen synlig text
<script>, <style> Taggarna tas bort, texten mellan dem behålls

Avkodning av entiteter

  • Namngivna entiteter (&amp;, &copy;, &eacute;) avkodas till sina Unicode-tecken.
  • Numeriska entiteter (&#169;, &#x00A9;) avkodas också.
  • Okända entiteter bevaras ordagrant, så att analysverktyg ser dem.

Normalisering av blanksteg

  • Mellanslag och tabbar före en radbrytning tas bort.
  • Tre eller fler tomma rader slås samman till en enda tom rad.
  • Mellanslag mellan ord behålls som de är; omvandlaren rättar inte om texten.

Användningsområden

  • Generera text/plain-delen av ett flerdelat e-postmeddelande.
  • Rensa skrapade artiklar innan de skickas till en språkmodell.
  • Fylla ett sökindex i ren text.
  • Beräkna en ärlig ordräkning som ignorerar markup.

Vanliga frågor

Den visuella formateringen (fetstil, färg och teckensnitt) försvinner, och det är just poängen. Strukturen finns kvar som radbrytningar: stycken, listpunkter och tabellrader blir separata rader, så att texten förblir lättläst.

Den synliga länktexten finns kvar, men URL:en tas bort tillsammans med taggens attribut. Om du behöver URL:erna, använd en särskild HTML-till-Markdown-omvandlare istället.

Omvandlaren tar bort själva taggarna men behåller texten mellan dem, så innehållet i <script>- och <style>-block finns kvar i utdata. Ta bort det från käll-HTML först om du inte vill ha det.

Ja. Utdata är i UTF-8-format och bevarar alla icke-ASCII-tecken från indata. Entiteter som &copy; och &eacute; dekoderas till sina motsvarande Unicode-tecken.

Relaterade verktyg

Verktyget finns på andra språk