HTML till textomvandlare
E-post i vanlig text, textanalys och verktyg för ordräkning kräver alla att HTML omvandlas till den läsbara sträng en människa faktiskt ser, utan några markupartefakter. Klistra in HTML så tar det här verktyget bort alla taggar, avkodar entiteter (& → &), slår samman sekvenser av blanksteg som uppstått av indrag och genererar ett rent, lättläst textblock som är klart för analys eller för text/plain-delen i ett flerdelat e-postmeddelande.
Så här extraherar du HTML till text
-
1
Klistra in HTML
Valfri storlek – ett kodavsnitt, ett formaterat e-postinnehåll eller en hel sida.
-
2
Konvertera
Ett klick: alla taggar och attribut tas bort och entiteter avkodas.
-
3
Kontrollera radbrytningarna
Stycken, listpunkter och tabellrader blir separata rader, så att texten behåller sin struktur.
-
4
Kopiera texten
Utdata är ren Unicode-text som tryggt kan matas till en ordräknare, en e-postmall eller en sentimentmodell.
Hur konverteringen hanterar komplexa taggar
Att omvandla HTML till text är mer än bara string.replace(/<[^>]+>/, ""): en naiv regex lämnar entitetskoder och indragsmellanslag kvar och vet inte att </p> bör inleda en ny rad.
Blocktaggar kontra inline-taggar
Taggar på blocknivå (<br>, och avslutande taggar </p>, </div>, </h1> till </h6>, </li>, </tr>) skapar var och en en radbrytning. Inline-taggar (<a>, <span>, <strong>) lämnar inget mellanrum, så att ord inte smälter samman.
Specifik hantering per tagg
| Tagg | Hantering |
|---|---|
<br> |
En radbrytning |
</p>, </div>, </h1> till </h6> |
En radbrytning per avslutande tagg |
</li>, </tr> |
En radbrytning; inga punkter eller tabellcellseparatorer läggs till |
<a href="url">text</a> |
text; attributet href tas bort |
<img alt="text"> |
Inget, taggen har ingen synlig text |
<script>, <style> |
Taggarna tas bort, texten mellan dem behålls |
Avkodning av entiteter
- Namngivna entiteter (
&,©,é) avkodas till sina Unicode-tecken. - Numeriska entiteter (
©,©) avkodas också. - Okända entiteter bevaras ordagrant, så att analysverktyg ser dem.
Normalisering av blanksteg
- Mellanslag och tabbar före en radbrytning tas bort.
- Tre eller fler tomma rader slås samman till en enda tom rad.
- Mellanslag mellan ord behålls som de är; omvandlaren rättar inte om texten.
Användningsområden
- Generera
text/plain-delen av ett flerdelat e-postmeddelande. - Rensa skrapade artiklar innan de skickas till en språkmodell.
- Fylla ett sökindex i ren text.
- Beräkna en ärlig ordräkning som ignorerar markup.
Vanliga frågor
Den visuella formateringen (fetstil, färg och teckensnitt) försvinner, och det är just poängen. Strukturen finns kvar som radbrytningar: stycken, listpunkter och tabellrader blir separata rader, så att texten förblir lättläst.
Den synliga länktexten finns kvar, men URL:en tas bort tillsammans med taggens attribut. Om du behöver URL:erna, använd en särskild HTML-till-Markdown-omvandlare istället.
Omvandlaren tar bort själva taggarna men behåller texten mellan dem, så innehållet i <script>- och <style>-block finns kvar i utdata. Ta bort det från käll-HTML först om du inte vill ha det.
Ja. Utdata är i UTF-8-format och bevarar alla icke-ASCII-tecken från indata. Entiteter som © och é dekoderas till sina motsvarande Unicode-tecken.
Relaterade verktyg
ASCII-tabellreferens
Full ASCII-tabell från 0 till 127 med decimal-, hex-, oktal- och binärvärden samt notation för numeriska HTML-referenser, inklusive NUL, LF och DEL.
HTML-teckenreferens
En sökbar lista över HTML-entiteter med deras namngivna och numeriska koder samt kopiering med ett klick för specialtecken och symboler.
Referens för kortkommandon
Sök dokumenterade standardkommandon för VS Code, Chrome och Bash med GNU Readline i macOS, Windows och Linux.
HTML-formaterare
Formatera HTML lokalt i webbläsaren med indrag på två eller fyra blanksteg. HTML laddas inte upp eller valideras.
E-postvalidator
Validera en e-postadress: RFC 5322-syntaxkontroll, live-slagning av MX-poster samt detaljer om lokal del, domän och längd. Ingen e-post skickas.
Slumpgenerator för bokstäver
Generera slumpade A-Z-bokstäver. Välj antal, versaler, gemener eller blandat läge och använd resultatet för spel, uppgifter eller klassrumsaktiviteter.
Verktyget finns på andra språk
- Convertisseur HTML en texte [FR]
- مُحوّل HTML إلى نص [AR]
- HTML zu Text Konverter [DE]
- เครื่องแปลง HTML เป็นข้อความ [TH]
- Convertidor de HTML a Texto [ES]
- HTML에서 텍스트로 변환기 [KO]
- Konverter HTML ke Teks [ID]
- HTMLからテキストへの変換ツール [JA]
- HTML naar tekst converter [NL]
- Chuyển đổi HTML thành Văn bản [VI]
- Konwerter HTML do tekstu [PL]
- Conversor de HTML para Texto [PT]
- HTML to Text Converter [EN]
- Convertitore da HTML a Testo [IT]
- Преобразователь HTML в текст [RU]
- HTML'den Metne Dönüştürücü [TR]
- HTML到文本转换器 [ZH]