Diakritikborttagare

Slugs i URL:er, filnamn för FTP-servrar, äldre databaser med Latin-1-kodning: alla missköter sig när du ger dem ett namn som “José Peña” eller “Zoë”. Det här verktyget tar bort accenter, tildes, umlaut och cedilj från text med hjälp av standardmässig Unicode-translitterering och normalisering, och lämnar dig med ren ASCII som överlever vilken pipeline som helst.

Så tar du bort diakritiska tecken

  1. 1

    Klistra in din text

    Skriv eller klistra in valfri text som innehåller accentuerade tecken: ett ord, en namnlista, en hel artikel.

  2. 2

    Kör konverteringen

    Klicka på "Ta bort diakritiker". Varje accentuerad bokstav blir vanlig ASCII: é blir e, ñ blir n, ß blir ss.

  3. 3

    Granska den rensade utdatan

    Titta i resultatrutan: alla tecken som ändrats är nu vanlig ASCII, medan mellanslag, skiljetecken och radbrytningar lämnas orörda.

  4. 4

    Kopiera resultatet

    Kopiera den rensade texten till urklipp med ett klick och klistra in den där du behöver den.

Så fungerar borttagningen

Verktyget använder först ICU-translitterering (regeln “Any-Latin; Latin-ASCII”): texten omvandlas till latinska tecken och därefter tas alla kvarvarande accenter bort, så é blir e, ß blir ss och æ blir ae. Om translittereringsmotorn inte är tillgänglig faller verktyget tillbaka på Unicode NFD (Normalization Form Decomposition), som delar upp é i basbokstaven e (U+0065) och den kombinerande akuta accenten (U+0301), tar bort varje kodpunkt i intervallet för kombinerande tecken (U+0300 till U+036F) och sätter sedan ihop texten igen. Båda vägarna fungerar för varje språk som använder det latinska alfabetet med tillagda tecken.

Fusklapp för teckenmappning

Indata Resultat
á é í ó ú a e i o u
à è ì ò ù a e i o u
â ê î ô û a e i o u
ä ë ï ö ü a e i o u
ñ n
ç c
ß ss
æ Æ ae AE
œ Œ oe OE
ø Ø o O
ł Ł l L

Fallback-vägen (utan translitterering) lämnar ß, æ, œ, ø och ł oförändrade eftersom den bara tar bort kombinerande tecken.

Vanliga användningsfall

  • URL-slugs. “El niño” blir “el-nino” efter borttagning och gemenisering.
  • Filnamn. Molnlagringstjänster och vissa äldre FTP-servrar förvanskar icke-ASCII-filnamn; ta bort först, ladda upp sedan.
  • CSV-importer till äldre system. Vilken databas som helst på Latin-1-kodning (Windows-1252) hanterar fel multibyte-UTF-8-tecken; borttagning undviker korruptionen.
  • Sökbara fält. Att lagra en diakritikfri version vid sidan av originalet låter användare hitta “naive” när raden säger “naïve”.

Fälla: det är en enkelriktad resa

Att ta bort från “naïve” ger “naive”; du kan inte få tillbaka umlauten automatiskt eftersom språket är förlorat. Behåll originalet vid sidan av den rensade versionen när båda kan behövas.

Vanliga frågor

Det är inte diakritiska tecken utan egna bokstäver utan enkelt kombinerande tecken. Verktyget omvandlar dem ändå: ß blir ss, æ blir ae, œ blir oe, ø blir o och ł blir l. Fallback-vägen, som bara används när translittereringsmotorn inte är tillgänglig, lämnar dem orörda.

Standardvägen translittererar även dem: kyrillisk, grekisk, arabisk och CJK-text blir latinska tecken (Привет blir Privet, Ελλάδα blir Ellada, 你好 blir ni hao), därefter tas kvarvarande tecken bort. Fallback-vägen tar bort bara kombinerande tecken och lämnar icke-latinska skriftsystem orörda.

Ja. Versala accentuerade bokstäver blir versal ASCII, gemena förblir gemena. Mellanslag, skiljetecken och radbrytningar lämnas orörda.

Din text skickas till vår server endast för att utföra omvandlingen; den sparas inte efter bearbetningen och läggs inte till i sidlänken. Endast anonym användningsstatistik samlas in.

Relaterade verktyg

Verktyget finns på andra språk