Diakritikborttagare

Ta bort diakritiska tecken

Slugs i URL:er, filnamn för FTP-servrar, äldre databaser med Latin-1-kodning: alla missköter sig när du ger dem ett namn som “José Peña” eller “Zoë”. Det här verktyget tar bort accenter, tildes, umlaut och cedilj från text, så att text med latinska bokstäver blir enkla ASCII-bokstäver som klarar vilken pipeline som helst. Det tar också bort accenterna i grekiska, betoningstecknen i ryska och vokaltecknen i arabiska och hebreiska, men behåller varje alfabet.

Så tar du bort diakritiska tecken

  1. 1

    Klistra in din text

    Skriv eller klistra in valfri text som innehåller accentuerade tecken: ett ord, en namnlista, en hel artikel.

  2. 2

    Kör konverteringen

    Klicka på "Ta bort diakritiska tecken". Latinska bokstäver med accent blir vanliga bokstäver: é blir e, å blir a, ö blir o och ß blir ss.

  3. 3

    Granska den rensade utdatan

    Titta i resultatrutan och tabellen under den, som visar varje tecken som ändrats och hur många gånger. Mellanslag, skiljetecken och radbrytningar lämnas orörda. Justera alternativen vid behov: ae, oe och ue som på tyska, grekiska och kyrilliska med latinska bokstäver, eller bokstäver som ska behållas som de är.

  4. 4

    Kopiera resultatet

    Kopiera den rensade texten till urklipp med ett klick och klistra in den där du behöver den.

Så fungerar borttagningen

Verktyget använder först Unicodes kanoniska uppdelning (NFD), som delar upp é i basbokstaven e (U+0065) och den kombinerande akuta accenten (U+0301). Sedan tar det bort de kombinerande tecknen efter varje latinsk bokstav och sätter ihop texten igen, enligt samma regel som CLDR-transformen “Latin-ASCII” använder. Bokstäver som uppdelningen inte delar, som ß, æ, ø, ł, đ och turkiskans punktlösa ı, ersätts med den enkla stavning som transformen ger: ss, ae, o, l, d och i. En versal som blir två bokstäver anpassas efter resten av ordet: Æsir blir Aesir och ÆSIR blir AESIR.

Andra alfabet behåller sina bokstäver. Grekiskan förlorar accenter, andningstecken och trema. Ryskan och andra språk med kyrilliska bokstäver förlorar betoningstecken, och ё blir е; й, ў och ї står kvar, eftersom de är egna bokstäver. Arabiskan förlorar sina korta vokaltecken, shadda och sukun, medan hamza och madda står kvar, eftersom de bildar bokstäver som أ och آ. Hebreiskan förlorar vokalpunkter och kantillationstecken. Kinesiska, japanska, koreanska, thailändska, hindi och andra skriftsystem lämnas som de är, och det gör även emojier.

Tre alternativ ändrar resultatet:

  • ä, ö och ü som ae, oe och ue. Den stavning som tyskan använder när bokstäverna med umlaut inte finns: Müller blir Mueller i stället för Muller.
  • Grekiska och kyrilliska med latinska bokstäver. Grekiska följer FN:s system (ELOT 743), så Αθήνα blir Athina; kyrilliska följer passtabellen i ICAO Doc 9303 i den ryska formen, så Щука blir Shchuka. Bokstäver som saknar latinsk stavning i tabellerna står kvar som de är, och verktyget listar dem.
  • Bokstäver att behålla. Skriv å ä ö för att behålla de svenska bokstäverna och bara ta bort andra accenter, eller ё för att behålla den i rysk text. Tecken som läggs till ovanpå en behållen bokstav försvinner ändå: med ê behållet blir vietnamesiska ế och ệ till ê.

Fusklapp för teckenmappning

Indata Resultat
á é í ó ú a e i o u
à è ì ò ù a e i o u
â ê î ô û a e i o u
ä ë ï ö ü a e i o u
ñ n
ç c
ß ss
æ ae
œ oe
ø Ø o O
ł Ł l L
đ Đ d D
ı i
ά έ ή ί ό ύ ώ α ε η ι ο υ ω
ё Ё е Е
مَرْحَبًا مرحبا

Vanliga användningsfall

  • URL-slugs. “El niño” blir “el-nino” efter borttagning och gemenisering.
  • Filnamn. Molnlagringstjänster och vissa äldre FTP-servrar förvanskar icke-ASCII-filnamn; ta bort först, ladda upp sedan.
  • CSV-importer till äldre system. Vilken databas som helst på Latin-1-kodning (Windows-1252) hanterar fel multibyte-UTF-8-tecken; borttagning undviker korruptionen.
  • Sökbara fält. Att lagra en diakritikfri version vid sidan av originalet låter användare hitta “naive” när raden säger “naïve”.

Fälla: det är en enkelriktad resa

Att ta bort från “naïve” ger “naive”; du kan inte få tillbaka umlauten automatiskt eftersom språket är förlorat. Behåll originalet vid sidan av den rensade versionen när båda kan behövas.

Vanliga frågor

Det är inte diakritiska tecken utan egna bokstäver utan något enkelt kombinerande tecken. Verktyget omvandlar dem ändå: ß blir ss, æ blir ae, œ blir oe, ø blir o och ł blir l. Vill du behålla någon av dem skriver du den i rutan “Behåll de här bokstäverna som de är”.

Ja, och varje alfabet behålls. Grekiskan förlorar sina accenter (Ελλάδα blir Ελλαδα), ryskan förlorar betoningstecken och ё blir е, arabiskan förlorar sina vokaltecken (مَرْحَبًا blir مرحبا) och hebreiskan sina vokalpunkter. Vill du skriva grekiska eller kyrilliska med latinska bokstäver slår du på alternativet för translitterering: Ελλάδα blir Ellada och Привет blir Privet. Kinesiska, japanska, thailändska och andra skriftsystem lämnas som de är.

Ja. Versala bokstäver med accent blir versal ASCII, gemena förblir gemena, och en versal som blir två bokstäver anpassas efter resten av ordet: Æsir blir Aesir, ÆSIR blir AESIR. Mellanslag, skiljetecken och radbrytningar lämnas orörda.

Texten du skriver in stannar i din webbläsare: den omvandlas där och skickas inte till våra servrar eller läggs till i sidlänken. För att föra den från första steget till resultatet sparar den här webbläsarfliken texten tills du stänger fliken eller klickar på “Börja om från början”.

Relaterade verktyg

Verktyget finns på andra språk