Unicode-uppslagning

Lägg in ett mystiskt tecken, det märkliga blankstecknet din användare klistrade in, en glyf från en typsnittsförhandsgranskning, en emoji som bryter ditt regex, så returnerar uppslagningen dess Unicode-teckenpunkt (U+XXXX) och de råa UTF-8-byten i hexadecimal, en rad per tecken.

Så identifierar du ett Unicode-tecken

  1. 1

    Klistra in tecknet

    Du kan klistra in en glyf eller en hel sträng: varje tecken analyseras i ordning.

  2. 2

    Läs teckenpunkten

    Få den kanoniska U+-notationen i versaler, nollutfylld till minst fyra hexadecimala siffror.

  3. 3

    Inspektera UTF-8-byten

    Se den 1–4-bytes sekvens tecknet upptar på disk eller på tråden.

  4. 4

    Kopiera resultaten

    Utdata är en tabell i CSV-format (tecken, teckenpunkt, UTF-8-byte) som du kan markera och klistra in i ett kalkylark eller en buggrapport.

Typiskt detektivarbete du kan göra med en uppslagning

De flesta Unicode-buggar ser identiska ut på skärmen. Det enda sättet att skilja ett vanligt mellanslag från ett hårt mellanslag, eller en krökt apostrof från ett primtecken, är att inspektera teckenpunkten.

Vanliga fällor som uppslagningen löser

Ser ut som Är faktiskt Teckenpunkt
Mellanslag Hårt mellanslag U+00A0
Mellanslag Smalt hårt mellanslag U+202F
(inget) Nollbreddsmellanslag U+200B
(inget) Nollbreddssammanfogare U+200D
Apostrof Högt enkelt citattecken U+2019
Apostrof Primtecken (fot/minuter) U+2032
Bindestreck Kort tankstreck U+2013
Bindestreck Icke-brytande bindestreck U+2011

UTF-8-bytelayout i ett ögonkast

  • 1 byte, ASCII, U+0000 till U+007F (0xxxxxxx)
  • 2 byte, latinskt supplement, arabiska, hebreiska (110xxxxx 10xxxxxx)
  • 3 byte, CJK, de flesta symboler (1110xxxx 10xxxxxx 10xxxxxx)
  • 4 byte, emoji, sällsynta skript (11110xxx 10xxxxxx 10xxxxxx 10xxxxxx)

Om din databaskolumn har en fast bytelängd kommer en 4-bytes emoji att äta upp fyra platser även om den renderas som en glyf, en vanlig källa till avkortningsbuggar.

Vanliga frågor

Oftast BOM-markörer (U+FEFF) i början av filen eller vilsna nollbreddssammanfogare från en ordbehandlare. Klistra in en i uppslagningen så talar den om det direkt, sedan kan du ta bort dem med en enkel sök-och-ersätt.

Ja. Uppslagningen itererar tecken för tecken, så ett helt ord ger en rad per tecken med dess teckenpunkt och UTF-8-byte.

En teckenpunkt är ett teckens abstrakta identitet, U+00E9 är alltid “é” oavsett var du lagrar det. UTF-8 är en av flera kodningar som förvandlar en teckenpunkt till byte; samma “é” är de två byten C3 A9 i UTF-8 men den enda byten E9 i Latin-1.

Ja. Uppslagningen beräknas på vår server: tecknen du klistrar in skickas, analyseras och deras teckenpunkt och UTF-8-byte returneras direkt. Vi lagrar inte texten du skickar.

Relaterade verktyg

Verktyget finns på andra språk