Reparera mojibake

Jämförelse av kodningshypoteser
Din inklistrade text och alla förslag stannar i webbläsaren. Stegläget sparar en validerad post i den här fliken i högst 30 minuter och lägger endast ett ogenomskinligt jobb-ID i webbadressen. Ingenting skickas via våra servrar eller ett reparations-API.

Klistra in texten som ser skadad ut

Klistra in text som café eller en japansk sträng som blev oläslig efter en kodningskonflikt. Originalet förblir oförändrat i redigeraren.

Högst 50 000 tecken. Verktyget jämför endast inklistrad Unicode-text. Det granskar eller reparerar inte filer, byteströmmar, databaser eller HTTP-rubriker.

Mojibake uppstår när läsbara data visas som fel tecken eftersom bytevärden har avkodats med en oförenlig teckenuppsättning. Ett välkänt exempel är café, där café kodades som UTF-8 men dess bytevärden tolkades som Latin-1 eller Windows-1252. Klistra in den synliga texten för att jämföra strikt reversibla reparationshypoteser. Verktyget lämnar originalet oförändrat, märker varje förslag som en hypotes och gör jämförelsen lokalt i webbläsaren.

Så jämför du en hypotes för mojibake-reparation

  1. 1

    Klistra in den synliga texten

    Använd texten exakt som du tog emot den. Verktyget laddar inte upp eller granskar en källfil.

  2. 2

    Välj jämförelsen aktivt

    Be webbläsaren testa bytevärden enligt Latin-1 och Windows-1252 mot en strikt UTF-8-avkodare.

  3. 3

    Jämför utan att anta

    Läs det oförändrade originalet bredvid varje reversibelt förslag och välj bara när sammanhanget ger stöd.

  4. 4

    Kopiera oformaterad text

    Kopiera, ladda ned eller skriv ut en vald hypotes utan att skriva över originaltexten.

Vad en mojibake-reparation kan och inte kan fastställa

En teckenkodning översätter mellan tecken och bytevärden. UTF-8 återger é med de två bytevärdena C3 A9. Om programvara avkodar dem som Windows-1252 eller ISO-8859-1 kan resultatet bli é. En användbar reparationshypotes vänder just det felet: behandla de synliga äldre tecknen som bytevärden, avkoda dessa strikt som UTF-8 och kontrollera att UTF-8-kodning av förslaget återskapar exakt samma bytevärden.

Returkontrollen avvisar ofullständiga och ogiltiga UTF-8-sekvenser. Den avvisar också förslag med ersättningstecknet , eftersom informationen bakom det tecknet redan har gått förlorad. En godkänd returkontroll ger stöd för en hypotes men bevisar inte vilken kodning källsystemet använde eller vad författaren avsåg.

Synlig text Testad hypotes Möjligt förslag Vad du bör kontrollera
café UTF-8-byte lästa som Latin-1 café Jämför stavningen med källan
It’s UTF-8-byte lästa som Windows-1252 It’s Kontrollera skiljetecken och skrivregler
文字化け UTF-8-byte lästa som Latin-1 文字化け Jämför japanskan med en betrodd kopia
café Två kodningsfel efter varandra café Granska båda kontrollerade omgångarna

Därför behöver japansk text sammanhang

Den japanska termen 文字化け betyder bokstavligen förvanskade tecken. Japansk UTF-8-text kan bli en lång blandning av latinska bokstäver, symboler och kontrolliknande tecken när dess bytevärden läses genom fel äldre kodning. Reversibilitet är värdefull, men ett kort namn eller ett ensamt tecken kan fortfarande vara tvetydigt. Jämför förslaget med originaldokumentet, en databasexport, avsändaren eller en annan auktoritativ kopia.

Begränsningar och säkrare återställning

Verktyget tar emot Unicode-text som webbläsaren redan har avkodat. Det kan inte återställa bytevärden som tidigare har kastats bort, avgöra kodningen i en binär fil, reparera en databaskolumn eller ändra HTTP-rubriken Content-Type. Behåll originalet om inget förslag visas. Hämta om möjligt källans faktiska bytevärden, gör en säkerhetskopia, fastställ den angivna och den verkliga kodningen och avkoda sedan en gång med ett verktyg som är byggt för filer eller byteströmmar. Spara aldrig skadad text om och om igen över den enda källkopian.

Vanliga frågor

Nej. Det betyder att en viss tolkning av äldre bytevärden blev giltig UTF-8 och klarade en exakt returkontroll. Flera tolkningar kan ge samma eller olika läsbara texter. Sammanhang och en auktoritativ källa behövs fortfarande.

De synliga tecknen kanske inte är UTF-8-byte som lästs som ISO-8859-1 eller Windows-1252, sekvensen kan vara ofullständig eller ett ersättningstecken kan redan ha raderat information. Behåll originalet och granska de faktiska bytevärdena och kodningsuppgifterna.

Nej. Det jämför endast inklistrad Unicode-text. Verktyget läser inte filer eller filkodningar, ansluter inte till databaser, skriver inte om lagrade värden och reparerar inte serverrubriker. Säkerhetskopiera källan före ett bytebaserat konverteringsflöde.

Nej. Jämförelse, val, kopiering, skapande av TXT och utskriftsförberedelse sker i webbläsaren. Stegläget kan spara en validerad post i den här fliken i högst 30 minuter och placerar endast ett ogenomskinligt jobb-ID i webbadressen.

Relaterade verktyg