Kontroll av textlikhet

Nästa

Två supportärenden som låter identiska, ett blogginlägg som liknar en konkurrents, eller två produktbeskrivningar som ser kopierade ut: magkänslan säger att de överlappar, men du vill ha en siffra. Den här kontrollen jämför två texter och ger två poäng: ordöverlappning, andelen unika ord som de två texterna har gemensamt, och teckenlikhet, hur väl de råa tecknen stämmer överens. Tillsammans visar de om texterna delar ordförråd, formulering eller båda.

Så mäts likheten

  1. 1

    Klistra in båda texterna

    Vilken längd som helst, från en mening till en hel artikel.

  2. 2

    Ordöverlappning

    Varje text görs till gemener och delas upp i unika ord. Jaccard-poängen är de gemensamma orden delat med det totala antalet olika ord.

  3. 3

    Teckenlikhet

    Verktyget jämför även de råa teckensekvenserna och rapporterar procentandelen tecken som stämmer.

  4. 4

    Läs båda poängen

    Hög ordöverlappning med lägre teckenlikhet betyder samma ord i annan ordning. Hög teckenlikhet betyder nästan identiska texter, bokstav för bokstav.

Vad varje poäng säger

Poäng Intervall Mäter Blind fläck
Ordöverlappning (Jaccard) 0-100% Andelen unika ord som är gemensamma för båda texterna Bortser från ordföljd och hur ofta ett ord upprepas
Teckenlikhet 0-100% Hur väl den råa teckensekvensen stämmer Känslig för längd och små ändringar
  • Ordöverlappning nära 100% betyder att de två texterna använder nästan samma uppsättning ord.
  • Teckenlikhet nära 100% betyder att texterna är nästan identiska tecken för tecken.
  • Ett stort gap (hög ordöverlappning, lägre teckenlikhet) pekar på samma ordförråd ordnat på annat sätt.

Genomräknat exempel

Jämförelse av The quick brown fox med The quick red fox:

  • Ordöverlappning: 60.00% (de delar the, quick och fox av fem olika ord)
  • Teckenlikhet: 83.33% (bara brown mot red skiljer sig)

De två siffrorna tillsammans berättar historien: nästan samma ord, och så när som på ett ord nästan samma tecken.

Vad den inte gör

Detta är en ytlig strängjämförelse, inte en plagiat- eller betydelsekontroll:

  • Den jämför ord och tecken, så två avsnitt som säger samma sak med andra ord får låg poäng.
  • Den har ingen databas över publicerat material och kan därför inte avgöra om text kopierats någon annanstans ifrån.
  • Betydelsebaserad (semantisk) matchning kräver en inbäddningsmodell, som det här verktyget inte använder.

Använd poängen som en snabb signal för nära dubbletter, inte som en dom.

Tips för förbearbetning

  • Ta bort standardtext (signaturer, sidhuvuden, sidfötter) innan du jämför; de blåser upp båda poängen på konstgjord väg.
  • Normalisera blanksteg och lös interpunktion så att formateringsskillnader inte överröstar verkliga innehållsmatchningar.
  • Håll koll på längdskillnader: mycket olika längder sänker teckenlikheten även när den kortare texten ryms i den längre, så jämför jämförbara avsnitt.

Vanliga frågor

Bara som en grov signal. Det mäter ordöverlappningen och teckenlikheten mellan de två texter du klistrar in; det har ingen databas över befintligt material och kan inte upptäcka kopiering från en okänd källa. En hög poäng flaggar nära dubbletter som är värda en närmare titt, inte mer.

Inte riktigt. Om en omskrivning behåller de flesta orden förblir ordöverlappningen hög. Men om den byter till synonymer sjunker båda poängen, eftersom verktyget jämför ord och tecken, inte betydelse. Att fånga verklig omskrivning kräver en semantisk (inbäddnings-)modell.

Båda poängen klarar långa texter, men jämförelsen av teckenlikhet blir långsammare när texterna växer, så håll varje text på några tusen tecken för ett snabbt resultat.

Dina två texter skickas till vår server för att jämföras och lagras inte. Jämförelsen är en enkel ord- och teckenmatchning, utan inblandade tredje parter.

Relaterade verktyg

Verktyget finns på andra språk