Luddig listmatchare

Att stämma av en CRM-export mot ett kalkylblad med fakturakunder, eller att matcha leverantörsnamn från två olika ERP-system, går nästan alltid sönder på små skillnader, “Acme Corp.” mot “ACME Corporation” mot “acme corp”. Klistra in båda listorna, sätt en likhetströskel så föreslår verktyget den bästa kandidaten i lista B för varje post i lista A, och flaggar de under tröskeln för manuell granskning.

Så matchar du två röriga listor

  1. 1

    Klistra in lista A

    En post per rad: kundnamn, produktkoder, gatuadresser.

  2. 2

    Klistra in lista B

    Kandidatpoolen. Skillnader i skiftläge, mellanrum och stavfel är OK.

  3. 3

    Sätt en tröskel

    Likhetsprocent över vilken en matchning accepteras (70 % är ett vettigt standardvärde).

  4. 4

    Läs rapporten

    Varje A-post paras med den bästa B-kandidaten och en konfidenspoäng. Poster under tröskeln markeras för granskning.

Hur likhet mäts

Verktyget använder PHP:s similar_text (en poäng för längsta gemensamma delsekvens) och rapporterar resultatet som en procentandel. Högre är bättre; en exakt matchning är 100 %.

Tröskel Beteende
≥ 95 % Nästan identiska, bara skillnader i skiftläge eller mellanrum
80–94 % Stavfel, saknade skiljetecken, trunkerade suffix
60–79 % Ändringar i ordföljd, förkortningar mot fullständiga former
< 60 % Troligen ingen riktig matchning, granska manuellt

Tips

  • Normalisera först om du känner till det vanliga bruset: gör till gemener, ta bort skiljetecken, kollapsa blanksteg. Du får snävare poäng.
  • Skala bort företagssuffix (“Inc”, “Ltd”, “GmbH”) om de förekommer inkonsekvent i en lista men inte i den andra.
  • Dela upp långa adresser, att matcha “gata + ort” separat slår att matcha en sammanslagen rad.
  • Se upp för en-till-många. Verktyget väljer den bästa B-matchningen per A-post; det hindrar inte att samma B matchar flera A-rader.

När du bör använda en strängare algoritm

För stort dedupliceringsarbete överträffar Levenshtein-avstånd eller Jaro–Winkler similar_text, särskilt på namn där teckenposition spelar roll. Om luddig matchning driver fakturering eller sammanslagningar, stickprovskontrollera 20 slumpmässiga par innan du litar på utdatan i stor skala.

Vanliga frågor

70 % fångar de flesta legitima matchningar samtidigt som verkliga missar flaggas. Skärp till 85 % om lista B är ren och du inte har råd med falska positiva; lätta upp till 55 % om båda listorna är röriga och du planerar att granska allt manuellt.

Ja, men normalisera först, ta bort mellanrum, bindestreck och landskodsprefix, gör e-post till gemener. Luddig matchning på råvärden rapporterar låga poäng för strukturellt identiska poster.

Internt gör verktyget båda sidor till gemener före jämförelse, så “Apple” och “apple” får 100 %.

Ja, matchningen körs på serversidan, så dina två listor skickas till verktyget för att jämföras. De behandlas i minnet under den enda begäran och lagras eller loggas inte efteråt.

Relaterade verktyg

Verktyget finns på andra språk