Ta bort dubbletter av rader

En CSV-export med upprepade rader, en loggfil med dubblerade poster, en sökordslista från tre överlappande källor: närhelst texten innehåller identiska rader slår det här verktyget ihop dem och behåller det första exemplaret på sin ursprungliga plats. Två matchningsalternativ, med eller utan hänsyn till versaler, valfri trimning av mellanslag och en räkning av hur många rader som togs bort.

Så tar du bort dubbletter av rader

  1. 1

    Klistra in texten

    Klistra in en lista, en logg, en CSV-kolumn eller valfri text där varje post står på en egen rad.

  2. 2

    Välj matchningsalternativ

    "Skiftlägeskänslig" behåller `Apple` och `apple` som separata rader; avstängd slås de ihop. "Trimma mellanslag" tar bort mellanslag i början och slutet före jämförelsen.

  3. 3

    Ta bort dubbletter

    Klicka på knappen. Det första exemplaret av varje rad behålls och senare upprepningar tas bort.

  4. 4

    Kontrollera och kopiera

    Statistiken visar ursprungliga rader, unika rader och borttagna dubbletter. Kopiera den rensade texten när den ser rätt ut.

Så fungerar matchningen

Alternativ Beteende
Skiftlägeskänslig (standard) Apple och apple behålls som separata rader
Inte skiftlägeskänslig Apple och apple räknas som samma rad
Trimma mellanslag (standard) hello” och “hello ” behandlas som samma rad

Det första exemplaret av varje rad behålls, så textens ursprungliga ordning bevaras.

Vanliga användningsområden

  • Rensa CSV-filer. Klistra in en enda kolumn (namn, e-post, SKU) och ta bort upprepningar innan du kopplar ihop den med övriga kolumner.
  • URL-listor. Slå samman listor från skrapning där samma sida förekommer många gånger.
  • Sökordsforskning. Att slå samman sökordsexporter från flera verktyg skapar oundvikligen dubbletter.
  • E-postlistor. Ta bort exakta dubbletter före import till ett CRM för att undvika felmeddelanden om att posten “redan finns”.
  • Loggfilssortering. Ta bort upprepade varningsrader för att se de unika problemen.

Vad verktyget inte gör

  • Ingen kolumnbaserad deduplicering. En CSV med email,name där e-posten upprepas men namnet skiljer sig behåller båda raderna, eftersom hela raderna skiljer sig. För att deduplicera efter en kolumn: extrahera kolumnen först, ta bort dubbletter i den och använd den sedan som nyckel mot originalfilen.
  • Inget skydd för rubrikrader. Varje rad behandlas som data, så en upprepad rubrikrad tas bort som vilken annan rad som helst.
  • Ingen luddig matchning. Rader som skiljer sig genom stavfel, inre mellanslag eller skiljetecken slås inte ihop.

Tips

  • Normalisera före matchning. Gör om till gemener och ta bort omgivande skiljetecken för att fånga “Apple, “, “ apple “ och “Apple” som en post.
  • Spara en kopia av originaltexten före större rensningar.
  • Kontrollera statistiken. Om du väntade dig 10 procent dubbletter men 80 procent togs bort är något fel med indata.

Vanliga frågor

Den första. Textens ursprungliga ordning bevaras, så varje unik rad stannar på sin ursprungliga plats.

Inte automatiskt. Varje rad, inklusive rubriken, jämförs som alla andra. Om en senare rad är lika med rubriken tas den bort. Spara rubriken separat om du behöver den.

Det här verktyget är fokuserat på exakt matchning för snabbhet. För luddig matchning (stavfel, annan versalhantering, extra skiljetecken) använd ett dedikerat dedupliceringsverktyg med en likhetströskel.

Ja. Texten skickas till vår server så att verktyget kan bearbeta den, och resultatet visas på sidan. Texten sparas inte efteråt.

Relaterade verktyg

Verktyget finns på andra språk