Extrahera URL:er från text

Klistra in en chattlogg, ett markdown-dokument, en e-posttråd eller ett rått HTML-utdrag och få en ren lista över alla http://- och https://-länkar den innehåller. Matcharen tar bort efterföljande skiljetecken, hanterar markdown- och HTML-länksyntax och tar bort exakta dubbletter, så att du kan skicka listan rakt in i en crawler eller ett arkiveringsverktyg.

Så extraherar du URL:er

  1. 1

    Klistra in källan

    Släpp in texten eller HTML:en. Citattecken, vinkelparenteser, markdown-länksyntax och efterföljande skiljetecken hanteras automatiskt.

  2. 2

    Kör skanningen

    Varje `http://`- och `https://`-länk hittas, efterföljande skiljetecken tas bort och exakta dubbletter rensas.

  3. 3

    Granska antalet

    Du ser hur många unika URL:er som hittades och hela listan.

  4. 4

    Kopiera eller exportera

    En URL per rad, redo för `curl -I`, en arkiverare, en skärmbildstjänst eller seed-listor för Screaming Frog.

Vad som räknas som en URL

URL-detektering är svårare än det ser ut, och den här extraheraren håller sig medvetet till en säker regel: den plockar bara upp fullständiga http://- och https://-länkar. Allt annat lämnas kvar i texten.

Former som känns igen

Form Exempel
Absolut HTTPS https://example.com/path?q=1
Absolut HTTP http://example.com
Mål för en markdown-länk [text](https://example.com)
Absolut href i HTML href="https://example.com"

Trimningsregler

Efterföljande skiljetecken tas bort, så (https://example.com). blir https://example.com. Mellanslag, citattecken, vinkelparenteser, parenteser, hakparenteser, kommatecken och semikolon avslutar en träff. En URL med parenteser kapas vid första öppnande parentesen, så en titel i Wikipedia-stil fångas bara upp till den öppnande parentesen.

Vad den hoppar över

  • mailto:, tel:, ftp: och alla andra scheman som inte är http eller https.
  • Protokollrelativa länkar som //cdn.example.com/asset.js.
  • Nakna domäner och adresser med www.-prefix utan schema, som example.com/docs/intro eller www.example.com/page.
  • Endast ankare som #section och pseudo-URL:er i JavaScript.

Hur dubbletter hanteras

Exakta dubbletter tas bort: https://example.com räknas en gång oavsett hur många gånger den förekommer, medan Example.com och example.com förblir separata poster. Listan behåller ordningen där varje URL först dök upp.

Tips för efterbearbetning

  • Gör om till gemener för kanonisk avduplicering. Om Example.com och example.com ska räknas som samma värd, gör om resultatet till gemener och avduplicera igen.
  • Skala bort spårningsparametrar med en UTM-rensare före arkivering, annars får du dussintals nära-dupletter.
  • Kontrollera status. Skicka listan genom en kontroll av brutna länkar för att släppa 404:or innan du fastställer listan.

Vanliga frågor

Bara om den korta länken är skriven med fullständigt schema. bit.ly/xyz ensamt fångas inte, men https://bit.ly/xyz behandlas som en vanlig URL. Extraheraren följer inte omdirigeringar; lös upp dem separat om du behöver den slutliga destinationen.

Ja, när href är en fullständig http://- eller https://-URL. Värdet extraheras rent utan den omgivande taggen; relativa href fångas inte.

De behålls ordagrant. Om du vill skala bort utm_* och liknande spårningsparametrar, använd ett URL-rensningsverktyg efter extraheringen.

Nej. Texten bearbetas under förfrågan och innehållet sparas eller loggas inte.

Relaterade verktyg

Verktyget finns på andra språk