Extrahera URL:er från text
Klistra in en chattlogg, ett markdown-dokument, en e-posttråd eller ett rått HTML-utdrag och få en ren lista över alla http://- och https://-länkar den innehåller. Matcharen tar bort efterföljande skiljetecken, hanterar markdown- och HTML-länksyntax och tar bort exakta dubbletter, så att du kan skicka listan rakt in i en crawler eller ett arkiveringsverktyg.
Så extraherar du URL:er
-
1
Klistra in källan
Släpp in texten eller HTML:en. Citattecken, vinkelparenteser, markdown-länksyntax och efterföljande skiljetecken hanteras automatiskt.
-
2
Kör skanningen
Varje `http://`- och `https://`-länk hittas, efterföljande skiljetecken tas bort och exakta dubbletter rensas.
-
3
Granska antalet
Du ser hur många unika URL:er som hittades och hela listan.
-
4
Kopiera eller exportera
En URL per rad, redo för `curl -I`, en arkiverare, en skärmbildstjänst eller seed-listor för Screaming Frog.
Vad som räknas som en URL
URL-detektering är svårare än det ser ut, och den här extraheraren håller sig medvetet till en säker regel: den plockar bara upp fullständiga http://- och https://-länkar. Allt annat lämnas kvar i texten.
Former som känns igen
| Form | Exempel |
|---|---|
| Absolut HTTPS | https://example.com/path?q=1 |
| Absolut HTTP | http://example.com |
| Mål för en markdown-länk | [text](https://example.com) |
| Absolut href i HTML | href="https://example.com" |
Trimningsregler
Efterföljande skiljetecken tas bort, så (https://example.com). blir https://example.com. Mellanslag, citattecken, vinkelparenteser, parenteser, hakparenteser, kommatecken och semikolon avslutar en träff. En URL med parenteser kapas vid första öppnande parentesen, så en titel i Wikipedia-stil fångas bara upp till den öppnande parentesen.
Vad den hoppar över
mailto:,tel:,ftp:och alla andra scheman som inte ärhttpellerhttps.- Protokollrelativa länkar som
//cdn.example.com/asset.js. - Nakna domäner och adresser med
www.-prefix utan schema, somexample.com/docs/introellerwww.example.com/page. - Endast ankare som
#sectionoch pseudo-URL:er i JavaScript.
Hur dubbletter hanteras
Exakta dubbletter tas bort: https://example.com räknas en gång oavsett hur många gånger den förekommer, medan Example.com och example.com förblir separata poster. Listan behåller ordningen där varje URL först dök upp.
Tips för efterbearbetning
- Gör om till gemener för kanonisk avduplicering. Om
Example.comochexample.comska räknas som samma värd, gör om resultatet till gemener och avduplicera igen. - Skala bort spårningsparametrar med en UTM-rensare före arkivering, annars får du dussintals nära-dupletter.
- Kontrollera status. Skicka listan genom en kontroll av brutna länkar för att släppa 404:or innan du fastställer listan.
Vanliga frågor
Bara om den korta länken är skriven med fullständigt schema. bit.ly/xyz ensamt fångas inte, men https://bit.ly/xyz behandlas som en vanlig URL. Extraheraren följer inte omdirigeringar; lös upp dem separat om du behöver den slutliga destinationen.
Ja, när href är en fullständig http://- eller https://-URL. Värdet extraheras rent utan den omgivande taggen; relativa href fångas inte.
De behålls ordagrant. Om du vill skala bort utm_* och liknande spårningsparametrar, använd ett URL-rensningsverktyg efter extraheringen.
Nej. Texten bearbetas under förfrågan och innehållet sparas eller loggas inte.
Relaterade verktyg
Ordräknare
Räkna ord, tecken, meningar och stycken med lästid, taltid, sökordstäthet och ett Flesch-läsbarhetsvärde för uppsatser, inlägg, bildtexter och meta-beskrivningar.
Piltecken att kopiera
Kopiera vanliga Unicode-pilar med ett klick: raka, dubbla, diagonala, krokade, cirkulära och triangelformade för dokument, chatt och design.
Mindre än eller lika med-symbolen
Kopiera tecknet ≤ och relaterade matematiska jämförelsesymboler. Inkluderar Unicode, HTML-entiteter och LaTeX-markup för kalkylark, uppsatser och webbsidor.
Dyslexivänlig textkonverterare
Formatera om inklistrad text till korta stycken och rader på cirka 72 tecken för enklare läsning. Kopiera resultatet till valfritt dokument, e-postmeddelande eller redigeringsprogram.
Bubbeltextgenerator
Gör vanlig text till bubbelbokstäver (Ⓐ Ⓑ Ⓒ) som du kan kopiera och klistra in i bios på Instagram, TikTok och Discord. Inringade versaler och gemener plus inringade siffror, ingen app krävs.
Konvertera versaler och gemener
Omvandla vilken text som helst till VERSALER, gemener, titelstil, meningsstil, camelCase, snake_case, kebab-case eller omvända versaler och gemener med ett klick. Unicode-bokstäver, inklusive tecken med accenter, hanteras korrekt.
Verktyget finns på andra språk
- Wydobywanie URL-ów z tekstu [PL]
- URLs aus Text extrahieren [DE]
- Trích xuất URL từ văn bản [VI]
- Extraire des URL du texte [FR]
- Metinden URL'leri Çıkarma [TR]
- Extrair URLs do Texto [PT]
- استخراج عناوين URL من النص [AR]
- 텍스트에서 URL을 추출합니다 [KO]
- Extract URLs from Text [EN]
- 从文本中提取 URL [ZH]
- URL's extraheren uit tekst [NL]
- ดึง URL จากข้อความ [TH]
- Ekstrak URL dari Teks [ID]
- Extraer URLs del Texto [ES]
- テキストからURL抽出 [JA]
- Estrai URL dal testo [IT]
- Извлечение URL из текста [RU]