Robots.txt-kontroll

Klistra in dina robots.txt-regler och den URL-sökväg du vill testa, så läser kontrollen Allow- och Disallow-raderna och talar om ifall sökvägen skulle blockeras eller tillåtas. Praktiskt när en sida plötsligt försvinner från Google och du vill bekräfta om en alltför strikt Disallow är orsaken, eller när du utformar nya regler och vill verifiera en sökväg innan du publicerar filen.

Så körs kontrollen

  1. 1

    Klistra in dina regler

    Kopiera Allow- och Disallow-raderna från din robots.txt till fältet, eller skriv nya för att prova dem.

  2. 2

    Ange en sökväg att testa

    Skriv URL-sökvägen du vill kontrollera, till exempel /private/page. Använd bara sökvägen, inte hela domänen.

  3. 3

    Kontrollera regeln

    Kontrollen söker igenom Allow- och Disallow-raderna och hittar den regel som matchar sökvägen du angav.

  4. 4

    Läs resultatet

    Du får antalet regler som hittades, den testade sökvägen och beslutet: tillåten som standard, blockerad av en Disallow eller tillåten av en Allow.

En minimal korrekt robots.txt

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /draft/
Sitemap: https://example.com/sitemap.xml
  • User-agent: *. Gäller alla crawlers som inte uttryckligen namnges i ett annat block.
  • Allow: /. Allt tillåtet som standard.
  • Disallow: /admin/. Admin-katalogen är avstängd.
  • Sitemap:. Talar om för sökmotorer var de hittar XML-sitemapen.

Regler som Googlebot faktiskt följer

Googles tolk är de facto-standarden för att tolka tvetydiga regler:

  • Skiftlägeskänsliga sökvägar. /Admin/ och /admin/ är olika.
  • Längsta matchning vinner. Allow: /admin/public/ slår Disallow: /admin/ för en URL som börjar med /admin/public/.
  • Jokertecken. * matchar valfri teckensekvens; $ förankrar i slutet av URL:en.
  • Kommentarer börjar med #.
  • Ordningsoberoende. Regler utvärderas efter specificitet (sökvägslängd), inte listningsordning.

Vanliga misstag

Misstag Effekt
Disallow: / högst upp, ingen Allow Hela webbplatsen blockerad
Disallow: *.pdf Många tolkar ignorerar, använd Disallow: /*.pdf$
Protokollrelativ eller absolut URL i Disallow Ignoreras, sökvägar måste vara relativa
Flera User-agent-rader före regler Kombineras; regler gäller alla listade UA:er
Avslutande blanksteg på sökvägar Behandlas tyst som en annan sökväg
Placera robots.txt i en underkatalog Endast filen i rotdomänen hämtas

robots.txt kontra noindex

robots.txt talar om för crawlers att inte hämta en URL. En sida som redan är indexerad och sedan blockeras i robots.txt kan förbli indexerad i månader, crawlern kan inte hämta den för att bekräfta borttagning. Om du vill ha bort den ur indexet, använd en noindex-metatagg eller HTTP-header på själva sidan och låt crawlern se den.

Crawl-delay

Crawl-delay: 10 ber om 10 sekunder mellan begäranden. Google ignorerar det (använd Search Console för att ställa in crawl-takten). Bing, Yandex och vissa nischade crawlers respekterar det. Använd det för små webbplatser under crawl-tryck från nischade botar.

Vad Disallow INTE gör

  • Blockerar från att länkas till. Andra webbplatser kan fortfarande länka till en förbjuden URL, och URL:en visas i sökresultaten med bara URL:en (ingen titel eller beskrivning).
  • Hindrar sidan från att renderas. Användare kan fortfarande besöka en Disallow-ad URL.
  • Döljer URL:en för världen. robots.txt är offentlig; att lista hemliga sökvägar där annonserar dem.

Vanliga frågor

Eftersom disallow blockerar crawling, inte indexering. Om Google redan känner till URL:en (från länkar eller sitemap) kan den behålla den nakna URL:en i sökresultaten. Använd en noindex-tagg på sidan och låt Google hämta den för att bekräfta borttagning.

Ja. Använd ett User-agent: BadBot-block med egna regler. Observera att botar som beter sig illa ignorerar robots.txt helt; endast följsamma botar respekterar den.

Nej. robots.txt är offentlig: att lista den annonserar platsen. Använd autentisering och åtkomstkontroll på servernivå i stället.

Ja, för sökvägar. Disallow: /Admin/ blockerar inte /admin/. Matcha den faktiska versaliseringen av dina URL:er.

Ja. Lista flera Sitemap:-rader för att peka mot separata XML-sitemaps eller ett sitemap-index.

Relaterade verktyg

Verktyget finns på andra språk