Robots.txt-generator

Ange vilken crawler du riktar dig mot, lista sökvägarna du vill blockera och de du vill tillåta, lägg till en valfri crawl-delay och peka på din sitemap, så sätter generatorn ihop en korrekt formaterad robots.txt som du kan kopiera och driftsätta. Den sköter det exakta radformatet och skiljetecknen så att du slipper memorera syntaxen eller stavningen av user-agents.

Så genererar du filen

  1. 1

    Ange user-agent

    Ange vilken crawler reglerna gäller, eller lämna * för att rikta dig mot alla botar.

  2. 2

    Lista sökvägar att blockera

    Lägg till kataloger eller sökvägar att blockera, en per rad, till exempel /admin/ eller /checkout/.

  3. 3

    Lista sökvägar att tillåta

    Lägg till sökvägar som ska förbli crawlbara, en per rad, för att skapa undantag inom ett bredare Disallow.

  4. 4

    Lägg till sitemap och crawl-delay

    Deklarera din sitemap-URL och, om du behöver, en crawl-delay i sekunder.

  5. 5

    Kopiera och driftsätt

    Kopiera den genererade filen och placera den på https://yourdomain.com/robots.txt, i roten, inte i en underkatalog.

Typiska startmallar

Tillåt allt (de flesta webbplatser):

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

Blockera staging / admin:

User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml

Blockera AI-träningscrawlers, tillåt sökmotorer:

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

User-agents värda att känna till

User-agent Ägare Syfte
Googlebot Google Search Webbindexering
Googlebot-Image Google Bildsökning
Google-Extended Google Bard/Gemini-träning (avregistrering)
Bingbot Microsoft Bing-sökning
DuckDuckBot DuckDuckGo DDG-sökning
GPTBot OpenAI ChatGPT / träning (avregistrering)
ClaudeBot Anthropic Claude-träning (avregistrering)
CCBot Common Crawl Korpus som används av många LLM:er
AhrefsBot Ahrefs SEO-bakåtlänksindex
SemrushBot Semrush SEO-research
MJ12bot Majestic SEO-research

AI-träningsbotar är avregistrerande av konvention, inte lagkrav; aktörer i god tro respekterar direktiven, mindre nogräknade gör det inte.

Regler för sökvägsmatchning

  • Sökvägar är relativa till domänroten och börjar med /.
  • * matchar alla tecken. Disallow: /*.pdf$ blockerar alla PDF:er.
  • $ förankrar till URL-slutet. Disallow: /*/trash$ blockerar /foo/trash men inte /foo/trashes/....
  • Längsta matchning vinner. Allow: /admin/public/ åsidosätter Disallow: /admin/ för den undersökvägen.
  • Sökvägar är skiftlägeskänsliga.

Saker robots.txt inte kan göra

  • Ta bort en sida från Google. Använd en noindex-metatagg på själva sidan.
  • Skydda en URL från människor. robots.txt är offentlig och endast förslag till följsamma botar.
  • Hastighetsbegränsa Googlebot. Crawl-delay ignoreras av Google; använd Search Console.
  • Blockera botar som ignorerar robots.txt. Spam-skrapare läser inte filen.

Checklista för driftsättning

  1. Placera på https://yourdomain.com/robots.txt, endast roten.
  2. Servera med Content-Type: text/plain (de flesta servrar gör detta automatiskt).
  3. Storlek: under 500 KB. Google trunkerar större filer.
  4. Efter driftsättning, kontrollera den hämtade filen i Google Search Consoles robots.txt-testare.
  5. När du tar bort en Disallow, observera att avindexering kan ta veckor.

Vanliga frågor

Inte strikt. Utan en antar crawlers “tillåt allt”. Om du har något att blockera: staging, admin, kassa, intern sökning: behöver du en.

Du kan be dem sluta via user-agent-block som GPTBot, ClaudeBot, CCBot och Google-Extended. Stora aktörer respekterar dessa; mindre nogräknade skrapare ignorerar dem helt.

Crawlers är förlåtande: okända direktiv ignoreras. Allvarliga fel (HTTP 404 eller 500) behandlas som “tillåt allt”. Validera filen innan du publicerar.

I roten av varje värd du vill täcka: https://www.example.com/robots.txt och https://example.com/robots.txt är separata filer för separata värdar.

Nej. Sökvägarna du anger används bara för att sätta ihop filen; de sparas eller loggas inte.

Relaterade verktyg

Verktyget finns på andra språk