Ska du blockera AI-botarna i robots.txt?.
Ska jag blockera GPTBot och andra AI-crawlers i robots.txt?
För de allra flesta företag: nej. Att blockera AI-crawlers hindrar dig från att bli citerad i AI-svar, men skyddar inte innehållet från att användas — det som redan finns i modellernas träningsdata stannar där, och andra sajter som citerar dig är fortfarande läsbara. Blockering är motiverat om innehållet i sig är produkten, exempelvis bakom betalvägg. Notera också att träningsbotar och sökbotar är olika: du kan säga nej till träning och ja till citering.
Under 2023 la väldigt många svenska sajter in ett Disallow för GPTBot. Det var en rimlig reflex då — debatten handlade om att modeller tränades på andras innehåll utan ersättning.
Sedan dess har något ändrats: samma botar som hämtar träningsdata är i flera fall inte samma botar som hämtar underlag när någon ställer en fråga just nu. Och det är den andra sortens hämtning som avgör om du blir citerad.
Vem är vem
| Bot | Vem äger den | Vad den gör | Blockera? |
|---|---|---|---|
GPTBot |
OpenAI | Hämtar innehåll för träning | Ditt val |
OAI-SearchBot |
OpenAI | Hämtar för sökning i ChatGPT | Nej — det här är citeringen |
ChatGPT-User |
OpenAI | Hämtar när en användare klickar/ber om en sida | Nej |
Google-Extended |
Styr träning för Gemini | Ditt val | |
Googlebot |
Vanlig sökindexering, inkl. AI Overviews | Aldrig | |
PerplexityBot |
Perplexity | Hämtar för svar med källhänvisning | Nej |
CCBot |
Common Crawl | Öppet arkiv som många tränar på | Ditt val |
ClaudeBot |
Anthropic | Hämtar innehåll | Ditt val |
Namnen är hämtade ur leverantörernas egen dokumentation: OpenAI listar tre user agents, Anthropic tre, Perplexity två, Common Crawl en, och Google har en egen samlad lista.
Den viktigaste raden är Googlebot. Googles AI Overviews använder det vanliga sökindexet — du kan inte välja bort AI Overviews utan att välja bort Google helt. Det finns ingen separat spak, vilket Google skriver ut i sin guide om AI-funktioner.
Vad blockering faktiskt ger dig
Vad den gör: hindrar framtida hämtning av just din sajt av just den boten.
Vad den inte gör:
- Den tar inte bort dig ur modeller som redan tränats. Det som är inne är inne.
- Den hindrar inte andra från att skriva om dig. Citerar en branschsajt ditt påstående, läses det hos dem.
- Den hindrar inte människor från att klistra in din text i ett chattfönster.
- Den är ingen juridisk åtgärd.
robots.txtär en artighetsförfrågan, inte ett tekniskt hinder.
Vad det kostar
För ett litet företag som säljer en tjänst är innehållet marknadsföring, inte produkt. Att bli citerad är hela poängen. Att blockera är då som att be Google sluta indexera dig för att skydda texten på din startsida.
När blockering faktiskt är rätt
Det finns fall, och de har ett gemensamt drag: innehållet är produkten.
- Betalt redaktionellt material, kursinnehåll, rapporter du säljer.
- Databaser och register där sammanställningen är värdet.
- Bildarkiv och portföljer där verket i sig är varan.
Är du i något av de lägena är rätt åtgärd oftast inte robots.txt utan inloggning. Innehåll bakom autentisering hämtas inte av någon bot över huvud taget.
En rimlig mellanväg
Vill du säga nej till träning men ja till citering — det är ett fullt legitimt ställningstagande — går det att skilja på:
# Nej till träning
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
# Ja till att bli citerad när någon ställer en fråga
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
Vad vi själva gör
Vi släpper in allt, på den här sajten och på kundernas. Skälet är enkelt: våra kunder är småföretag som behöver bli hittade, och en text som ingen får läsa hjälper ingen att bli hittad.
Det är ett ställningstagande, inte en universell sanning. Är innehållet din vara ser räkningen annorlunda ut.
Kolla vad du har i dag
Öppna dinsajt.se/robots.txt. Står det Disallow: / under en AI-bot, kom det troligen dit 2023 och har aldrig omprövats sedan dess — ofta av ett insticksprogram, utan att någon fattade ett beslut.
Sidan är fri att läsa, citera och länka till. Hittar du ett fel eller en siffra som hunnit bli gammal — mejla hej@webraketen.se, så rättar vi och skriver ut ändringsdatumet.