Miksi sillä on väliä
Moni sivusto estää tekoälyrobotit vahingossa. Julkaisualustan tai palomuurin oletusasetus, tietoturvalisäosa tai vuonna 2023 tehty "estetään kaikki tekoälyt" -päätös voi pitää sivuston poissa ChatGPT:n ja Clauden hakuvastauksista. Et huomaa sitä mistään, koska tavallinen Google-näkyvyys pysyy ennallaan.
Mikä robotti tekee mitä
| Robotti | Tehtävä | Jos estät sen |
|---|---|---|
| GPTBot (OpenAI) | Koulutus | Sisältö ei päädy tuleviin malleihin. ChatGPT:n haku toimii yhä |
| OAI-SearchBot (OpenAI) | ChatGPT:n haku | Sivusi ei näy ChatGPT:n hakuvastauksissa |
| ChatGPT-User (OpenAI) | Käyttäjän pyyntö | OpenAI:n mukaan robots.txt ei välttämättä koske sitä |
| ClaudeBot (Anthropic) | Koulutus | Sisältö ei päädy tuleviin malleihin |
| Claude-SearchBot (Anthropic) | Clauden haku | Näkyvyys Clauden hakuvastauksissa voi heiketä |
| Claude-User (Anthropic) | Käyttäjän pyyntö | Claude ei voi hakea sivua käyttäjän pyynnöstä |
| Google-Extended | Geminin koulutus ja vastaukset | Ei vaikuta Google-hakuun eikä AI-yhteenvetoihin |
| Applebot-Extended | Applen mallien koulutus | Ei estä Siriä ja Spotlightia |
| CCBot | Common Crawl -aineisto | Sisältö ei päädy tuleviin Common Crawl -aineistoihin |
Kaksi yleistä väärinkäsitystä: GPTBotin estäminen ei poista sivua ChatGPT:stä, koska lähteet hakee OAI-SearchBot. Google-Extendedin estäminen ei poista sivua AI-yhteenvedoista, koska ne käyttävät tavallista Googlebotia.
Entä llms.txt?
llms.txt on Jeremy Howardin vuonna 2024 ehdottama Markdown-tiedosto, joka tiivistää sivuston tärkeimmän sisällön kielimalleille. Ajatus on hyvä, mutta näyttö puuttuu:
- Google ei käytä sitä. Googlen oma ohje tekoälyhakuun sanoo suoraan, ettei llms.txt:n kaltaisia erillisiä tiedostoja tarvita.
- Yksikään suuri tekoälyyhtiö ei ole sitoutunut käyttämään sitä.
- Ahrefs tutki 137 000 domainia. Noin 38 000 oli julkaissut llms.txt:n, ja niistä 97 % ei saanut yhtään pyyntöä.
Johtopäätös: llms.txt ei ole SEO- eikä GEO-keino. Sen tekeminen ei haittaa, ja siitä voi olla hyötyä kehittäjädokumentaatiossa. Mutta jos hakurobotit ovat estettyinä, llms.txt ei auta mitään. Meillä on sellainen, koska sen ylläpito on automatisoitu, ei siksi, että se nostaisi näkyvyyttä.
Näin se tehdään
- Avaa oma robots.txt. Se löytyy osoitteesta omasivusto.fi/robots.txt. Etsi rivit, joissa mainitaan yllä olevia robotteja.
- Salli hakurobotit. OAI-SearchBot, Claude-SearchBot, Googlebot ja Bingbot eivät saa olla Disallow-rivin takana.
- Päätä koulutusroboteista erikseen. GPTBotin, ClaudeBotin ja Google-Extendedin estäminen on liiketoimintapäätös, ei SEO-päätös. Useimmille pk-yrityksille niiden salliminen on järkevää, koska malli oppii silloin yrityksestä oikeat tiedot.
- Tarkista palomuuri. Cloudflaren ja muiden palveluiden bottiesto voi pysäyttää robotin ennen kuin robots.txt:tä edes luetaan. Palvelimen lokeissa se näkyy 403- tai 429-vastauksina.
- Katso lokeista, käyvätkö robotit. Jos OAI-SearchBotia ei näy lokeissa koskaan, jokin estää sen.
Musta hattu
Temppu: Robotti tekeytyy toiseksi väärennetyllä tunnisteella tai kiertää estot vaihtamalla IP-osoitetta. Toiseen suuntaan: sivusto näyttää tekoälyroboteille eri sisällön kuin ihmisille.
Miten kävi: Cloudflare syytti elokuussa 2025 Perplexityä estojen kiertämisestä, minkä Perplexity kiisti. Sivuston puolella eri sisällön näyttäminen roboteille on cloakingia, joka on ollut Googlen spam-käytäntöjen vastaista aina. Aitojen robottien IP-osoitteet löytyvät yhtiöiden julkaisemista listoista, joten tunnisteeseen ei tarvitse luottaa sokeasti.
Tarkistuslista
Käy kohdat läpi omalla sivustollasi. Valinnat tallentuvat vain tähän selaimeen.
Lähteet
- OpenAI: Overview of OpenAI crawlers
- Anthropic: Does Anthropic crawl data from the web, and how can site owners block the crawler?
- Google Search Central: Google's common crawlers (Google-Extended)
- Apple: About Applebot
- llmstxt.org: The /llms.txt file
- Google Search Central: Optimizing for generative AI features on Google Search
- Ahrefs: We analyzed 137K sites: 97% of llms.txt files never get read (5/2026)
- Cloudflare: Perplexity is using stealth, undeclared crawlers to evade website no-crawl directives (8/2025)
Tarkistettu 28.9.2026. Hakukoneiden ja tekoälypalveluiden käytännöt muuttuvat, joten päivitämme oppaan säännöllisesti.