SEO- ja GEO-opas · Tekoälyhaku

Tekoälyrobotit ja llms.txt

Lyhyesti

Tekoälyyhtiöillä on kolmenlaisia robotteja: koulutusrobotit keräävät aineistoa tulevien mallien opettamiseen, hakurobotit indeksoivat sivuja tekoälyhakua varten ja käyttäjän robotit hakevat sivun, kun joku pyytää avustajaa lukemaan sen. Robots.txt-tiedostolla voit sallia tai estää ne erikseen. Tärkein sääntö: hakurobotit kannattaa sallia, koulutusroboteista voi päättää erikseen.

Miksi sillä on väliä

Moni sivusto estää tekoälyrobotit vahingossa. Julkaisualustan tai palomuurin oletusasetus, tietoturvalisäosa tai vuonna 2023 tehty "estetään kaikki tekoälyt" -päätös voi pitää sivuston poissa ChatGPT:n ja Clauden hakuvastauksista. Et huomaa sitä mistään, koska tavallinen Google-näkyvyys pysyy ennallaan.

Mikä robotti tekee mitä

RobottiTehtäväJos estät sen
GPTBot (OpenAI)KoulutusSisältö ei päädy tuleviin malleihin. ChatGPT:n haku toimii yhä
OAI-SearchBot (OpenAI)ChatGPT:n hakuSivusi ei näy ChatGPT:n hakuvastauksissa
ChatGPT-User (OpenAI)Käyttäjän pyyntöOpenAI:n mukaan robots.txt ei välttämättä koske sitä
ClaudeBot (Anthropic)KoulutusSisältö ei päädy tuleviin malleihin
Claude-SearchBot (Anthropic)Clauden hakuNäkyvyys Clauden hakuvastauksissa voi heiketä
Claude-User (Anthropic)Käyttäjän pyyntöClaude ei voi hakea sivua käyttäjän pyynnöstä
Google-ExtendedGeminin koulutus ja vastauksetEi vaikuta Google-hakuun eikä AI-yhteenvetoihin
Applebot-ExtendedApplen mallien koulutusEi estä Siriä ja Spotlightia
CCBotCommon Crawl -aineistoSisältö ei päädy tuleviin Common Crawl -aineistoihin

Kaksi yleistä väärinkäsitystä: GPTBotin estäminen ei poista sivua ChatGPT:stä, koska lähteet hakee OAI-SearchBot. Google-Extendedin estäminen ei poista sivua AI-yhteenvedoista, koska ne käyttävät tavallista Googlebotia.

Entä llms.txt?

llms.txt on Jeremy Howardin vuonna 2024 ehdottama Markdown-tiedosto, joka tiivistää sivuston tärkeimmän sisällön kielimalleille. Ajatus on hyvä, mutta näyttö puuttuu:

  • Google ei käytä sitä. Googlen oma ohje tekoälyhakuun sanoo suoraan, ettei llms.txt:n kaltaisia erillisiä tiedostoja tarvita.
  • Yksikään suuri tekoälyyhtiö ei ole sitoutunut käyttämään sitä.
  • Ahrefs tutki 137 000 domainia. Noin 38 000 oli julkaissut llms.txt:n, ja niistä 97 % ei saanut yhtään pyyntöä.

Johtopäätös: llms.txt ei ole SEO- eikä GEO-keino. Sen tekeminen ei haittaa, ja siitä voi olla hyötyä kehittäjädokumentaatiossa. Mutta jos hakurobotit ovat estettyinä, llms.txt ei auta mitään. Meillä on sellainen, koska sen ylläpito on automatisoitu, ei siksi, että se nostaisi näkyvyyttä.

Näin se tehdään

  1. Avaa oma robots.txt. Se löytyy osoitteesta omasivusto.fi/robots.txt. Etsi rivit, joissa mainitaan yllä olevia robotteja.
  2. Salli hakurobotit. OAI-SearchBot, Claude-SearchBot, Googlebot ja Bingbot eivät saa olla Disallow-rivin takana.
  3. Päätä koulutusroboteista erikseen. GPTBotin, ClaudeBotin ja Google-Extendedin estäminen on liiketoimintapäätös, ei SEO-päätös. Useimmille pk-yrityksille niiden salliminen on järkevää, koska malli oppii silloin yrityksestä oikeat tiedot.
  4. Tarkista palomuuri. Cloudflaren ja muiden palveluiden bottiesto voi pysäyttää robotin ennen kuin robots.txt:tä edes luetaan. Palvelimen lokeissa se näkyy 403- tai 429-vastauksina.
  5. Katso lokeista, käyvätkö robotit. Jos OAI-SearchBotia ei näy lokeissa koskaan, jokin estää sen.

Musta hattu

Temppu: Robotti tekeytyy toiseksi väärennetyllä tunnisteella tai kiertää estot vaihtamalla IP-osoitetta. Toiseen suuntaan: sivusto näyttää tekoälyroboteille eri sisällön kuin ihmisille.

Miten kävi: Cloudflare syytti elokuussa 2025 Perplexityä estojen kiertämisestä, minkä Perplexity kiisti. Sivuston puolella eri sisällön näyttäminen roboteille on cloakingia, joka on ollut Googlen spam-käytäntöjen vastaista aina. Aitojen robottien IP-osoitteet löytyvät yhtiöiden julkaisemista listoista, joten tunnisteeseen ei tarvitse luottaa sokeasti.

Tarkistuslista

Käy kohdat läpi omalla sivustollasi. Valinnat tallentuvat vain tähän selaimeen.

Lähteet

  1. OpenAI: Overview of OpenAI crawlers
  2. Anthropic: Does Anthropic crawl data from the web, and how can site owners block the crawler?
  3. Google Search Central: Google's common crawlers (Google-Extended)
  4. Apple: About Applebot
  5. llmstxt.org: The /llms.txt file
  6. Google Search Central: Optimizing for generative AI features on Google Search
  7. Ahrefs: We analyzed 137K sites: 97% of llms.txt files never get read (5/2026)
  8. Cloudflare: Perplexity is using stealth, undeclared crawlers to evade website no-crawl directives (8/2025)

Tarkistettu 28.9.2026. Hakukoneiden ja tekoälypalveluiden käytännöt muuttuvat, joten päivitämme oppaan säännöllisesti.

Kumpi hattu sivustollasi on?

Katsotaan yhdessä, miten yrityksesi näkyy Googlessa ja tekoälyssä.

Tee maksuton GEO-testi ja näe, miten yrityksesi näkyy tekoälyhauissa. Tai anna meidän hoitaa koko homma: Huoleton SEO sisältää avainsanatutkimuksen, sisällön ja teknisen optimoinnin sekä kuukausiraportin.

Tee maksuton GEO-testi
Tutustu SEO-palveluun
Ajankohtaista Kaikki artikkelit
Päivystys

Päivystystyön ehdot

Lue hinta ja yhteydenotto-ohje ennen kuin jatkat päivystyspyyntöön.

Hinta 150 € aloitusmaksu + 120 € / alkava tunti Hinnat alv 0 %. Veloitus koskee myös ylläpitoasiakkaita.

Hätäpäivystyspyynnöt otetaan käsittelyyn mahdollisimman nopeasti, myös öisin, viikonloppuisin, arkipyhinä ja juhlapyhinä.

Lähetä tekstiviestillä tai WhatsAppilla laskutustiedot ja lyhyt kuvaus ongelmasta. Olemme yhteydessä, kun päivystyspyyntö on käsitelty. Numero ei vastaanota puheluita.

Hyväksyminen ei vielä lähetä pyyntöä tai tilaa työtä.

Labona

Jätä viesti

Kirjoita meille omin sanoin. Viesti menee suoraan oikealle tiimille.

Mitä viestisi koskee?

Käytämme antamiasi tietoja viestiisi vastaamiseen. Tietosuojaseloste