Sinulla on jo sitemap, olet lähettänyt sen Googlelle ja verkkosivustosi alkaa jo indeksoitua. Mutta eräänä päivänä huomaat, että verkkosivustosi hallintapaneeli (admin), sisäiset maksusivut tai staging-sivusto ilmestyvät Googlen hakutuloksiin. Kun asiakas hakee yrityksesi nimeä – hän näkee myös keskeneräisen testausversion.

Tai päinvastoin: julkaiset uuden blogikirjoituksen ja kahden viikon odotuksen jälkeen sitä ei vieläkään näy Googlesta. Kun kysyt tekniseltä tiimiltä, he sanovat: "Robots.txt-tiedosto estää Googlea indeksoimasta koko verkkosivustoa."

Molemmat tilanteet liittyvät pieneen tiedostoon, johon harva verkkosivuston ylläpitäjä kiinnittää huomiota: robots.txt.

Tämä artikkeli selittää, mitä robots.txt on, miten se toimii, milloin sitä tulee muokata ja mitä yleisiä virheitä yritysten tulee välttää – kaikki yksinkertaisella kielellä ja todellisin esimerkein.

Mitä robots.txt on? Selitys verkkosivuston ylläpitäjälle

Jos sitemap on kuin rakennuksen pohjapiirros, joka kertoo Googlelle, mitä huoneita on olemassa, niin robots.txt on kuin "Rajoitetun alueen" -kyltti, joka kertoo Googlelle, mihin huoneisiin ei saa mennä.

Teknisesti ottaen: robots.txt on pieni tekstitiedosto, joka sijaitsee verkkosivustosi juurihakemistossa (esimerkiksi: https://example.com/robots.txt). Tämä tiedosto sisältää sääntöjä, jotka kertovat hakukoneiden boteille – kuten Googlebotille – mitä:

  • Sivuja saa indeksoida (skannata)
  • Sivuja ei saa indeksoida (skannata)
  • Sitemap sijaitsee

Voit tarkastella minkä tahansa verkkosivuston robots.txt-tiedostoa kirjoittamalla: domainin-nimi.com/robots.txt selaimeesi.

💡 Tärkeää: robots.txt on vain kohtelias pyyntö, ei ehdoton kielto. Luotettavat botit, kuten Googlebot, noudattavat sitä, mutta pahantahtoiset botit (roskapostibotit, sivustojen kerääjät) voivat jättää sen huomiotta. Jos tarvitset todellista suojausta, käytä salasanaa tai palomuuria – älä luota robots.txt-tiedostoon.

Miltä robots.txt-tiedosto näyttää?

Sinun ei tarvitse kirjoittaa tätä tiedostoa tyhjästä. Mutta jotta ymmärtäisit, mitä näet, tässä on yksinkertainen robots.txt-tiedosto:

User-agent: *
Disallow: /admin/
Disallow: /thanh-toan/
Disallow: /staging/
Allow: /

Sitemap: https://example.com/sitemap.xml

Selitys riveittäin:

RiviMerkitys
User-agent: *Koskee kaikkia botteja (Google, Bing jne.)
Disallow: /admin/Älä anna bottien päästä hakemistoon /admin/
Disallow: /thanh-toan/Älä anna bottien päästä maksusivuille
Disallow: /staging/Älä anna bottien päästä staging-versioon
Allow: /Salli bottien indeksoida kaikki muu sisältö
Sitemap: https://...Kertoo boteille, missä sitemap sijaitsee

Tässä on monimutkaisempi esimerkki – sopii yrityksen verkkosivustolle, jossa on blogi, palvelusivut ja hallintoalue:

# Sallii kaikille boteille julkisen sisällön indeksoinnin
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /search?
Disallow: /*?ref=
Disallow: /*?utm_

# Sallii Googlebotin indeksoida CSS:n ja JS:n (tarvitaan sivun renderöintiin)
User-agent: Googlebot
Allow: /wp-content/uploads/
Allow: /wp-includes/

Sitemap: https://example.com/sitemap.xml
📝 Huomautus kehittäjille: Polun `` merkki on jokerimerkki – `/?utm_` tarkoittaa kaikkien `?utm_` parametria sisältävien URL-osoitteiden estämistä. `$` merkki polun lopussa vastaa tarkasti URL-osoitteen loppua. Esimerkiksi: `Disallow: /*.pdf$` estää kaikki PDF-tiedostot.

Miten robots.txt toimii SEO-prosessissa?

Ymmärtääksemme robots.txt-tiedoston paikan, katsotaanpa uudelleen prosessia, jolla Google tuo verkkosivustosi hakutuloksiin:

Crawl → Index → Rank
(Indeksointi) (Tallennus) (Sijoitus)

Robots.txt toimii ensimmäisessä vaiheessa – Crawl (Indeksointi).

Ennen kuin Googlebot alkaa skannata mitään sivustoasi, se tarkistaa ensin robots.txt-tiedoston. Jos URL on lueteltu Disallow-kohdassa, Googlebot ohittaa sivun – ei skannaa, ei lue sisältöä.

Googlebot haluaa indeksoida osoitteen https://example.com/admin/settings
→ Tarkistaa robots.txt-tiedoston
→ Näkee Disallow: /admin/
→ Ohittaa, ei indeksoi

Googlebot haluaa indeksoida osoitteen https://example.com/dich-vu/
→ Tarkistaa robots.txt-tiedoston
→ Ei estettyä
→ Indeksoi normaalisti → Tallentaa → Voi ilmestyä hakutuloksiin

Robots.txt ja sitemap: täydentävä pari

TiedostoRooli
Sitemap"Tämä on luettelo sivuista, jotka haluan Googlen tietävän"
Robots.txt"Nämä ovat sivut, joita en halua Googlen skannaavan"

Nämä kaksi tiedostoa eivät ole ristiriidassa – ne toimivat yhdessä. Sitemap näyttää tien, robots.txt asettaa esteet. Kun yhdistät ne oikein, hallitset sitä, mitä Google näkee ja mitä se jättää huomiotta verkkosivustollasi.

Mihin robots.txt:tä käytetään? 4 yleistä tapausta

1. Hallintapaneeli- ja sisäsivujen piilottaminen Googlelta

Admin-sivut, CMS-taustajärjestelmät, staging-sivustot, testaus-sivustot – kaikki eivät saisi näkyä Googlesta. Robots.txt auttaa sinua kertomaan Googlelle: "Älä mene tänne."

Disallow: /admin/
Disallow: /wp-admin/
Disallow: /staging/

2. "Crawl budgetin" tuhlaamisen välttäminen

Google ei indeksoi rajattomasti. Jokaisella verkkosivustolla on "crawl budget" – sivujen määrä, jonka Googlebot skannaa jokaisella vierailulla. Jos verkkosivustolla on paljon epäolennaisia sivuja (sisäiset hakusivut, suodatinsivut, sivutus-sivut), Googlebot saattaa keskittyä näiden sivujen skannaamiseen tärkeämpien palvelu- tai blogisivujen sijaan.

Disallow: /search?
Disallow: /tag/
Disallow: /page/
💡 Crawl budget on pääasiassa tärkeä suurille verkkosivustoille (tuhansia sivuja). Pienet yritysten verkkosivustot eivät yleensä tarvitse sitä liikaa, mutta robots.txt-tiedoston siistinä pitäminen on silti hyvä tapa.

3. Duplikaattisisällön estäminen

Jos verkkosivustollasi on useita URL-osoitteita, jotka johtavat samaan sisältöön (esimerkiksi URL-osoitteet seurantaparametreilla ?utm_source=facebook tai tulostusversio ?print=true), voit estää nämä duplikaattiosoitteet:

Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?print=

4. Suuntiminen sitemap-tiedostoon

Robots.txt on ensimmäinen paikka, josta Googlebot tarkistaa saapuessaan verkkosivustolle. Sitemapin sijainnin määrittäminen täällä auttaa Googlea löytämään sitemapin nopeammin – vaikka et olisikaan vielä lähettänyt sitä Search Consoleen.

Sitemap: https://example.com/sitemap.xml

Milloin yrityksen tulee kiinnittää huomiota robots.txt-tiedostoon?

Sinun ei aina tarvitse muokata robots.txt-tiedostoa. Mutta on aikoja, jolloin tämän tiedoston tarkistaminen on pakollista:

Kun verkkosivusto otetaan käyttöön (go-live)

Tämä on tärkein hetki. Monet verkkosivustot estävät indeksoinnin kokonaan, koska kehittäjät unohtavat poistaa rivin Disallow: / – rivin, jonka he asettivat staging-vaiheen aikana estääkseen Googlea indeksoimasta keskeneräistä versiota.

Tarkistus go-live-vaiheessa:

KohdeTarkistustapa
Robots.txt-tiedosto on olemassaAvaa https://domainin-nimi.com/robots.txt selaimella
Ei estä koko verkkosivustoaVarmista, että RIVILLÄ Disallow: / EI OLE
Sitemap on määritettyVarmista, että RIVILLÄ Sitemap: https://domainin-nimi.com/sitemap.xml ON
Tärkeät sivut eivät ole estettyjäTarkista, että palvelu-, blogi- ja yhteystietosivut eivät ole Disallow-kohdassa

✅ Kun verkkosivustoa ei indeksoida Googleen viikkoihin

Jos sinulla on sitemap, olet lähettänyt sen Search Consoleen, mutta Google ei silti indeksoi sitä – robots.txt on ensimmäinen epäilty, joka on tarkistettava.

Kun lisäät alueita, jotka haluat piilottaa (jäsensivut, sisäiset sivut)

Jos verkkosivustollesi lisätään tilinhallintasivuja, jäsenalueita tai sisäisiä sivuja – päivitä robots.txt estääksesi nämä alueet.

Kun verkkosivuston alusta tai ulkoasu muutetaan

Jokainen alusta (WordPress, Webflow, räätälöity koodi) luo erilaisen URL-rakenteen. Siirrettäessä vanha robots.txt saattaa estää uusia sivuja virheellisesti tai jättää estämättä tarvittavat sivut.

Kun Search Console ilmoittaa virheestä "Blocked by robots.txt"

Google Search Console tarjoaa Indexing (Indeksointi) -raportin, joka kertoo, mitkä sivut on estetty robots.txt-tiedoston toimesta. Jos löydät tärkeän sivun estettynä – se on aika muokata tiedostoa välittömästi.

5 yleistä robots.txt-virhettä ja niiden korjaaminen

Virhe 1: Koko verkkosivuston estäminen – vakavin virhe

Ilmenemismuoto: Yhtään sivua ei indeksoida Googleen. Search Console ilmoittaa lukuisista sivuista "Blocked by robots.txt".

Syy: Robots.txt-tiedostossa on:

User-agent: 
Disallow: /

Nämä kaksi riviä tarkoittavat: "Kielletään kaikki botit pääsemästä mille tahansa sivulle." Tämä tapahtuu yleensä, kun kehittäjät asettavat tämän säännön staging-vaiheessa ja unohtavat poistaa sen go-live-vaiheessa.

Korjaus: Muuta seuraavasti:

User-agent: *
Disallow:

Sitemap: https://domainin-nimi.com/sitemap.xml

Disallow: (ei mitään kaksoispisteen jälkeen) = salli kaiken indeksoinnin.

⚠️ Tämä on numero 1 virhe, jonka näemme uusilla yritysten verkkosivustoilla. Korjauksen jälkeen Google saattaa kestää muutamasta päivästä useisiin viikkoihin indeksoidakseen sivuston uudelleen. Lähetä sitemap uudelleen Search Consoleen prosessin nopeuttamiseksi.

Virhe 2: CSS:n ja JavaScriptin estäminen

Ilmenemismuoto: Verkkosivusto näyttää normaalilta selaimessa, mutta kun käytät Search Consolessa "URL Inspection" -työkalua, Google näkee sivun rikkinäisenä tai tyhjänä.

Syy: Robots.txt estää CSS- ja JS-hakemistot:

Disallow: /wp-content/
Disallow: /wp-includes/

Google tarvitsee CSS:n ja JS:n lukeakseen ymmärtääkseen, miltä sivu näyttää (tätä kutsutaan "renderöinniksi"). Jos ne ovat estettyjä, Google ei voi renderöidä sivua → ei ymmärrä sisältöä → vaikuttaa sijoitukseen.

Korjaus:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Allow: /wp-content/
Allow: /wp-includes/
📝 Huomautus kehittäjille: Vuodesta 2014 lähtien Google on selvästi suositellut: älä estä CSS:ää, JS:ää ja kuvia robots.txt-tiedostossa. Googlebot tarvitsee näitä resursseja sivun renderöimiseksi oikein. Käytä URL Inspection -työkalua Search Consolessa tarkistaaksesi, miten Google renderöi sivusi.

Virhe 3: Tärkeiden sivujen virheellinen estäminen

Ilmenemismuoto: Palvelusivut, tuotesivut tai blogikirjoitukset eivät ilmesty Googlen hakutuloksiin – vaikka sitemap sisältäisi ne.

Syy: Robots.txt-sääntö on liian laaja. Esimerkiksi:

Disallow: /dich-vu

Tämä rivi estää paitsi /dich-vu/, myös /dich-vu-thiet-ke-web/, /dich-vu-seo/ ja kaikkien URL-osoitteiden, jotka alkavat /dich-vu.

Korjaus: Lisää kauttaviiva / polun loppuun estääksesi tarkan hakemiston:

Disallow: /dich-vu-noi-bo/

Tai käytä Allow-sääntöä suojataksesi tarvitsemasi sivun:

Disallow: /dich-vu-noi-bo/
Allow: /dich-vu/
Allow: /dich-vu-thiet-ke-web/
📝 Huomautus kehittäjille: `Allow`- ja `Disallow`-sääntöjen järjestys vaikuttaa. Googlebot käyttää tarkinta (most specific path) sääntöä. Jos polut ovat samanpituisia, `Allow` on etusijalla `Disallow`-sääntöön nähden. Testaa aina [Robots Testing Tool](https://support.google.com/webmasters/answer/6062598) -työkalulla Search Consolessa ennen käyttöönottoa.

Virhe 4: Robots.txt-tiedoston puuttuminen

Ilmenemismuoto: Kirjoitat domainin-nimi.com/robots.txt → saat 404-virheen.

Syy: Manuaalisesti tehty verkkosivusto, jossa kehittäjä ei ole luonut tätä tiedostoa. Tai tiedosto on poistettu vahingossa käyttöönoton yhteydessä.

Vaikutus: Ei niin vakava kuin virhe 1 – jos robots.txt-tiedostoa ei ole, Google indeksoi oletuksena kaiken. Mutta tämä tarkoittaa:

  • Google indeksoi admin-sivut, testaus-sivut, sisäiset sivut
  • Sinulla ei ole tapaa ohjata sitemap-tiedostoon robots.txt:n kautta
  • Perushallinta puuttuu

Korjaus: Luo robots.txt-tiedosto juurihakemistoon. Vähimmäissisältö:

User-agent: *
Disallow: /admin/
Disallow: /search?

Sitemap: https://domainin-nimi.com/sitemap.xml

Virhe 5: Robots.txt:n käyttäminen sivujen piilottamiseen Googlelta (väärä käyttötarkoitus)

Ilmenemismuoto: Estät sivun Disallow-säännöllä, mutta sivu ilmestyy silti Googleen – vaikka ilman sisältökatkelmaa.

Syy: Robots.txt estää indeksoinnin (skannaamisen), ei tallennusta (indeksoinnin). Jos sivu on jo indeksoitu aiemmin tai siitä on linkki toiselta verkkosivustolta, Google saattaa säilyttää URL-osoitteen hakutuloksissa – se vain ei näytä sisältöä.

Oikea korjaus:

TavoiteMitä käytetään
Ei halua Googlen indeksoivan (skannaavan)Disallow robots.txt-tiedostossa
Ei halua Googlen tallentavan (näyttävän)<meta name="robots" content="noindex"> HTML-koodissa
Ei halua kumpaakaanKäytä noindex HTML-koodissa (ja älä estä robots.txt-tiedostossa)
⚠️ Tämä on yleisin väärinkäsitys: Jos estät sekä indeksoinnin (robots.txt) että asetat `noindex` (HTML), Google ei näe noindex-tagia, koska se ei indeksoi sivua – ja sivu saattaa silti tallentua. Ratkaisu: käytä `noindex` HTML-koodissa ja poista `Disallow`-sääntö kyseiselle sivulle robots.txt-tiedostosta.

Robots.txt-malli yrityksen verkkosivustolle

Tässä on malli robots.txt-tiedostosta, joka sopii useimmille pk-yritysten verkkosivustoille:

# =============================================
# Yrityksen verkkosivuston Robots.txt
# Päivitetty: 2026-04-20
# =============================================

# Koskee kaikkia botteja
User-agent: *

# Estää hallinto- ja sisäiset alueet
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /dashboard/
Disallow: /staging/

# Estää sisäiset hakusivut (välttää crawl budgetin tuhlaamisen)
Disallow: /search?
Disallow: /*?s=

# Estää URL-osoitteet seurantaparametreilla (välttää duplikaattisisältöä)
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?fbclid=

# Estää ostoskorin / maksusivut (jos on)
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/

# Sallii CSS:n, JS:n, kuvat (Google tarvitsee sivun renderöintiin)
Allow: /wp-content/uploads/
Allow: /wp-content/themes/
Allow: /wp-includes/

# Suuntiminen sitemap-tiedostoon
Sitemap: https://domainin-nimi.com/sitemap.xml
📝 Huomautus kehittäjille: Robots.txt-tiedoston on oltava juuriverkkotunnuksessa – `https://example.com/robots.txt`. Ei `/blog/robots.txt` tai muussa alihakemistossa. Jokainen aliverkkotunnus tarvitsee oman robots.txt-tiedostonsa (esimerkiksi `blog.example.com/robots.txt` erillään `example.com/robots.txt`).

Miten tarkistaa oman verkkosivustosi robots.txt-tiedosto

Tapa 1: Tarkista suoraan selaimella

Kirjoita https://oman-verkkosivustosi-nimi.com/robots.txt osoiteriville. Näet tiedoston sisällön tekstimuodossa. Jos näet 404-virheen – verkkosivustolla ei ole robots.txt-tiedostoa.

Tapa 2: Käytä Google Search Consolea

  1. Kirjaudu sisään Google Search Consoleen
  2. Mene kohtaan SettingsCrawlingrobots.txt
  3. Katso robots.txt-tiedosto, jonka Google lukee
  4. Tarkista, onko tietty URL-osoite estetty

Tapa 3: Tarkista Indeksointi-raportista

Search Consolessa → Pages (tai Indexing) → Etsi kohta "Blocked by robots.txt". Jos tärkeitä sivuja on luettelossa – sinun on korjattava robots.txt-tiedosto välittömästi.

💡 On suositeltavaa tarkistaa robots.txt-tiedosto vähintään kerran vuosineljänneksessä tai aina, kun verkkosivustolla tapahtuu suuria muutoksia (sivujen lisäys, rakenteen muutos, alustan vaihto).

Yhteenveto: Mitä robots.txt-tiedoston tulisi estää ja mitä ei

✅ PITÄISI estää❌ EI PITÄISI estää
Hallintapaneelisivut (/admin/, /wp-admin/)Etusivu, palvelusivut, yhteystietosivu
Staging / testaus-sivutBlogikirjoitukset, artikkelit
Sisäiset hakusivut (/search?)CSS- ja JavaScript-tiedostot
URL-osoitteet seurantaparametreilla (?utm_, ?fbclid=)Kuvat (Google Images tuo myös liikennettä)
Ostoskorin, maksun, henkilökohtaisen tilin sivutSitemap
Duplikaattisisällön sivut (suodattimet, lajittelut, sivutus)FAQ-sivut, tapaustutkimukset

Usein kysytyt kysymykset robots.txt-tiedostosta

Miten robots.txt ja sitemap eroavat toisistaan?

Sitemap sanoo: "Tämä on sivu, jonka haluan Googlen tietävän." Robots.txt sanoo: "Tämä on sivu, jota en halua Googlen skannaavan." Kaksi tiedostoa täydentävät toisiaan – sitemap näyttää tien sisään, robots.txt asettaa esteitä.

Jos robots.txt-tiedostoa ei ole, indeksoiko Google verkkosivuston?

Kyllä. Jos robots.txt-tiedostoa ei ole, Google indeksoi oletuksena kaiken – jopa sivut, joita et halua. Siksi tämä tiedosto on olemassa.

Käytän WordPressiä, missä robots.txt sijaitsee?

WordPress luo virtuaalisen robots.txt-tiedoston automaattisesti. Jos käytät SEO-lisäosaa, kuten Yoast tai Rank Math, voit muokata robots.txt-tiedostoa suoraan lisäosassa ilman pääsyä palvelimeen.

Vaikuttaako robots.txt verkkosivuston nopeuteen?

Ei. Tämä tiedosto on vain muutaman kilotavun kokoinen. Se ei vaikuta sivun latausnopeuteen.

Estin sivun robots.txt-tiedoston avulla, mutta sivu ilmestyi silti Googleen?

Koska robots.txt estää vain indeksoinnin (skannaamisen), ei tallennusta (indeksoinnin). Jos haluat sivun katoavan kokonaan Google-hausta, käytä HTML-koodissa <meta name="robots" content="noindex"> -tagia – ja älä estä kyseistä sivua robots.txt-tiedostossa (jotta Google voi lukea noindex-tagin).

Robots.txt-tiedoston muokkaamisen jälkeen, kauanko Googlen kestää päivittää?

Google tarkistaa robots.txt-tiedoston yleensä uudelleen 24–48 tunnin kuluessa. Voit pyytää Googlea tarkistamaan sen uudelleen aiemmin Search Consolessa → Settings → Crawling.

Yhteenveto

Robots.txt on pieni tiedosto – yleensä vain muutama rivi – mutta se vaikuttaa suoraan siihen, näkeekö Google verkkosivustosi vai ei.

Muistettavaa:

  1. Robots.txt on "Rajoitetun alueen" -kyltti: kertoo Googlelle, mitä sivuja ei saa skannata
  2. Tarkista heti verkkosivuston julkaisun yhteydessä: koko verkkosivuston estäminen on yleisin ja vakavin virhe
  3. Älä käytä robots.txt:tä sivujen piilottamiseen Googlelta: se estää skannaamisen, ei tallennusta
  4. Salli aina CSS ja JS: Google tarvitsee niitä sivun renderöintiin
  5. Yhdistä sitemapin ja Search Consoln kanssa: täydellistä hallintaa varten Google-indeksointiin ja skannaamiseen

Tarkista verkkosivustosi alusta

Robots.txt on vain yksi monista teknisistä tekijöistä, jotka vaikuttavat SEO:hon. Jos mietit: "Onko verkkosivustoni asetettu oikein?" – vastaus löytyy käyttämästäsi alustasta.

GTG CRM auttaa sinua luomaan verkkosivuston, jossa on asianmukainen robots.txt, automaattinen sitemap ja teknisesti valmis rakenne Googlelle – sinun ei tarvitse huolehtia yksittäisten tiedostojen ja rivien muokkaamisesta.

Muuta juuri lukemasi käytännön tuloksiksi – sovella GTG CRM:llä, ilmaiseksi.

Sovella nyt