Mikä on Robots.txt ja milloin yrityksen tulee kiinnittää huomiota tähän tiedostoon?

Sinulla on sitemap, olet lähettänyt sen Googlelle, ja verkkosivustosi alkaa indeksoitua. Mutta eräänä päivänä huomaat, että verkkosivustosi hallintapaneeli (admin), sisäiset maksusivut tai staging-sivut ilmestyvät Googleen. Asiakkaat kirjoittavat yrityksen nimen – näkevät jopa keskeneräisen testin.

Tai päinvastoin: julkaiset uuden blogikirjoituksen, odotat kaksi viikkoa, eikä se näy edelleenkään Googlella. Kysyt tekniseltä tiimiltä, he sanovat: "Robots.txt-tiedosto estää Googlea indeksoimasta koko verkkosivustoa."

Molemmat tilanteet liittyvät pieneen tiedostoon, johon harvat verkkosivujen ylläpitäjät kiinnittävät huomiota: robots.txt.

Tämä artikkeli selittää, mikä robots.txt on, miten se toimii, milloin sitä tulee muokata ja yleisimmät virheet, joita yritysten tulee välttää – kaikki yksinkertaisella kielellä ja todellisin esimerkein.

Mikä on Robots.txt? Selitys verkkosivujen ylläpitäjille

Jos sitemap on rakennuksen pohjapiirros – kertoo Googlelle, mitä huoneita on olemassa – niin robots.txt on "Rajoitetun alueen" kyltti – kertoo Googlelle, mihin huoneisiin ei saa mennä.

Teknisesti sanottuna: robots.txt on pieni tekstitiedosto, joka sijaitsee verkkosivustosi juurihakemistossa (esimerkiksi: https://example.com/robots.txt). Tämä tiedosto sisältää sääntöjä, jotka kertovat hakukoneiden boteille – kuten Googlebotille –:

  • Mitkä sivut saa indeksoida (skannata)
  • Mitkä sivut ei saa indeksoida
  • Missä sitemap sijaitsee

Voit tarkastella minkä tahansa verkkosivuston robots.txt-tiedostoa kirjoittamalla: verkkotunnus.com/robots.txt selaimeen.

💡 Tärkeää: robots.txt on vain kohtelias pyyntö, ei ehdoton kielto. Uskottavat botit, kuten Googlebot, noudattavat sitä, mutta huonot botit (roskaposti, kaapijat) voivat jättää sen huomiotta. Jos tarvitset todellista turvallisuutta, käytä salasanaa tai palomuuria – älä luota robots.txt-tiedostoon.

Miltä Robots.txt-tiedosto näyttää?

Sinun ei tarvitse kirjoittaa tätä tiedostoa tyhjästä. Mutta jotta ymmärrät, kun katsot sitä, tässä on yksinkertainen robots.txt-tiedosto:

User-agent: *
Disallow: /admin/
Disallow: /thanh-toan/
Disallow: /staging/
Allow: /

Sitemap: https://example.com/sitemap.xml

Selitys riveittäin:

RiviMerkitys
User-agent: *Koskee kaikkia botteja (Google, Bing jne.)
Disallow: /admin/Älä anna bottien mennä hakemistoon /admin/
Disallow: /thanh-toan/Älä anna bottien mennä maksusivulle
Disallow: /staging/Älä anna bottien mennä staging-versioon
Allow: /Anna bottien indeksoida kaikki muu
Sitemap: https://...Kertoo botille, missä sitemap sijaitsee

Alla on monimutkaisempi esimerkki – sopii yrityksen verkkosivustolle, jossa on blogi, palvelusivut ja hallintoalue:

# Anna kaikkien bottien indeksoida julkinen sisältö
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /search?
Disallow: /*?ref=
Disallow: /*?utm_

# Anna Googlebotin indeksoida CSS ja JS (tarvitaan sivun renderöintiin)
User-agent: Googlebot
Allow: /wp-content/uploads/
Allow: /wp-includes/

Sitemap: https://example.com/sitemap.xml

📝 Huomautus kehittäjille: wildcard-merkki * polussa on jokerimerkki — /?utm_ tarkoittaa estää kaikki URL-osoitteet, jotka sisältävät parametrin ?utm_. $-merkki polun lopussa käytetään täsmälliseen URL-osoitteen loppuun kohdistamiseen. Esimerkiksi: Disallow: /*.pdf$ estää kaikki PDF-tiedostot.

---

Miten Robots.txt toimii SEO-prosessissa?

Ymmärtääksesi robots.txt:n paikan, katsotaanpa uudelleen prosessia, jolla Google tuo verkkosivun hakutuloksiin:

Crawl → Index → Rank
(Indeksointi) (Tallennus) (Sijoitus)

Robots.txt toimii ensimmäisessä vaiheessa – Crawl.

Ennen kuin Googlebot alkaa skannata mitään verkkosivustosi sivua, se tarkistaa ensin robots.txt-tiedoston. Jos URL on lueteltu Disallow-kohdassa, Googlebot ohittaa sivun – ei skannaa, ei lue sisältöä.

Googlebot haluaa indeksoida https://example.com/admin/settings
→ Tarkistaa robots.txt
→ Näkee Disallow: /admin/
→ Ohittaa, ei indeksoi

Googlebot haluaa indeksoida https://example.com/dich-vu/
→ Tarkistaa robots.txt
→ Ei estetty
→ Indeksoi normaalisti → Tallentaa → Voi ilmestyä hakutuloksiin

Robots.txt ja sitemap: täydentävä pari

TiedostoRooli
Sitemap"Tässä on luettelo sivuista, jotka haluan Googlen tietävän"
Robots.txt"Tässä ovat sivut, joita en halua Googlen skannaavan"

Nämä kaksi tiedostoa eivät ole ristiriidassa – ne toimivat yhdessä. Sitemap näyttää reitin, robots.txt asettaa esteitä. Kun yhdistät ne oikein, hallitset sitä, mitä Google näkee ja mitä se ohittaa verkkosivustollasi.

Mihin Robots.txt:tä käytetään? 4 yleistä tapausta

1. Piilota hallintapaneelit ja sisäiset sivut Googlelta

Admin-sivut, CMS-taustajärjestelmän sivut, staging-sivut, testaus-sivut – mikään niistä ei saisi ilmestyä Googleen. Robots.txt auttaa sinua kertomaan Googlelle: "Älä mene tänne."

Disallow: /admin/
Disallow: /wp-admin/
Disallow: /staging/

2. Vältä "crawl budgetin" tuhlausta

Google ei indeksoi rajattomasti. Jokaisella verkkosivustolla on "crawl budget" – sivujen määrä, jonka Googlebot skannaa jokaisella vierailulla. Jos verkkosivustolla on paljon merkityksettömiä sivuja (sisäiset hakusivut, suodatus-sivut, sivutus-sivut), Googlebot voi käyttää aikansa näiden sivujen skannaamiseen tärkeiden palvelu- tai blogisivujen sijaan.

Disallow: /search?
Disallow: /tag/
Disallow: /page/

💡 Crawl budget on pääasiassa tärkeä suurille verkkosivustoille (tuhansia sivuja). Pienet yritysverkkosivustot eivät yleensä tarvitse liikaa huolta, mutta robots.txt:n pitäminen siistinä on silti hyvä tapa.

3. Estä päällekkäinen sisältö

Jos useat URL-osoitteet johtavat samaan sisältöön (esimerkiksi URL, jossa on seurantaparametri ?utm_source=facebook, tai tulostusversio ?print=true), voit estää nämä päällekkäiset URL-osoitteet:

Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?print=

4. Ohjaa sitemapin luo

Robots.txt on ensimmäinen paikka, jota Googlebot tarkistaa saapuessaan verkkosivustolle. Sitemap-osoitteen sijoittaminen tänne auttaa Googlea löytämään sitemapin nopeammin – jopa silloin, kun et ole vielä lähettänyt sitä Search Consolessa.

Sitemap: https://example.com/sitemap.xml

Milloin yrityksen tulee kiinnittää huomiota robots.txt-tiedostoon?

Sinun ei aina tarvitse muokata robots.txt-tiedostoa. Mutta on aikoja, jolloin tämän tiedoston tarkistaminen on pakollista:

Kun verkkosivusto otetaan käyttöön (go-live)

Tämä on tärkein hetki. Monet verkkosivustot estetään kokonaan indeksoinnilta, koska kehittäjät unohtavat poistaa rivin Disallow: / – rivin, jonka he asettivat staging-prosessin aikana, jotta Google ei indeksoisi keskeneräistä versiota.

Tarkista käyttöönottovaiheessa:

LuokkaTarkistustapa
Robots.txt-tiedosto on olemassaAvaa https://verkkotunnus.com/robots.txt selaimessa
Ei estä koko verkkosivustoaVarmista, että EI ole riviä Disallow: /
Sitemap on määriteltyVarmista, että ON rivi Sitemap: https://verkkotunnus.com/sitemap.xml
Tärkeät sivut eivät ole estettyjäTarkista, että palvelusivut, blogi, yhteystiedot eivät ole Disallow-kohdassa

✅ Kun verkkosivustoa ei indeksoida Googleen viikkoihin

Jos sinulla on sitemap ja olet lähettänyt sen Search Consolessa, mutta Google ei silti indeksoi – robots.txt on ensimmäinen epäilty, jota tulee tarkistaa.

Kun lisätään piilotettava alue (jäsenalue, sisäiset sivut)

Jos verkkosivusto lisää käyttäjätilien hallintasivuja, jäsenalueita tai sisäisiä sivuja – päivitä robots.txt-tiedosto estämään nämä alueet.

Kun verkkosivuston alusta vaihtuu tai se uudistetaan

Jokainen alusta (WordPress, Webflow, custom code) luo erilaisen URL-rakenteen. Kun siirryt, vanha robots.txt-tiedosto voi estää uusia sivuja virheellisesti tai jättää estettäviä sivuja huomiotta.

Kun Search Console ilmoittaa virheen "Blocked by robots.txt"

Google Search Console tarjoaa Indexing-raportin, joka näyttää, mitkä sivut on estetty robots.txt-tiedostolla. Jos näet tärkeän sivun olevan estetty – se on aika muokata tiedostoa välittömästi.

5 yleistä robots.txt-virhettä ja niiden korjaus

Virhe 1: Koko verkkosivuston estäminen – vakavin virhe

Oire: Yhtäkään sivua ei indeksoida Googleen. Search Console ilmoittaa suuria määriä sivuja "Blocked by robots.txt".

Syy: Robots.txt-tiedosto sisältää:

User-agent: 
Disallow: /

Nämä kaksi riviä tarkoittavat: "Kielletty kaikilta boteilta mennä mille tahansa sivulle." Tämä tapahtuu yleensä, kun kehittäjä asettaa tämän säännön staging-vaiheen aikana ja unohtaa poistaa sen käyttöönottovaiheen yhteydessä.

Korjaus: Muuta muotoon:

User-agent: *
Disallow:

Sitemap: https://verkkotunnus.com/sitemap.xml

Disallow: (ei mitään kaksoispisteen jälkeen) = sallii kaiken indeksoinnin.

⚠️ Tämä on #1 virhe, jonka näemme uusilla yritysverkkosivustoilla. Korjauksen jälkeen Google voi kestää muutamasta päivästä useisiin viikkoihin indeksoidakseen sivut uudelleen. Lähetä sitemap uudelleen Search Consolessa nopeuttaaksesi prosessia.

---

Virhe 2: CSS ja JavaScriptin estäminen

Oire: Verkkosivusto näyttää normaalilta selaimessa, mutta kun käytät Search Consolessa "URL Inspection" -työkalua, Google näkee sivun vääristyneenä tai tyhjänä sisällöltään.

Syy: Robots.txt estää CSS- ja JS-hakemistot:

Disallow: /wp-content/
Disallow: /wp-includes/

Google tarvitsee CSS:n ja JS:n lukemista ymmärtääkseen, miltä sivu näyttää (ns. "renderöinti"). Jos se on estetty, Google ei voi renderöidä sivua → ei ymmärrä sisältöä → vaikuttaa sijoitukseen.

Korjaus:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Allow: /wp-content/
Allow: /wp-includes/

📝 Huomautus kehittäjille: Vuodesta 2014 lähtien Google on selkeästi suositellut: älä estä CSS:ää, JS:ää ja kuvia robots.txt-tiedostossa. Googlebot tarvitsee näitä resursseja renderöidäkseen sivun oikein. Käytä URL Inspection -työkalua Search Consolessa tarkistaaksesi, miten Google renderöi sivusi.

Virhe 3: Tärkeiden sivujen virheellinen estäminen

Oire: Palvelusivut, tuotesivut tai blogikirjoitukset eivät ilmesty Googleen – vaikka sitemap sisältäisi ne.

Syy: Robots.txt-sääntö on liian laaja. Esimerkiksi:

Disallow: /dich-vu

Tämä rivi estää paitsi /dich-vu/, myös /dich-vu-thiet-ke-web/, /dich-vu-seo/ ja kaikki URL-osoitteet, jotka alkavat /dich-vu.

Korjaus: Lisää / loppuun polussa estääksesi tarkan hakemiston:

Disallow: /dich-vu-noi-bo/

Tai käytä Allow-sääntöä tarvittavan sivun suojaamiseksi:

Disallow: /dich-vu-noi-bo/
Allow: /dich-vu/
Allow: /dich-vu-thiet-ke-web/

📝 Huomautus kehittäjille: Allow- ja Disallow-sääntöjen järjestys vaikuttaa. Googlebot käyttää tarkinta polkua (most specific path). Jos ne ovat samanpituisia, Allow-sääntöä priorisoidaan Disallow-säännön sijaan. Testaa aina Robots Testing Tool -työkalulla Search Consolessa ennen käyttöönottoa.

Virhe 4: Ei robots.txt-tiedostoa

Oire: Kirjoitat verkkotunnus.com/robots.txt → saat virheen 404.

Syy: Verkkosivusto on rakennettu manuaalisesti, eikä kehittäjä ole luonut tiedostoa. Tai tiedosto on poistettu virheellisesti käyttöönoton yhteydessä.

Vaikutus: Ei niin vakava kuin virhe 1 – ilman robots.txt-tiedostoa, Google indeksoi oletuksena kaiken. Mutta tämä tarkoittaa:

  • Google indeksoi admin-, testi- ja sisäiset sivut
  • Sinulla ei ole tapaa ohjata sitemapin luo robots.txt-tiedoston kautta
  • Perushallinta puuttuu

Korjaus: Luo robots.txt-tiedosto juurihakemistoon. Vähimmäissisältö:

User-agent: *
Disallow: /admin/
Disallow: /search?

Sitemap: https://verkkotunnus.com/sitemap.xml

---

Virhe 5: Käyttää robots.txt-tiedostoa sivujen piilottamiseen Googlelta (väärinymmärretty tarkoitus)

Oire: Estät sivun Disallow-säännöllä, mutta sivu ilmestyy edelleen Googleen – ilman sisältökatkelmaa.

Syy: Robots.txt estää indeksoinnin (crawl), mutta ei tallennusta (index). Jos sivu on jo tallennettu, tai siihen on linkki toiselta verkkosivustolta, Google voi säilyttää URL-osoitteen hakutuloksissa – se vain ei näytä sisältöä.

Oikea korjaus:

TavoiteMitä käyttää
Ei halua Googlen indeksoivan (skannaavan)Disallow robots.txt-tiedostossa
Ei halua Googlen tallentavan (näyttävän) -tagi HTML:ssä
Ei halua kumpaakaanKäytä noindex-tagia HTML:ssä (ja älä estä robots.txt-tiedostossa)

⚠️ Tämä on usein väärinymmärretty kohta: Jos estät sekä indeksoinnin (robots.txt) että asetat noindex-tagin (HTML), Google ei näe noindex-tagia, koska se ei indeksoi sivua – ja sivu voi silti tulla tallennetuksi. Ratkaisu: käytä noindex-tagia HTML:ssä ja poista kyseisen sivun Disallow-sääntö robots.txt-tiedostosta.

Esimerkki Robots.txt-tiedostosta yrityksen verkkosivustolle

Tässä on robots.txt-tiedostoesimerkki, joka sopii useimmille PK-yritysten verkkosivustoille:

# =============================================
# Robots.txt yrityksen verkkosivustolle
# Päivitetty: 2026-04-20
# =============================================

# Koskee kaikkia botteja
User-agent: *

# Estä hallintoalue ja sisäiset sivut
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /dashboard/
Disallow: /staging/

# Estä sisäiset hakusivut (vältä crawl budgetin tuhlausta)
Disallow: /search?
Disallow: /*?s=

# Estä URL-osoitteet seurantaparametreilla (vältä päällekkäistä sisältöä)
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?fbclid=

# Estä ostoskori / maksusivut (jos on)
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/

# Salli CSS, JS, kuvat (Google tarvitsee ne sivun renderöintiin)
Allow: /wp-content/uploads/
Allow: /wp-content/themes/
Allow: /wp-includes/

# Ohjaa sitemapin luo
Sitemap: https://verkkotunnus.com/sitemap.xml

📝 Huomautus kehittäjille: Robots.txt-tiedoston on oltava juuriverkkotunnuksessa – https://example.com/robots.txt. Ei /blog/robots.txt tai muissa alihakemistoissa. Jokaisella aliverkkotunnuksella tarvitaan oma robots.txt-tiedosto (esimerkiksi blog.example.com/robots.txt on erillinen example.com/robots.txt-tiedostosta).

Miten tarkistaa oman verkkosivustosi robots.txt-tiedosto

Tapa 1: Suora tarkistus selaimessa

Kirjoita https://oma-verkkotunnuksesi.com/robots.txt osoiteriville. Näet tiedoston sisällön tekstimuodossa. Jos näet 404-virheen – verkkosivustolla ei ole robots.txt-tiedostoa.

Tapa 2: Käytä Google Search Consolea

  1. Kirjaudu Google Search Consoleen
  2. Mene kohtaan SettingsCrawlingrobots.txt
  3. Katso robots.txt-tiedosto, jonka Google lukee
  4. Tarkista, onko tietty URL-osoite estetty

Tapa 3: Tarkista Indexing-raportista

Search Consolessa → Pages (tai Indexing) → Etsi kohta "Blocked by robots.txt". Jos luettelossa on tärkeitä sivuja, sinun on korjattava robots.txt-tiedosto välittömästi.

💡 On suositeltavaa tarkistaa robots.txt-tiedosto vähintään kerran vuosineljänneksessä tai aina, kun verkkosivustolla tapahtuu suuria muutoksia (sivujen lisäys, rakenteen muutos, alustan migraatio).

Yhteenveto: Mitä robots.txt-tiedoston tulisi estää ja mitä ei

✅ TULEE estää❌ EI TULE estää
Hallintapaneelit (/admin/, /wp-admin/)Etusivu, palvelusivut, yhteystiedot
Staging / testaus-sivutBlogikirjoitukset
Sisäiset hakusivut (/search?)CSS- ja JavaScript-tiedostot
URL-osoitteet seurantaparametreilla (?utm_, ?fbclid=)Kuvat (Google Images tuo myös liikennettä)
Ostoskori-, maksusivut, henkilökohtaiset tilitSitemap
Päällekkäisen sisällön sivut (suodatus, järjestely, sivutus)UKK-sivut, tapaustutkimukset

---

Usein kysytyt kysymykset robots.txt-tiedostosta

Miten robots.txt ja sitemap eroavat toisistaan?

Sitemap sanoo: "Tämä on sivu, jonka haluan Googlen tietävän." Robots.txt sanoo: "Tämä on sivu, jota en halua Googlen skannaavan." Nämä kaksi tiedostoa täydentävät toisiaan – sitemap näyttää reitin sisään, robots.txt asettaa esteitä.

Jos robots.txt-tiedostoa ei ole, voiko Google silti indeksoida verkkosivuston?

Kyllä. Ilman robots.txt-tiedostoa, Google indeksoi oletuksena kaikki sivut – myös ne, joita et halua. Siksi on tärkeää, että tämä tiedosto on olemassa.

Käytän WordPressiä, missä robots.txt-tiedosto sijaitsee?

WordPress luo virtuaalisen (virtual) robots.txt-tiedoston. Jos käytät SEO-lisäosaa, kuten Yoastia tai Rank Mathia, voit muokata robots.txt-tiedostoa suoraan lisäosassa ilman pääsyä palvelimeen.

Vaikuttaako robots.txt verkkosivuston nopeuteen?

Ei. Tämä tiedosto painaa vain muutaman kilotavun. Se ei vaikuta sivun latausnopeuteen.

Estin sivun robots.txt-tiedostolla, miksi sivu ilmestyy silti Googleen?

Koska robots.txt estää vain indeksoinnin (crawl), ei tallennusta (index). Jos haluat sivun katoavan kokonaan Googlesta, käytä -tagia HTML:ssä – ja älä estä sivua robots.txt-tiedostossa (jotta Google voi lukea noindex-tagin).

Kuinka kauan kestää, että Google päivittää robots.txt-tiedoston korjauksen jälkeen?

Google tarkistaa yleensä robots.txt-tiedoston uudelleen 24-48 tunnin kuluessa. Voit pyytää Googlea tarkistamaan sen aikaisemmin Search Consolessa → Settings → Crawling.

Johtopäätös

Robots.txt on pieni tiedosto – usein vain muutama rivi – mutta se vaikuttaa suoraan siihen, näkeekö Google verkkosivustosi vai ei.

Muistettavat asiat:

  1. Robots.txt on "Rajoitetun alueen" kyltti: kertoo Googlelle, mitä sivuja ei saa skannata
  2. Tarkista heti, kun verkkosivusto otetaan käyttöön: koko sivuston estäminen on yleisin ja vakavin virhe
  3. Älä käytä robots.txt-tiedostoa sivujen piilottamiseen Googlelta: se estää indeksoinnin, ei tallennusta
  4. Salli aina CSS ja JS: Google tarvitsee niitä sivun renderöintiin
  5. Yhdistä sitemapin ja Search Consolessa: jotta voit täysin hallita sitä, miten Google indeksoi ja tallentaa verkkosivustosi

Tarkista verkkosivustosi alusta

Robots.txt on vain yksi monista teknisistä tekijöistä, jotka vaikuttavat SEO:hon. Jos mietit: "Onko verkkosivustoni asetettu oikein?" – vastaus löytyy käyttämästäsi alustasta.

GTG CRM auttaa sinua luomaan verkkosivuston, jossa on standardinmukainen robots.txt-tiedosto, automaattinen sitemap ja teknisesti valmis rakenne Googlelle – sinun ei tarvitse murehtia yksittäisten tiedostojen tai rivikoodien muokkaamisesta.

Muuta juuri lukemasi konkreettisiksi tuloksiksi – sovella heti GTG CRM:llä, maksutta.

Sovella heti