You have a sitemap, have submitted it to Google, and your website has started to be indexed. But one day, you discover that your admin page, internal payment page, or staging page is also appearing on Google. A customer types in your company name and sees an unfinished test page.
Or the opposite: you post a new blog article, wait two weeks, and it's still not on Google. You ask the technical team, and they say: "The robots.txt file is blocking Google from crawling the entire website."
Both situations relate to a small file that few web managers pay attention to: robots.txt.
This article will explain what robots.txt is, how it works, when you need to edit it, and common mistakes businesses need to avoid – all in simple language, with practical examples.
What is Robots.txt? Explained for Web Managers
If a sitemap is a building's floor plan – telling Google what rooms there are – then robots.txt is a "Restricted Area" sign – telling Google which rooms not to enter.
Technically speaking: robots.txt is a small text file located in the root directory of your website (e.g., https://example.com/robots.txt). This file contains rules that tell search engine bots – like Googlebot –:
- Which pages are allowed to be crawled
- Which pages are not allowed to be crawled
- Where the sitemap is located
You can view the robots.txt of any website by typing: domain-name.com/robots.txt in your browser.
💡 Important: robots.txt is only a polite request, not an absolute prohibition. Reputable bots like Googlebot will comply, but bad bots (spam, scrapers) may ignore it. If you need true security, use passwords or a firewall – don't rely on robots.txt.
What Does a Robots.txt File Look Like?
You don't need to write this file from scratch. But to understand it when you see it, here's a simple robots.txt file:
User-agent: *
Disallow: /admin/
Disallow: /thanh-toan/
Disallow: /staging/
Allow: /
Sitemap: https://example.com/sitemap.xml
Explanation of each line:
| Line | Meaning |
|---|---|
User-agent: * | Applies to all bots (Google, Bing, etc.) |
Disallow: /admin/ | Do not let bots into the /admin/ directory |
Disallow: /thanh-toan/ | Do not let bots into the payment page |
Disallow: /staging/ | Do not let bots into the staging version |
Allow: / | Allow bots to crawl the rest of the site |
Sitemap: https://... | Tells bots where the sitemap is located |
Here's a more complex example – suitable for a business website with a blog, service pages, and an admin area:
# Allow all bots to crawl public content
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /search?
Disallow: /*?ref=
Disallow: /*?utm_
# Allow Googlebot to crawl CSS and JS (needed for page rendering)
User-agent: Googlebot
Allow: /wp-content/uploads/
Allow: /wp-includes/
Sitemap: https://example.com/sitemap.xml
📝 Note for devs: The `` character in a path is a wildcard — `/?utm_` means block any URL containing the parameter `?utm_`. The `$` character at the end of a path is used for exact URL matching. For example: `Disallow: /*.pdf$` will block all PDF files.
How Robots.txt Works in the SEO Process
To understand the role of robots.txt, let's revisit the process of Google displaying a website in search results:
Crawl → Index → Rank
(Quét) (Lưu) (Xếp hạng)Robots.txt toimii ensimmäisessä vaiheessa – Crawl.
Ennen kuin Googlebot alkaa indeksoida mitään sivua verkkosivustollasi, se tarkistaa ensin robots.txt:n. Jos URL sisältyy Disallow-kohtaan, Googlebot jättää sivun huomiotta – ei indeksoi, ei lue sisältöä.
Googlebot haluaa indeksoida https://example.com/admin/settings
→ Tarkistaa robots.txt:n
→ Löytää Disallow: /admin/
→ Jättää huomiotta, ei indeksoi
Googlebot haluaa indeksoida https://example.com/dich-vu/
→ Tarkistaa robots.txt:n
→ Ei estetty
→ Indeksoi normaalisti → Indeksoi → Voi ilmestyä hakutuloksiin
Robots.txt ja sitemap: toisiaan täydentävä pari
| Tiedosto | Rooli |
|---|---|
| Sitemap | "Tämä on luettelo sivuista, jotka haluan Googlen tietävän" |
| Robots.txt | "Nämä ovat sivut, joita en halua Googlen indeksoivan" |
Nämä kaksi tiedostoa eivät ole ristiriidassa – ne toimivat yhdessä. Sitemap näyttää tien, robots.txt asettaa esteitä. Kun niitä käytetään oikein, voit hallita sitä, mitä Google näkee ja jättää huomiotta verkkosivustollasi.
Mihin robots.txt:tä käytetään? 4 yleistä tapausta
1. Hallinta- ja sisäiset sivut pois Googlen näkyvistä
Ylläpitosivut, CMS-taustajärjestelmän sivut, staging-sivut, testaus-sivut – kaikki nämä eivät saisi näkyä Googlessa. Robots.txt auttaa sinua sanomaan Googlelle: "Älä mene tänne."
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /staging/
2. "Crawl budgetin" tuhlaamisen välttäminen
Google ei indeksoi loputtomasti. Jokaisella verkkosivustolla on "crawl budget" – sivujen määrä, jonka Googlebot indeksoi jokaisella vierailulla. Jos verkkosivustolla on monia epäolennaisia sivuja (sisäiset hakusivut, suodatussivut, sivutus), Googlebot saattaa käyttää aikaansa näiden sivujen indeksointiin tärkeiden palvelusivujen tai blogikirjoitusten sijaan.
Disallow: /search?
Disallow: /tag/
Disallow: /page/
💡 Crawl budget on pääasiassa tärkeä suurille verkkosivustoille (tuhansia sivuja). Pienten yritysten verkkosivustot eivät yleensä tarvitse huolehtia liikaa, mutta robots.txt:n pitäminen siistinä on silti hyvä tapa.
3. Duplikaattisisällön estäminen
Jos verkkosivustolla on useita URL-osoitteita, jotka johtavat samaan sisältöön (esimerkiksi URL-osoitteet, joissa on seurantaparametreja ?utm_source=facebook tai tulostusversio ?print=true), voit estää nämä duplikaattiset URL-osoitteet:
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?print=
4. Ohjeiden antaminen sitemapille
Robots.txt on ensimmäinen paikka, jota Googlebot tarkistaa saapuessaan verkkosivustolle. Sitemap-osoitteen asettaminen tähän auttaa Googlea löytämään sitemapin nopeammin – vaikka et olisikaan vielä lähettänyt sitä Search Consolen kautta.
Sitemap: https://example.com/sitemap.xml
Milloin yrityksen on kiinnitettävä huomiota robots.txt:hen?
Sinun ei aina tarvitse muokata robots.txt:tä. Mutta on aikoja, jolloin tämän tiedoston tarkistaminen on pakollista:
Kun verkkosivusto on juuri otettu käyttöön (go-live)
Tämä on tärkein hetki. Monet verkkosivustot estetään kokonaan indeksoinnilta, koska kehittäjä unohtaa poistaa rivin Disallow: / – rivin, jonka he asettivat staging-vaiheen aikana, jotta Google ei indeksoisi keskeneräistä versiota.
Tarkistus go-live-vaiheessa:
| Luokka | Tarkistustapa |
|---|---|
| Robots.txt-tiedosto on olemassa | Avaa https://domain-name.com/robots.txt selaimessa |
| Koko verkkosivustoa ei ole estetty | Varmista, ettei ole riviä Disallow: / |
| Sitemap on määritetty | Varmista, että on rivi Sitemap: https://domain-name.com/sitemap.xml |
| Tärkeät sivut eivät ole estettyjä | Tarkista, että palvelu-, blogi- ja yhteystiedot eivät kuulu Disallow-sääntöihin |
✅ Kun verkkosivustoa ei indeksoida Googleen useisiin viikkoihin
Jos sinulla on jo sivukartta, olet lähettänyt sen Search Consoleen, mutta Google ei silti indeksoi sitä - robots.txt on ensimmäinen epäilty, jota tulee tarkistaa.
Kun lisätään piilotettavia alueita (jäsenalueet, sisäiset sivut)
Jos verkkosivusto lisää tilinhallintasivuja, jäsenalueita tai sisäisiä sivuja - päivitä robots.txt estääksesi nämä alueet.
Kun vaihdetaan verkkosivuston alustaa tai uudistetaan
Jokainen alusta (WordPress, Webflow, custom code) luo erilaisen URL-rakenteen. Migraatiossa vanha robots.txt voi estää virheellisesti uusia sivuja tai jättää estettäviä sivuja huomiotta.
Kun Search Console raportoi virheen "Estetty robots.txt:llä"
Google Search Console tarjoaa Indeksointi-raportin, joka kertoo, mitkä sivut ovat estetty robots.txt:llä. Jos huomaat tärkeän sivun olevan estetty - on aika korjata tiedosto välittömästi.
5 yleistä robots.txt-virhettä ja niiden korjaus
Virhe 1: Koko verkkosivuston estäminen - vakavin virhe
Oireet: Mikään sivu ei ole Googlen indeksoimana. Search Console raportoi joukon sivuja "Estetty robots.txt:llä".
Syy: robots.txt-tiedosto sisältää:
User-agent:
Disallow: /
Nämä kaksi riviä tarkoittavat: "Kielletään kaikilta boteilta pääsy mille tahansa sivulle." Tämä tapahtuu yleensä silloin, kun kehittäjä asettaa tämän säännön staging-vaiheessa ja unohtaa poistaa sen live-vaiheeseen siirryttäessä.
Korjaus: Korjaa seuraavasti:
User-agent: *
Disallow:
Sitemap: https://ten-mien.com/sitemap.xml
Disallow: (ei mitään kaksoispisteen jälkeen) = sallii kaikkien indeksoinnin.
⚠️ Tämä on yleisin virhe, jonka näemme uusilla yritysverkkosivustoilla. Korjauksen jälkeen Googlen voi kestää useita päiviä tai viikkoja uudelleen indeksointiin. Lähetä sivukartta uudelleen Search Consoleen nopeuttamaan prosessia.
Virhe 2: CSS:n ja JavaScriptin estäminen
Oireet: Verkkosivusto näyttää normaalilta selaimessa, mutta käytettäessä Search Consolen "URL Inspection" -työkalua Google näkee sivun rikkoutuneena tai tyhjänä sisällöstä.
Syy: Robots.txt estää CSS- ja JS-tiedostoja sisältävän hakemiston:
Disallow: /wp-content/
Disallow: /wp-includes/
Google tarvitsee CSS:n ja JS:n lukemista ymmärtääkseen, miltä sivu näyttää (tätä kutsutaan "renderöinniksi"). Jos ne ovat estettyjä, Google ei pysty renderöimään sivua → ei ymmärrä sisältöä → vaikuttaa sijoitukseen.
Korjaus:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Allow: /wp-content/
Allow: /wp-includes/
📝 Huomautus kehittäjille: Vuodesta 2014 lähtien Google on selkeästi suositellut: älä estä CSS:ää, JS:ää ja kuvia robots.txt:ssä. Googlebot tarvitsee näitä resursseja renderöidäkseen sivun oikein. Käytä Search Consolen URL Inspection -työkalua tarkistaaksesi, miten Google renderöi sivusi.
Virhe 3: Tärkeiden sivujen virheellinen estäminen
Oireet: Palvelusivut, tuotesivut tai blogikirjoitukset eivät näy Google-haussa - vaikka sivukartta listaa ne.
Syy: Robots.txt:n sääntö on liian laaja. Esimerkki:
Disallow: /dich-vu
Tämä rivi estää paitsi /dich-vu/ myös /dich-vu-thiet-ke-web/, /dich-vu-seo/ ja minkä tahansa URL:n, joka alkaa /dich-vu.
Korjaus: Lisää / polun loppuun estääksesi hakemiston tarkasti:
Disallow: /dich-vu-noi-bo/
Tai käytä Allow-sääntöä suojataksesi tarvittavat sivut:
Disallow: /dich-vu-noi-bo/
Allow: /dich-vu/
Allow: /dich-vu-thiet-ke-web/
📝 Huomautus kehittäjille: `Allow`- ja `Disallow`-sääntöjen järjestys vaikuttaa. Googlebot käyttää tarkinta (most specific path) sääntöä. Jos ne ovat samalla pituudella, `Allow` ohittaa `Disallow`-säännön. Testaa aina Robots Testing Tool -työkalulla Search Consolessa ennen käyttöönottoa.
Virhe 4: robots.txt-tiedostoa ei ole
Ilmentymä: Kirjoita ten-mien.com/robots.txt → palauttaa virheen 404.
Syy: Verkkosivusto on tehty käsin ja kehittäjä ei ole luonut tätä tiedostoa. Tai tiedosto on poistettu vahingossa käyttöönoton yhteydessä.
Vaikutus: Ei yhtä vakava kuin virhe 1 - ilman robots.txt-tiedostoa Google indeksoi oletusarvoisesti kaiken. Mutta tämä tarkoittaa:
- Google indeksoi myös ylläpitosivut, testaus- ja sisäiset sivut
- Sinulla ei ole tapaa ohjata sivustokarttaa robots.txt-tiedoston kautta
- Perusvalvonnan puute
Korjaus: Luo robots.txt-tiedosto juurihakemistoon. Vähimmäissisältö:
User-agent: *
Disallow: /admin/
Disallow: /search?
Sitemap: https://ten-mien.com/sitemap.xml
Virhe 5: robots.txt-tiedoston käyttäminen sivujen piilottamiseen Googlelta (tarkoituksen väärinymmärrys)
Ilmentymä: Estät sivun Disallow-määrityksellä, mutta sivu näkyy silti Googlella - ilman sisältöä esittelevää pätkää.
Syy: Robots.txt estää indeksoinnin (crawl), ei hakemistoon lisäämistä (index). Jos sivu on jo indeksoitu aiemmin, tai siihen on linkkejä muilta verkkosivustoilta, Google saattaa säilyttää URL-osoitteen hakutuloksissa - vain sisältöä ei näytetä.
Oikea korjaus:
| Tavoite | Mitä käyttää |
|---|---|
| Et halua Googlen indeksoivan (crawl) | Disallow robots.txt-tiedostossa |
| Et halua Googlen lisäävän hakemistoon (index) | <meta name="robots" content="noindex"/>-tagi HTML:ssä |
| Et halua kumpaakaan | Käytä noindex-tagia HTML:ssä (ja älä estä robots.txt-tiedostossa) |
⚠️ Tämä on yleisin väärinkäsitys: Jos estät indeksoinnin (robots.txt) ja lisäät `noindex`-tagin (HTML), Google ei näe noindex-tagia, koska se ei indeksoi kyseistä sivua — ja sivu voi silti tulla indeksoiduksi. Ratkaisu: käytä `noindex`-tagia HTML:ssä ja poista `Disallow`-sääntö kyseiselle sivulle robots.txt-tiedostosta.
Robots.txt-malli yritysverkkosivustolle
Alla on robots.txt-malli, joka sopii useimmille pienille ja keskisuurille yritysverkkosivustoille:
# =============================================
# Robots.txt yritysverkkosivustolle
# Päivitetty: 2026-04-20
# =============================================
# Sovelletaan kaikkiin bottiin
User-agent: *
# Estä ylläpitoalueet ja sisäiset alueet
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /dashboard/
Disallow: /staging/
# Estä sisäiset hakusivut (vältä indeksointibudjetin tuhlausta)
Disallow: /search?
Disallow: /*?s=
# Estä seuranta-parametreja sisältävät URL-osoitteet (vältä päällekkäistä sisältöä)
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?fbclid=
# Estä ostoskori / maksusivut (jos on)
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
# Salli CSS, JS, kuvat (Google tarvitsee ne sivun renderöintiin)
Allow: /wp-content/uploads/
Allow: /wp-content/themes/
Allow: /wp-includes/
# Ohjaa sivustokarttaan
Sitemap: https://ten-mien.com/sitemap.xml
📝 Huomautus kehittäjälle: Robots.txt-tiedoston on oltava verkkotunnuksen juurella — `https://example.com/robots.txt`. Ei `/blog/robots.txt` tai muussa alihakemistossa. Jokainen aliverkkotunnus tarvitsee oman robots.txt-tiedoston (esimerkiksi `blog.example.com/robots.txt` on erillään `example.com/robots.txt`-tiedostosta).
Kuinka tarkistaa verkkosivustosi robots.txt-tiedosto
Tapa 1: Tarkista suoraan selaimella
Kirjoita osoiteriville https://ten-mien-cua-ban.com/robots.txt. Näet tiedoston sisällön tekstimuodossa. Jos näet virheen 404 — verkkosivustolla ei ole robots.txt-tiedostoa.
Tapa 2: Käytä Google Search Consolea
- Kirjaudu sisään Google Search Consoleen
- Siirry kohtaan Asetukset → Indeksointi → robots.txt
- Tarkastele robots.txt-tiedostoa, jota Google lukee
- Tarkista, onko tietty URL-osoite estetty
Tapa 3: Tarkistus indeksointiraportista
Search Consolessa → Sivut (tai Indeksointi) → Etsi kohta "Estetty robots.txt-tiedostolla". Jos tärkeitä sivuja on tässä luettelossa, sinun on korjattava robots.txt-tiedosto välittömästi.
💡 Robots.txt-tiedosto tulisi tarkistaa vähintään kerran vuosineljänneksessä tai aina kun verkkosivustolla tapahtuu suuria muutoksia (sivujen lisäys, rakenteen muutos, alustan siirto).
Yhteenvetotaulukko: Mitä robots.txt-tiedostolla tulisi estää ja mitä ei
| ✅ TULISI estää | ❌ EI TULISI estää |
|---|---|
Hallintasivut (/admin/, /wp-admin/) | Etusivu, palvelusivut, yhteystiedot-sivu |
| Staging / testaus-sivut | Blogikirjoitukset, artikkelit |
Sisäisen haun sivut (/search?) | CSS- ja JavaScript-tiedostot |
URL-osoitteet seurantaparametreilla (?utm_, ?fbclid=) | Kuvat (Google Kuvat tuovat myös liikennettä) |
| Ostoskori, maksut, henkilökohtaiset tili-sivut | Sivukartta |
| Duplikaattisisältö-sivut (suodatin, lajittelu, sivutus) | UKK-sivut, tapaustutkimukset |
Usein kysytyt kysymykset robots.txt-tiedostosta
Miten robots.txt ja sivukartta eroavat toisistaan?
Sivukartta sanoo: "Tässä ovat sivut, joiden haluan Googlen tietävän." Robots.txt sanoo: "Tässä ovat sivut, joiden en halua Googlen indeksoivan." Nämä kaksi tiedostoa täydentävät toisiaan – sivukartta näyttää tien sisään ja robots.txt asettaa esteitä.
Jos robots.txt-tiedostoa ei ole, voiko Google indeksoida verkkosivuston?
Kyllä. Ilman robots.txt-tiedostoa Google indeksoi oletusarvoisesti kaikki sivut – myös ne, joita et halua. Siksi tämä tiedosto on tarpeen.
Käytän WordPressiä, missä robots.txt-tiedosto sijaitsee?
WordPress luo virtuaalisen robots.txt-tiedoston itse. Jos käytät SEO-lisäosaa, kuten Yoastia tai Rank Mathia, voit muokata robots.txt-tiedostoa suoraan lisäosasta ilman palvelimen käyttöä.
Vaikuttaako robots.txt-tiedosto verkkosivuston nopeuteen?
Ei. Tämä tiedosto on vain muutaman kilotavun kokoinen. Se ei vaikuta sivun latausnopeuteen.
Estin sivun robots.txt-tiedostolla, mutta se ilmestyy silti Googleen?
Koska robots.txt-tiedosto estää vain indeksoinnin, ei hakua. Jos haluat sivun poistuvan kokonaan Google-hauista, käytä `` -tagia HTML:ssä – ja älä estä kyseistä sivua robots.txt-tiedostolla (jotta Google voi lukea noindex-tagin).
Kuinka kauan Googlen kestää päivittää robots.txt-tiedoston muutokset?
Google tarkistaa robots.txt-tiedoston uudelleen yleensä 24–48 tunnin kuluessa. Voit pyytää Googlea tarkistamaan sen nopeammin siirtymällä Search Consoleen → Asetukset → Indeksointi.
Yhteenveto
Robots.txt on pieni tiedosto – usein vain muutaman rivin mittainen – mutta se vaikuttaa suoraan siihen, näkeekö Google verkkosivustosi vai ei.
Muistettavaa:
- Robots.txt on "Rajoitettu alue" -kyltti: se kertoo Googlelle, mitkä sivut ovat indeksointikieltoalueella.
- Tarkista heti verkkosivuston julkaisun yhteydessä: koko verkkosivuston estäminen on yleinen ja vakava virhe.
- Älä käytä robots.txt-tiedostoa sivujen piilottamiseen Googlelta: se estää indeksoinnin, ei hakua.
- Salli aina CSS ja JS: Google tarvitsee näitä sivun renderöimiseksi ja sisällön ymmärtämiseksi.
- Yhdistä sivukarttaan ja Search Consoleen: saadaksesi täydellisen hallinnan siihen, miten Google indeksoi ja sijoittaa verkkosivustosi.
Tarkista verkkosivustosi alusta
Robots.txt on vain yksi monista teknisistä tekijöistä, jotka vaikuttavat SEO:hon. Jos mietit: "Onko verkkosivustoni asetettu oikein?" – vastaus löytyy käyttämästäsi alustasta.
GTG CRM auttaa sinua luomaan verkkosivuston, jossa on oikein määritetty robots.txt, automaattinen sitemap ja Googlelle valmis tekninen rakenne – sinun ei tarvitse huolehtia yksittäisten tiedostojen tai koodirivien muokkaamisesta.
Tee lukemastasi konkreettisia tuloksia – kokeile GTG CRM:ää nyt, ilmaiseksi.
Kokeile nyt
