Mis on robots.txt ja millal peaks ettevõte selle faili suhtes tähelepanelik olema?
Teil on sitemap, olete selle Google'ile esitanud ja veebisait on hakanud indekseeruma. Kuid ühel päeval avastate, et teie administratsioonipaneel, sisemised makselehed või teie veebisaidi testimislehed ilmuvad Google'is. Kui kliendid otsivad teie ettevõtte nime – näevad nad isegi teie veel lõpetamata testilehte.
Või vastupidi: postitate uut blogiartiklit, aga kahe nädala pärast pole seda Google'is näha. Küsides tehniliselt üksuselt, ütlevad nad: "Robots.txt fail blokeerib Google'il kogu veebisaidi indekseerimise."
Mõlemad olukorrad on seotud väikese failiga, millele veebihaldurid vähe tähelepanu pööravad: robots.txt.
See artikkel selgitab, mis on robots.txt, kuidas see töötab, millal seda peaks muutma ja milliseid levinud vigu ettevõtted peaksid vältima – kõik see lihtsas keeles ja koos praktiliste näidetega.
Mis on robots.txt? Selgitus veebihaldurile
Kui sitemap on hoone plaan – see ütleb Google'ile, millised toad on olemas, siis robots.txt on "Keelatud ala" silt – see ütleb Google'ile, millistesse ruumidesse ei tohi siseneda.
Tehniliselt öeldes on robots.txt väike tekstifail, mis asub teie veebisaidi juurkaustas (näiteks: https://example.com/robots.txt). See fail sisaldab reegleid, mis ütlevad otsingumootorite robotitele – nagu Googlebot –:
- Milliseid lehti tohib indekseerida (skaneerida)
- Milliseid lehti ei tohi indekseerida
- Kus asub sitemap
Saate vaadata mis tahes veebisaidi robots.txt faili, sisestades brauserisse: domeeninimi.com/robots.txt.
💡 Oluline: robots.txt on ainult viisakas palve, mitte absoluutne keeld. Usaldusväärsed botid, nagu Googlebot, järgivad seda, kuid halvad botid (spämm, skrapijad) võivad seda ignoreerida. Kui vajate tõelist turvalisust, kasutage paroole või tulemüüri – ärge lootke robots.txt peale.
Milline robots.txt fail välja näeb?
Te ei pea seda faili algusest peale ise kirjutama. Kuid selle mõistmiseks, kui seda vaatate, siin on lihtne robots.txt fail:
User-agent: *
Disallow: /admin/
Disallow: /thanh-toan/
Disallow: /staging/
Allow: /
Sitemap: https://example.com/sitemap.xml
Iga rea selgitus:
| Rida | Tähendus |
|---|---|
User-agent: * | Kehtib kõigile botidele (Google, Bing jne.) |
Disallow: /admin/ | Keelab botidel siseneda kausta /admin/ |
Disallow: /thanh-toan/ | Keelab botidel siseneda makselehtedele |
Disallow: /staging/ | Keelab botidel siseneda staging versiooni |
Allow: / | Lubab botidel indekseerida ülejäänud osa |
Sitemap: https://... | Teavitab botti sitemap asukohast |
Siin on keerulisem näide – sobiv ettevõtte veebisaidile, millel on blogi, teenuste lehed ja administratsiooniala:
# Lubab kõikidele botidele avaliku sisu indekseerimist
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /search?
Disallow: /*?ref=
Disallow: /*?utm_
# Lubab Googlebotil indekseerida CSS ja JS (vajalik lehe renderdamiseks)
User-agent: Googlebot
Allow: /wp-content/uploads/
Allow: /wp-includes/
Sitemap: https://example.com/sitemap.xml
📝 Märkus arendajatele: tee sees olev
*on metsik kaart –/?utm_tähendab kõigi URL-ide blokeerimist, mis sisaldavad parameetrit?utm_. Märk$URL-i lõpus kasutatakse URL-i lõpu täpseks vastendamiseks. Näiteks:Disallow: /*.pdf$blokeerib kõik PDF-failid.
---
Kuidas robots.txt töötab SEO protsessis?
Robots.txt faili asukoha mõistmiseks vaadake üle protsessi, millega Google veebisaite otsingutulemustesse lisab:
Crawl → Index → Rank
(Skaneeri) (Salvesta) (Järjesta)
Robots.txt töötab esimeses etapis – Crawl.
Enne kui Googlebot hakkab teie veebisaidil ühtegi lehte skaneerima, kontrollib ta esmalt robots.txt-i. Kui URL on loendis Disallow, ignoreerib Googlebot seda lehte – ei skaneeri, ei loe sisu.
Googlebot soovib skaneerida https://example.com/admin/settings
→ Kontrollib robots.txt-i
→ Leiab Disallow: /admin/
→ Ignoreerib, ei skaneeri
Googlebot soovib skaneerida https://example.com/dich-vu/
→ Kontrollib robots.txt-i
→ Ei ole blokeeritud
→ Skaneerib normaalselt → Salvestab → Võib ilmuda otsingutulemustesse
Robots.txt ja sitemap: täiendav paar
| Fail | Roll |
|---|---|
| Sitemap | "See on lehtede loetelu, mida soovin, et Google teaks" |
| Robots.txt | "Need on lehed, mida ei soovi, et Google skaneeriks" |
Need kaks faili ei ole vastuolus – nad töötavad koos. Sitemap näitab teed, robots.txt seab piirdeid. Kui neid õigesti kombineerida, saate kontrollida, mida Google teie veebisaidil näeb ja mida ignoreerib.
Milleks robots.txt-i kasutatakse? 4 levinud juhtumit
1. Haldus- ja siseveebilehtede peitmine Google'ilt
Adminlehed, CMS-i taustalehed, lavastuslehed, testlehed – neid kõiki ei tohiks Google'is kuvada. Robots.txt aitab teil Google'ile öelda: "Ära siia tule."
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /staging/
2. "Crawl budgeti" raiskamise vältimine
Google ei skaneeri piiramatult. Igal veebisaidil on "skaneerimise eelarve" (crawl budget) – lehtede arv, mida Googlebot külastuse ajal skaneerib. Kui veebisaidil on palju vähetähtsaid lehti (sisesed otsingulehed, filtrid, leheküljendused), võib Googlebot kulutada nende lehtede skaneerimisele hoopis tähtsamate teenuste või ajaveebiartiklite asemel.
Disallow: /search?
Disallow: /tag/
Disallow: /page/
💡 Crawl budget on peamiselt oluline suurte veebisaitide (tuhanded lehed) puhul. Väikeettevõtte veebisaidid ei pea tavaliselt liiga palju muretsema, kuid robots.txt puhtana hoidmine on siiski hea tava.
3. Duplikaatsisu sealduse blokeerimine
Kui teie veebisaidil on mitu URL-i, mis viivad samale sisule (näiteks jälgimisparameetriga URL-id ?utm_source=facebook või prinditavad versioonid ?print=true), saate need duplikaatsed URL-id blokeerida:
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?print=
4. Sitemapi suunamise näitamine
Robots.txt on esimene koht, mida Googlebot veebisaidile saabumisel kontrollib. Sitemapitee siia panemine aitab Google'il sitemapile kiiremini juurde pääseda – isegi kui te pole seda veel Search Console'i kaudu esitanud.
Sitemap: https://example.com/sitemap.xml
Millal peaksid ettevõtted robots.txt-i tähele panema?
Te ei pea alati robots.txt-i muutma. Kuid on aeg, millal selle faili kontrollimine on kohustuslik:
Kui veebisait on just käivitatud (go-live)
See on kõige kriitilisem aeg. Paljud veebisaidid on täielikult skaneerimisest blokeeritud, kuna arendajad unustavad eemaldada rea Disallow: / – rea, mille nad lavastusperioodil lisasid, et Google ei indekseeriks lõpetamata versiooni.
Kontrollige käivitamisel:
| Kategooria | Kuidas kontrollida |
|---|---|
| robots.txt fail on olemas | Avage brauseris https://ten-mien.com/robots.txt |
| Kogu veebisaiti ei tohiks blokeerida | Veenduge, et Disallow: / rida puudub |
| Sitemap on deklareeritud | Veenduge, et Sitemap: https://ten-mien.com/sitemap.xml rida on olemas |
| Olulisi lehti ei tohiks blokeerida | Kontrollige, et teenuste, ajaveebi ja kontaktide lehti ei oleks Disallow all |
✅ Kui teie veebisaiti pole Google indekseerinud juba nädalaid
Kui teil on sitemap, olete selle Search Console'i kaudu esitanud, kuid Google seda ikka ei indekseeri – robots.txt on esimene kahtlusalune, mida tuleks kontrollida.
Kui lisate varjutamist vajavaid sektsioone (liikmeala, sise-lehed)
Kui teie veebisaidile lisatakse konto haldamise leht, liikmepiirkond või sise-leht – värskendage robots.txt-faili, et neid piirkondi blokeerida.
Veebisaidi platvormi muutmisel või uuesti kujundamisel
Iga platvorm (WordPress, Webflow, kohandatud kood) loob erineva URL-i struktuuri. Migreerimisel võib vana robots.txt valesti blokeerida uusi lehti või jätta blokeerimata lehti, mida tuleks blokeerida.
Kui Search Console teatab veast "Blokeeritud robots.txt poolt"
Google Search Console sisaldab aruannet Indekseerimine, mis näitab, millised lehed on robots.txt poolt blokeeritud. Kui näete, et olulisi lehti on blokeeritud – on aeg faili kohe muuta.
5 levinumat robots.txt viga ja nende parandamine
Viga 1: Kogu veebisaidi blokeerimine – kõige tõsisem viga
Sümptomid: Ühtki lehte pole Google indekseerinud. Search Console teatab suure hulga lehtede kohta "Blokeeritud robots.txt poolt".
Põhjus: robots.txt fail sisaldab:
User-agent:
Disallow: /
Need kaks rida tähendavad: "Keelake kõik botid mis tahes lehele sisenemast." Tavaliselt juhtub see siis, kui arendaja pani selle reegli töökeskkonnas ja unustas selle avaldamisel eemaldada.
Parandus: Muutke järgmiselt:
User-agent: *
Disallow:
Sitemap: https://ten-mien.com/sitemap.xml
Disallow: (tühi pärast koolonit) = lubage indekseerida kõike.
⚠️ See on nr 1 viga, mida näeme uutel ärikliendi veebisaitidel. Pärast parandamist võib Google'il kuluda mõni päev kuni nädal, et uuesti indekseerida. Esitage sitemap uuesti Search Console'i kaudu, et protsessi kiirendada.
---
Viga 2: CSS-i ja JavaScripti blokeerimine
Sümptomid: Veebisait kuvatakse brauseris normaalselt, kuid kui Search Console'is kasutatakse tööriista "URL Inspection", näeb Google, et lehel on rikutud paigutus või tühi sisu.
Põhjus: Robots.txt blokeerib CSS-i ja JS-i sisaldavaid katalooge:
Disallow: /wp-content/
Disallow: /wp-includes/
Google vajab CSS-i ja JS-i lugemiseks, et mõista, kuidas leht välja näeb (nn "renderdamine"). Kui need on blokeeritud, ei saa Google lehte renderdada → ei mõista sisu → mõjutab järjestust.
Parandus:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Allow: /wp-content/
Allow: /wp-includes/
📝 Märkus arendajale: Alates 2014. aastast on Google selgelt soovitanud: ärge blokeerige CSS-i, JS-i ja pilte robots.txt-failis. Googlebot vajab neid ressursse lehe õigeks renderdamiseks. Kasutage Search Console'i tööriista "URL Inspection", et kontrollida, kuidas Google teie lehte renderdab.
Viga 3: Oluliste lehtede vale blokeerimine
Sümptomid: Teenuste lehed, tootelehed või ajaveebi postitused ei ilmu Google'is – kuigi sitemap loetleb neid.
Põhjus: Robots.txt reegel on liiga lai. Näiteks:
Disallow: /dich-vu
See rida blokeerib mitte ainult /dich-vu/, vaid ka /dich-vu-thiet-ke-web/, /dich-vu-seo/ ja mis tahes URL-i, mis algab /dich-vu.
Lahendus: Lisage kataloogi täpseks blokeerimiseks tee lõppu /:
Disallow: /dich-vu-noi-bo/
Või kasutage vajalike lehtede kaitsmiseks Allow:
Disallow: /dich-vu-noi-bo/
Allow: /dich-vu/
Allow: /dich-vu-thiet-ke-web/
📝 Märkus arendajale:
AllowjaDisallowjärjekord on oluline. Googlebot kasutab kõige konkreetsemat reeglit (most specific path). Kui pikkus on sama, eelistatakseAllowDisallow'le. Testige alati enne kasutuselevõttu Search Console'i Robots Testing Tool abil.
Viga 4: Puudub robots.txt fail
Ilming: Sisestades ten-mien.com/robots.txt → kuvatakse 404 viga.
Põhjus: Käsitsi valmistatud veebisait, kus arendaja seda faili ei loonud. Või fail kustutati ekslikult kasutuselevõtu käigus.
Mõju: Mitte nii tõsine kui viga 1 – kui robots.txt puudub, indekseerib Google vaikimisi kõike. Kuid see tähendab:
- Google indekseerib ka administraatori lehed, testlehed, siseveebilehed
- Teil pole võimalust robots.txt kaudu sitemapini juhatada
- Puudub elementaarne kontroll
Lahendus: Looge robots.txt fail juurkataloogis. Miinimum sisu:
User-agent: *
Disallow: /admin/
Disallow: /search?
Sitemap: https://ten-mien.com/sitemap.xml
---
Viga 5: Robots.txt kasutamine lehtede peitmiseks Google'i eest (eesmärgi valesti mõistmine)
Ilming: Te blokeerite lehe Disallow abil, kuid see leht ilmub endiselt Google'is – kuigi ilma sisutükita.
Põhjus: Robots.txt blokeerib indekseerimist (crawl), mitte indekseerimist (index). Kui leht oli juba varem indekseeritud või sellele viitab tagasilink teiselt veebisaidilt, võib Google hoida URL-i otsingutulemustes – lihtsalt sisu ei kuvata.
Õige lahendus:
| Eesmärk | Mida kasutada |
|---|---|
| Ei soovi, et Google indekseeriks (crawl) | Disallow robots.txt-is |
| Ei soovi, et Google indekseeriks (index) | märgend HTML-is |
| Ei soovi mõlemat | Kasutage HTML-is noindex (ja ärge blokeerige robots.txt-is) |
⚠️ See on kõige sagedamini valesti mõistetud punkt: Kui te blokeerite indekseerimise (robots.txt) ja samal ajal lisate
noindex(HTML), siis Google ei näe noindex märgendit, kuna lehte ei indekseerita (crawl) – ja leht võib siiski indekseerida. Lahendus: kasutage HTML-isnoindexja eemaldage robots.txt-st selle leheDisallowreegel.
Näidis robots.txt väikeettevõtte veebisaidile
Siin on robots.txt faili näidis, mis sobib enamikule väikeettevõtete (SMB) veebisaitidele:
# =============================================
# Robots.txt väikeettevõtte veebisaidile
# Värskendatud: 2026-04-20
# =============================================
# Kehtib kõikidele botidele
User-agent: *
# Blokeeri administraatori ja sisealad
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /dashboard/
Disallow: /staging/
# Blokeeri sisesed otsingulehed (vältimaks indekseerimisruumi raiskamist)
Disallow: /search?
Disallow: /*?s=
# Blokeeri jälgimisparameetritega URL-id (vältimaks korduvat sisu)
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?fbclid=
# Blokeeri ostukorv / kassasse mineku lehed (kui on olemas)
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
# Luba CSS, JS, pildid (Google vajab neid lehe renderdamiseks)
Allow: /wp-content/uploads/
Allow: /wp-content/themes/
Allow: /wp-includes/
# Juhatab sitemapini
Sitemap: https://ten-mien.com/sitemap.xml
📝 Märkus arendajale: robots.txt fail peab asuma domeeni juurkaustas —
https://example.com/robots.txt. Mitte/blog/robots.txtega mõnes teises alamkataloogis. Igal alamdomeenil vajab oma robots.txt faili (näiteksblog.example.com/robots.txton eraldi failistexample.com/robots.txt).
Kuidas kontrollida oma veebisaidi robots.txt-i
1. meetod: Kontrollige otse brauseris
Sisestage aadressiribale https://sinu-domeeni-nimi.com/robots.txt. Näete faili sisu tekstina. Kui näete 404 viga — veebisaitil pole veel robots.txt-i.
2. meetod: Kasutage Google Search Console'i
- Logige sisse Google Search Console'i
- Minge jaotisse Settings → Crawling → robots.txt
- Vaadake robots.txt faili, mida Google loeb
- Kontrollige, kas konkreetne URL on blokeeritud
3. meetod: Kontrollige indekseerimise aruandlust
Search Console'is → Pages (või Indexing) → Leidke jaotis "Blocked by robots.txt". Kui selles loendis on mõni oluline leht, peate robots.txt-i viivitamatult parandama.
💡 Robots.txt-i tuleks kontrollida vähemalt kord kvartalis või iga kord, kui veebisaidil toimuvad suured muudatused (lisatakse lehti, muudetakse struktuuri, migreeritakse platvormi).
Kokkuvõtlik tabel: Mida peaks robots.txt blokeerima ja mida mitte
| ✅ TULEKS blokeerida | ❌ EI TULEKS blokeerida |
|---|---|
Administraatori lehed (/admin/, /wp-admin/) | Esileht, teenuste lehed, kontaktilehed |
| Staging / testlehed | Blogipostitused, artiklid |
Sisemised otsingulehed (/search?) | CSS ja JavaScript failid |
URL-id koos jälgimisparameetritega (?utm_, ?fbclid=) | Pildid (Google Pildid toob samuti liiklust) |
| Ostukorvi, makse, isikliku konto lehed | Sitemap |
| Duplikaatsisu sisuga lehed (filtrid, sorteerimine, leheküljendus) | KKK lehed, juhtumiuuringud |
---
Korduma kippuvad küsimused robots.txt kohta
Kuidas erinevad robots.txt ja sitemap?
Sitemap ütleb: "See on leht, millest tahan, et Google teaks." Robots.txt ütleb: "See on leht, mida ma ei taha, et Google indekseeriks." Kaks faili täiendavad teineteist — sitemap näitab teed sisse, robots.txt paneb barjäärid.
Kui robots.txt-i pole, kas Google saab veebisaiti indekseerida?
Jah. Ilma robots.txt-ita indekseerib Google vaikimisi kõik lehed — sealhulgas need, mida te ei soovi. Seetõttu on seda faili vaja.
Ma kasutan WordPressi, kus robots.txt asub?
WordPress loob ise virtuaalse robots.txt faili. Kui kasutate SEO pistikprogramme nagu Yoast või Rank Math, saate robots.txt-i muuta otse pistikprogrammis, ilma serverisse sisse logimata.
Kas robots.txt mõjutab veebisaidi kiirust?
Ei. See fail on ainult paar KB suurune. See ei mõjuta lehe laadimiskiirust.
Ma blokeerisin lehe robots.txt-iga, miks see siis ikka Google'isse ilmub?
Kuna robots.txt blokeerib ainult indekseerimise, mitte indeksi loomise. Kui soovite, et leht Google'ist täielikult kaoks, kasutage HTML-is meta-märgendit — ja ärge blokeerige seda lehte robots.txt-is (et Google saaks noindex märgendit lugeda).
Kui ma olen robots.txt-i muutnud, kui kaua aega võtab, et Google seda värskendaks?
Google kontrollib robots.txt-i tavaliselt uuesti 24-48 tunni jooksul. Saate minna Search Console'i → Settings → Crawling ja paluda Google'il varem uuesti kontrollida.
Järeldus
Robots.txt on väike fail — tavaliselt vaid paar rida —, kuid see mõjutab otseselt seda, kas Google teie veebisaiti näeb või mitte.
Meeldejätamist väärt:
- Robots.txt on silt "Keelatud ala": ütleb Google'ile, milliseid lehti ei tohi indekseerida
- Kontrollige kohe, kui veebisait läheb käiku: veebisaidi täieliku blokeerimise viga on levinud ja tõsine
- Ärge kasutage robots.txt, et peita lehte Google'i eest: see blokeerib indekseerimise, mitte indekseerimise
- Luba alati CSS ja JS: Google peab lehe renderdama, et sisu mõista
- Ühendage sitemap ja Search Console: et Google'i indekseerimist ja indekseerimist täielikult kontrollida
Kontrollige oma veebisaidi platvormi
Robots.txt on vaid üks paljudest tehnilistest teguritest, mis mõjutavad SEO-d. Kui te mõtlete: "Kas minu veebisait on õigesti seadistatud?" - vastus peitub kasutatavas platvormis.
GTG CRM aitab teil luua veebisaidi, millel on standardne robots.txt, automaatne sitemap ja Google'i valmis tehniline struktuur – te ei pea muretsema iga faili või koodirea muutmisega.
Muutke loetu reaalseks tulemuseks — rakendage kohe GTG CRM-iga tasuta.
Rakendage kohe
