Sul on olemas saidikaart, see on Google'ile esitatud ja veebisait on hakanud indekseerima. Kuid ühel päeval avastad, et administraatori leht (admin), sisemised makselehed või saidi lavastusversioon ilmub samuti Google'is. Kliendid sisestavad ettevõtte nime – näevad ka lõpetamata testlehte.

Või vastupidi: postitate uue ajaveebiartikli, ootate kaks nädalat ja see ei ilmu ikka Google'is. Küsige tehniliselt üksuselt, nad ütlevad: "Robots.txt fail blokeerib Google'il kogu veebisaidi indekseerimise."

Mõlemad olukorrad on seotud väikese failiga, millele veebihaldurid vähe tähelepanu pööravad: robots.txt.

See artikkel selgitab, mis on robots.txt, kuidas see töötab, millal seda muuta vaja on ja milliseid levinud vigu ettevõtted peavad vältima – kõik lihtsas keeles, koos praktiliste näidetega.

Mis on Robots.txt? Selgitus veebihaldurile

Kui saidikaart on hoone plaani – öeldes Google'ile, milliseid ruume on, siis robots.txt on silt "Piiratud ala" – öeldes Google'ile, millistesse ruumidesse ei tohi siseneda.

Tehniliselt öeldes: robots.txt on väike tekstifail, mis asub veebisaidi juurkaustas (nt: https://example.com/robots.txt). See fail sisaldab reegleid, mis ütlevad otsingumootori botidele – nagu Googlebot – teada:

  • Milliseid lehti tohib indekseerida (skannida)
  • Milliseid lehti ei tohi indekseerida
  • Kus saidikaart asub

Saate vaadata mis tahes veebisaidi robots.txt faili, sisestades brauserisse: domeeninimi.com/robots.txt.

💡 Oluline: robots.txt on ainult viisakas palve, mitte absoluutne keeld. Usaldusväärsed botid nagu Googlebot järgivad seda, kuid halvad botid (spämm, kraapijad) võivad seda ignoreerida. Kui vajate tõelist turvalisust, kasutage paroole või tulemüüri – ärge lootke robots.txt-ile.

Kuidas Robots.txt fail välja näeb?

Te ei pea seda faili ise nullist kirjutama. Kuid et mõista, mida vaadates näete, siin on lihtne robots.txt fail:

User-agent: *
Disallow: /admin/
Disallow: /thanh-toan/
Disallow: /staging/
Allow: /

Sitemap: https://example.com/sitemap.xml

Iga rea selgitus:

RidaTähendus
User-agent: *Kehtib kõigile botidele (Google, Bing jne)
Disallow: /admin/Ärge laske botidel siseneda kausta /admin/
Disallow: /thanh-toan/Ärge laske botidel siseneda makselehele
Disallow: /staging/Ärge laske botidel siseneda lavastusversiooni
Allow: /Laske botidel indekseerida kogu ülejäänud osa
Sitemap: https://...Teavitab botte, kus saidikaart asub

Siin on keerulisem näide – sobib ettevõtte veebisaidile, kus on ajaveeb, teenustelehed ja administraatori ala:

# Lubage kõigil botidel avalikku sisu indekseerida
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /search?
Disallow: /*?ref=
Disallow: /*?utm_

# Lubage Googlebotil indekseerida CSS-i ja JS-i (vajalik lehe renderdamiseks)
User-agent: Googlebot
Allow: /wp-content/uploads/
Allow: /wp-includes/

Sitemap: https://example.com/sitemap.xml
📝 Märkus arendajale: `` täht teel on Metasümbol – `/?utm_` tähendab igasuguste URL-ide blokeerimist, mis sisaldavad parameetrit `?utm_`. `$ `täht tee lõpus kasutatakse URL-i lõpu täpseks sobitamiseks. Näiteks: `Disallow: /*.pdf$` blokeerib kõik PDF-failid.

Kuidas Robots.txt töötab SEO protsessis?

Et mõista robots.txt kohta, vaadake uuesti protsessi, millega Google veebisaidi otsingutulemustesse lisab:

Crawl → Index → Rank
(Skanni)   (Salvesta)   (Järjesta)

Robots.txt töötab esimeses etapis – indekseerimine.

Enne kui Googlebot hakkab teie veebisaidil lehti indekseerima, kontrollib ta kõigepealt robots.txt-i. Kui URL on loetletud Disallow all, ignoreerib Googlebot seda lehte – ei indekseeri, ei loe sisu.

Googlebot soovib indekseerida https://example.com/admin/settings
→ Kontrollib robots.txt
→ Leiab Disallow: /admin/
→ Ignoreerib, ei indekseeri

Googlebot soovib indekseerida https://example.com/dich-vu/
→ Kontrollib robots.txt
→ Pole blokeeritud
→ Indekseerib normaalselt → Indekseerib → Võib ilmuda otsingutulemustesse

Robots.txt ja sitemap: täiendav paar

FailRoll
Sitemap"See on nimekiri lehtedest, mida ma tahan, et Google teaks"
Robots.txt"Need on lehed, mida ma ei taha, et Google indekseeriks"

Need kaks faili ei ole vastuolus – nad töötavad koos. Sitemap näitab teed, robots.txt paneb barjääri. Õigesti kombineerituna saate kontrollida, mida Google teie veebisaidil näeb ja mida ignoreerib.

Milleks robots.txt-i kasutatakse? 4 levinud juhtumit

1. Hoidke administraatori ja sisemised lehed Google'i eest varjatud

Administraatori lehed, CMS-i tagala lehed, lavastuslehed, testlehed – neid kõiki ei tohiks Google'is kuvada. Robots.txt aitab teil Google'ile öelda: "Ära siia sisenema."

Disallow: /admin/
Disallow: /wp-admin/
Disallow: /staging/

2. Vältige "indekseerimisbudžeti" raiskamist

Google ei indekseeri piiramatult. Igal veebisaidil on "indekseerimisbudžett" (crawl budget) – lehtede arv, mida Googlebot iga külastuse ajal skannib. Kui veebisaidil on palju ebaolulisi lehti (sisemised otsingulehed, filtrite lehed, leheküljenduse lehed), võib Googlebot olla hõivatud nende lehtede indekseerimisega, mitte oluliste teenuste või blogipostituste lehtedega.

Disallow: /search?
Disallow: /tag/
Disallow: /page/
💡 Indekseerimisbudžett on peamiselt oluline suurte veebisaitide puhul (tuhanded lehed). Väikeste ettevõtete veebisaidid ei pea tavaliselt liiga palju muretsema, kuid robots.txt korras hoidmine on siiski hea harjumus.

3. Blokeerige korduv sisu

Kui teie veebisaidil on mitu URL-i, mis viivad sama sisuni (näiteks URL-id jälgimisparameetritega ?utm_source=facebook või prindiversiooniga ?print=true), saate need korduvad URL-id blokeerida:

Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?print=

4. Suunake sitemapile

Robots.txt on esimene koht, mida Googlebot veebisaidile jõudes kontrollib. Sitemap'i asukoha siia paigutamine aitab Google'il sitemap'i kiiremini leida – isegi kui te pole seda veel Search Console'i kaudu esitanud.

Sitemap: https://example.com/sitemap.xml

Millal peaksid ettevõtted robots.txt vastu huvi tundma?

Teil ei pruugi alati olla vaja robots.txt-i muuta. Kuid on aeg, mil selle faili kontrollimine on kohustuslik:

Kui veebisait on just käivitatud (go-live)

See on kõige olulisem aeg. Paljud veebisaidid on indekseerimisest täielikult blokeeritud, kuna arendajad unustavad eemaldada rea Disallow: / – rea, mille nad lavastusfaasi ajal lisasid, et Google ei indekseeriks lõpetamata versiooni.

Kontrollimine käivitamisel:

KategooriaKuidas kontrollida
Robots.txt fail on olemasAvage brauseris https://domeeninimi.com/robots.txt
Kogu veebisaiti ei blokeeritaVeenduge, et Disallow: / rida PUUDUB
Sitemap on deklareeritudVeenduge, et Sitemap: https://domeeninimi.com/sitemap.xml rida ON OLEMAS
Olulised lehed pole blokeeritudKontrollige, et teenindus-, blogi- ja kontaktilehed pole Disallow all

✅ Kui veebisaiti ei indekseerita Google'is pärast mitu nädalat

Kui teil on sitemap, see on esitatud Search Console'i kaudu, kuid Google ikka ei indeksi – robots.txt on esimene kahtlusalune, mida kontrollida.

Oma ala lisamisel (liikmete lehed, sisemised lehed)

Kui veebisait lisab konto halduslehti, liikmete alasid või sisemisi lehti – värskendage robots.txt-faili, et need alad blokeerida.

Veebisaidi platvormi muutmisel või ümberkujundamisel

Iga platvorm (WordPress, Webflow, kohandatud kood) loob erineva URL-struktuuri. Migreerimisel võib vana robots.txt-fail valesti blokeerida uusi lehti või jätta välja lehed, mida tuleks blokeerida.

Kui Search Console teatab veast "Blocked by robots.txt"

Google Search Console'il on aruanne Indexing, mis näitab, millised lehed on robots.txt-faili poolt blokeeritud. Kui märkate, et tähtis leht on blokeeritud – on aeg faili kohe muuta.

5 levinud robots.txt viga ja kuidas neid parandada

Viga 1: Kogu veebisaidi blokeerimine – kõige tõsisem viga

Sümptomid: Ühtki lehte ei indeksi Google. Search Console teatab paljudest lehtedest "Blocked by robots.txt".

Põhjus: robots.txt-fail sisaldab:

User-agent: 
Disallow: /

Need kaks rida tähendavad: "Keela kõik botid igale lehele." Tavaliselt juhtub see siis, kui arendaja paigutab selle reegli testimise ajal ja unustab selle live-keskkonda minnes eemaldada.

Parandus: Muutke järgmiselt:

User-agent: *
Disallow:

Sitemap: https://your-domain.com/sitemap.xml

Disallow: (mitte midagi peale koolonit) = luba kõike indekseerida.

⚠️ See on number 1 viga, mida me näeme uutel ettevõtte veebisaitidel. Pärast parandamist võib Google'il kuluda uuesti indekseerimiseks paar päeva kuni paar nädalat. Esitage sitemap uuesti Search Console'i kaudu, et protsessi kiirendada.

Viga 2: CSS-i ja JavaScript-i blokeerimine

Sümptomid: Veebisait kuvatakse brauseris normaalselt, kuid kui kasutada Search Console'i tööriista "URL Inspection", näeb Google, et leht on katki või tühja sisuga.

Põhjus: Robots.txt blokeerib CSS-i ja JS-i sisaldavaid kaustu:

Disallow: /wp-content/
Disallow: /wp-includes/

Google vajab CSS-i ja JS-i lugemist, et mõista, kuidas leht välja näeb (seda nimetatakse "rendering"). Kui see on blokeeritud, ei saa Google lehte renderdada → ei saa sisust aru → mõjutab järjekohta.

Parandus:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Allow: /wp-content/
Allow: /wp-includes/
📝 Märkus arendajatele: Alates 2014. aastast on Google selgelt soovitanud: ärge blokeerige robots.txt-failis CSS-i, JS-i ja pilte. Googlebot vajab neid ressursse, et lehte õigesti renderdada. Kasutage Search Console'i URL Inspection tööriista, et kontrollida, kuidas Google teie lehte renderdab.

Viga 3: Tähtsa lehe valesti blokeerimine

Sümptomid: Teenuse lehed, tootelehed või blogipostitused ei ilmu Google'is – isegi kui sitemap neid loetleb.

Põhjus: robots.txt reegel on liiga lai. Näiteks:

Disallow: /dich-vu

See rida blokeerib mitte ainult /dich-vu/, vaid ka /dich-vu-thiet-ke-web/, /dich-vu-seo/ ja mis tahes URL-i, mis algab /dich-vu.

Parandus: Lisage kataloogi täpseks blokeerimiseks tee lõppu /:

Disallow: /dich-vu-noi-bo/

Või kasutage vajalike lehtede kaitsmiseks Allow:

Disallow: /dich-vu-noi-bo/
Allow: /dich-vu/
Allow: /dich-vu-thiet-ke-web/
📝 Märkus arendajatele: `Allow` ja `Disallow` järjekord on oluline. Googlebot kasutab kõige täpsemat teed (most specific path). Kui pikkus on sama, eelistatakse `Allow`-i `Disallow`-i ees. Testige alati enne kasutuselevõttu Search Console'i Robots Testing Tool abil.

Viga 4: Robots.txt faili puudumine

Ilming: Sisestage ten-mien.com/robots.txt → tagastab 404 vea.

Põhjus: Veebisait on käsitsi tehtud ja arendaja ei ole seda faili loonud. Või kustutati fail ekslikult juurutamise ajal.

Mõju: Mitte nii tõsine kui viga 1 - ilma robots.txt failita indekseerib Google vaikimisi kõike. Kuid see tähendab:

  • Google indekseerib administraatori, testi- ja siseseid lehti
  • Te ei saa robots.txt kaudu sitemapile viidata
  • Puudub põhikontroll

Lahendus: Looge fail robots.txt juurkausta. Minimaalne sisu:

User-agent: *
Disallow: /admin/
Disallow: /search?

Sitemap: https://ten-mien.com/sitemap.xml

Viga 5: Robots.txt kasutamine lehe Google'ist peitmiseks (valesti mõistetud eesmärk)

Ilming: Blokeerite lehe Disallow abil, kuid see ilmub siiski Google'is – kuigi ilma sisulõiguta.

Põhjus: Robots.txt blokeerib indekseerimist (crawl), mitte registreerimist (index). Kui leht oli juba varem indekseeritud või sellele viitab mõnest teisest veebisaidist tagasilink, võib Google hoida URL-i otsingutulemustes – lihtsalt ilma sisu kuvamiseta.

Õige lahendus:

EesmärkMida kasutada
Ei taha, et Google indekseeriks (crawl)Disallow robots.txt failis
Ei taha, et Google registreeriks (index) silt HTML-is
Ei taha mõlematKasutage HTML-is noindex (ja mitte blokeerige robots.txt failis)
⚠️ See on kõige sagedamini valesti mõistetud punkt: Kui blokeerite nii indekseerimise (robots.txt) kui ka määrate `noindex` (HTML), ei näe Google noindex silti, kuna lehte ei indekseerita — ja leht võib siiski registreerida. Lahendus: kasutage HTML-is `noindex` ja eemaldage lehe `Disallow` reegel robots.txt failist.

Näidis robots.txt äriveebisaidi jaoks

Allpool on näidis robots.txt fail, mis sobib enamikule VKEdest äriveebisaitidest:

# =============================================
# Robots.txt äriveebisaidi jaoks
# Värskendatud: 2026-04-20
# =============================================

# Kehtib kõigile robotitele
User-agent: *

# Blokeeri administraatori ja sise piirkonnad
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /dashboard/
Disallow: /staging/

# Blokeeri sisemised otsingulehed (vältimaks indekseerimisaja raiskamist)
Disallow: /search?
Disallow: /*?s=

# Blokeeri jälgimisparameetritega URL-id (vältimaks duplikaatsisuust)
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?fbclid=

# Blokeeri ostukorvi / makselehed (kui neid on)
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/

# Luba CSS, JS, pildid (Google vajab neid lehe renderdamiseks)
Allow: /wp-content/uploads/
Allow: /wp-content/themes/
Allow: /wp-includes/

# Viide sitemapile
Sitemap: https://ten-mien.com/sitemap.xml
📝 Märkus arendajale: Robots.txt fail peab asuma domeeni juures — `https://example.com/robots.txt`. Mitte `/blog/robots.txt` ega muus alamkaustas. Igal alamdomeenil on vaja oma robots.txt faili (näiteks `blog.example.com/robots.txt` on eraldi `example.com/robots.txt` failist).

Kuidas kontrollida oma veebisaidi robots.txt faili

1. meetod: Kontrollige otse brauseris

Sisestage aadressiribale `https://ten-mien-cua-ban.com/robots.txt`. Näete faili sisu tekstivormingus. Kui näete 404 viga — veebisaidil pole robots.txt faili.

2. meetod: Kasutage Google Search Console'i

  1. Logige sisse Google Search Console
  2. Minge jaotisesse SettingsCrawlingrobots.txt
  3. Vaadake robots.txt faili, mida Google loeb
  4. Kontrollige, kas konkreetne URL on blokeeritud

3. meetod: kontrollimine indekseerimisaruannetes

Search Console'is → Pages (või Indexing) → otsige jaotist "Blocked by robots.txt". Kui selles loendis on mõni oluline leht, peate robots.txt viivitamatult parandama.

💡 Soovitatav on robots.txt-i kontrollida vähemalt kord kvartalis või iga kord, kui veebisaidil toimub suur muudatus (lehtede lisamine, struktuuri muutmine, platvormi migreerimine).

Kokkuvõtlik tabel: Mida robots.txt peaks blokeerima ja mida mitte

✅ TOHIKS blokeerida❌ EI TOHIKS blokeerida
Administreerimislehed (/admin/, /wp-admin/)Avaleht, teenuste leht, kontaktileht
Staging / testlehedBlogipostitused, artiklid
Sisesed otsingulehed (/search?)CSS ja JavaScript failid
URL-id jälgimisparameetritega (?utm_, ?fbclid=)Pildid (Google Images toob samuti liiklust)
Ostukorvi lehed, makselehed, isiklikud kontodSitemap
Duplikaatsisuulise sisuga lehed (filter, sort, lehitsemine)KKK, juhtumiuuringute lehed

Korduma kippuvad küsimused robots.txt kohta

Kuidas robots.txt ja sitemap erinevad?

Sitemap ütleb: "Siin on lehed, millest ma tahan, et Google teaks." Robots.txt ütleb: "Siin on lehed, mida ma ei soovi, et Google indekseeriks." Mõlemad failid täiendavad üksteist – sitemap näitab teed sisse, robots.txt seab tõkkeid.

Kas Google saab veebisaiti indekseerida, kui robots.txt puudub?

Jah. Ilma robots.txt-ita indekseerib Google vaikimisi kõik lehed – ka need, mida te ei soovi. Seetõttu on see fail oluline.

Ma kasutan WordPressi, kus robots.txt asub?

WordPress loob ise virtuaalse robots.txt faili. Kui kasutate SEO-pistikkleemiseid nagu Yoast või Rank Math, saate robots.txt faili redigeerida otse pistikkleemises, ilma et peaksite serverile juurde pääsema.

Kas robots.txt mõjutab veebisaidi kiirust?

Ei. See fail on vaid paar KB suurune. See ei mõjuta lehe laadimise kiirust.

Ma blokeerisin lehe robots.txt abil, miks see ikka veel Google'is ilmub?

Kuna robots.txt blokeerib ainult indekseerimist, mitte registreerimist. Kui soovite, et leht Google'ist täielikult kaoks, kasutage HTML-is meta-märgendit - ja ärge blokeerige seda lehte robots.txt-is (et Google saaks noindex-märgendit lugeda).

Kui kaua võtab aega, kuni Google pärast robots.txt parandamist värskendab?

Google kontrollib robots.txt faili uuesti tavaliselt 24–48 tunni jooksul. Saate Search Console → Settings → Crawling jaotisesse minna, et taotleda Google'ilt varasemat kontrollimist.

Kokkuvõte

Robots.txt on väike fail – tavaliselt vaid mõne rea pikkune – kuid see mõjutab otseselt seda, kas Google teie veebisaiti näeb või mitte.

Asjad, mida meeles pidada:

  1. Robots.txt on "Piiratud ala" silt: see ütleb Google'ile, milliseid lehti ei tohi indekseerida
  2. Kontrollige kohe, kui veebisait läheb tööle: kogu veebisaidi blokeerimise viga on kõige levinum ja tõsisem viga
  3. Ärge kasutage robots.txt-i lehtede peitmiseks Google'ilt: see blokeerib indekseerimist, mitte registreerimist
  4. Lubage alati CSS ja JS: Google vajab lehe renderdamist, et sisu mõista
  5. Koostöö sitemap'i ja Search Console'iga: et täielikult kontrollida, kuidas Google teie veebisaiti indekseerib ja registreerib

Kontrollige oma veebisaidi platvormi

Robots.txt on vaid üks paljudest tehnilistest teguritest, mis mõjutavad SEO-d. Kui te mõtlete: "Kas minu veebisait on õigesti seadistatud?" – vastus peitub teie kasutatavas platvormis.

GTG CRM aitab teil luua veebisaidi, millel on standardne robots.txt, automaatne sitemap ja Google'i jaoks valmis tehniline struktuur – te ei pea muretsema iga faili või koodirea muutmisega.

Muutke see, mida just lugesite, reaalseteks tulemusteks — rakendage GTG CRM-iga kohe, tasuta.

Rakendage kohe