Mis on robots.txt ja millal peaks ettevõte selle faili suhtes tähelepanelik olema?

Teil on sitemap, olete selle Google'ile esitanud ja veebisait on hakanud indekseeruma. Kuid ühel päeval avastate, et teie administratsioonipaneel, sisemised makselehed või teie veebisaidi testimislehed ilmuvad Google'is. Kui kliendid otsivad teie ettevõtte nime – näevad nad isegi teie veel lõpetamata testilehte.

Või vastupidi: postitate uut blogiartiklit, aga kahe nädala pärast pole seda Google'is näha. Küsides tehniliselt üksuselt, ütlevad nad: "Robots.txt fail blokeerib Google'il kogu veebisaidi indekseerimise."

Mõlemad olukorrad on seotud väikese failiga, millele veebihaldurid vähe tähelepanu pööravad: robots.txt.

See artikkel selgitab, mis on robots.txt, kuidas see töötab, millal seda peaks muutma ja milliseid levinud vigu ettevõtted peaksid vältima – kõik see lihtsas keeles ja koos praktiliste näidetega.

Mis on robots.txt? Selgitus veebihaldurile

Kui sitemap on hoone plaan – see ütleb Google'ile, millised toad on olemas, siis robots.txt on "Keelatud ala" silt – see ütleb Google'ile, millistesse ruumidesse ei tohi siseneda.

Tehniliselt öeldes on robots.txt väike tekstifail, mis asub teie veebisaidi juurkaustas (näiteks: https://example.com/robots.txt). See fail sisaldab reegleid, mis ütlevad otsingumootorite robotitele – nagu Googlebot –:

  • Milliseid lehti tohib indekseerida (skaneerida)
  • Milliseid lehti ei tohi indekseerida
  • Kus asub sitemap

Saate vaadata mis tahes veebisaidi robots.txt faili, sisestades brauserisse: domeeninimi.com/robots.txt.

💡 Oluline: robots.txt on ainult viisakas palve, mitte absoluutne keeld. Usaldusväärsed botid, nagu Googlebot, järgivad seda, kuid halvad botid (spämm, skrapijad) võivad seda ignoreerida. Kui vajate tõelist turvalisust, kasutage paroole või tulemüüri – ärge lootke robots.txt peale.

Milline robots.txt fail välja näeb?

Te ei pea seda faili algusest peale ise kirjutama. Kuid selle mõistmiseks, kui seda vaatate, siin on lihtne robots.txt fail:

User-agent: *
Disallow: /admin/
Disallow: /thanh-toan/
Disallow: /staging/
Allow: /

Sitemap: https://example.com/sitemap.xml

Iga rea selgitus:

RidaTähendus
User-agent: *Kehtib kõigile botidele (Google, Bing jne.)
Disallow: /admin/Keelab botidel siseneda kausta /admin/
Disallow: /thanh-toan/Keelab botidel siseneda makselehtedele
Disallow: /staging/Keelab botidel siseneda staging versiooni
Allow: /Lubab botidel indekseerida ülejäänud osa
Sitemap: https://...Teavitab botti sitemap asukohast

Siin on keerulisem näide – sobiv ettevõtte veebisaidile, millel on blogi, teenuste lehed ja administratsiooniala:

# Lubab kõikidele botidele avaliku sisu indekseerimist
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /search?
Disallow: /*?ref=
Disallow: /*?utm_

# Lubab Googlebotil indekseerida CSS ja JS (vajalik lehe renderdamiseks)
User-agent: Googlebot
Allow: /wp-content/uploads/
Allow: /wp-includes/

Sitemap: https://example.com/sitemap.xml

📝 Märkus arendajatele: tee sees olev * on metsik kaart – /?utm_ tähendab kõigi URL-ide blokeerimist, mis sisaldavad parameetrit ?utm_. Märk $ URL-i lõpus kasutatakse URL-i lõpu täpseks vastendamiseks. Näiteks: Disallow: /*.pdf$ blokeerib kõik PDF-failid.

---

Kuidas robots.txt töötab SEO protsessis?

Robots.txt faili asukoha mõistmiseks vaadake üle protsessi, millega Google veebisaite otsingutulemustesse lisab:

Crawl → Index → Rank
(Skaneeri)   (Salvesta)   (Järjesta)

Robots.txt töötab esimeses etapis – Crawl.

Enne kui Googlebot hakkab teie veebisaidil ühtegi lehte skaneerima, kontrollib ta esmalt robots.txt-i. Kui URL on loendis Disallow, ignoreerib Googlebot seda lehte – ei skaneeri, ei loe sisu.

Googlebot soovib skaneerida https://example.com/admin/settings
→ Kontrollib robots.txt-i
→ Leiab Disallow: /admin/
→ Ignoreerib, ei skaneeri

Googlebot soovib skaneerida https://example.com/dich-vu/
→ Kontrollib robots.txt-i
→ Ei ole blokeeritud
→ Skaneerib normaalselt → Salvestab → Võib ilmuda otsingutulemustesse

Robots.txt ja sitemap: täiendav paar

FailRoll
Sitemap"See on lehtede loetelu, mida soovin, et Google teaks"
Robots.txt"Need on lehed, mida ei soovi, et Google skaneeriks"

Need kaks faili ei ole vastuolus – nad töötavad koos. Sitemap näitab teed, robots.txt seab piirdeid. Kui neid õigesti kombineerida, saate kontrollida, mida Google teie veebisaidil näeb ja mida ignoreerib.

Milleks robots.txt-i kasutatakse? 4 levinud juhtumit

1. Haldus- ja siseveebilehtede peitmine Google'ilt

Adminlehed, CMS-i taustalehed, lavastuslehed, testlehed – neid kõiki ei tohiks Google'is kuvada. Robots.txt aitab teil Google'ile öelda: "Ära siia tule."

Disallow: /admin/
Disallow: /wp-admin/
Disallow: /staging/

2. "Crawl budgeti" raiskamise vältimine

Google ei skaneeri piiramatult. Igal veebisaidil on "skaneerimise eelarve" (crawl budget) – lehtede arv, mida Googlebot külastuse ajal skaneerib. Kui veebisaidil on palju vähetähtsaid lehti (sisesed otsingulehed, filtrid, leheküljendused), võib Googlebot kulutada nende lehtede skaneerimisele hoopis tähtsamate teenuste või ajaveebiartiklite asemel.

Disallow: /search?
Disallow: /tag/
Disallow: /page/

💡 Crawl budget on peamiselt oluline suurte veebisaitide (tuhanded lehed) puhul. Väikeettevõtte veebisaidid ei pea tavaliselt liiga palju muretsema, kuid robots.txt puhtana hoidmine on siiski hea tava.

3. Duplikaatsisu sealduse blokeerimine

Kui teie veebisaidil on mitu URL-i, mis viivad samale sisule (näiteks jälgimisparameetriga URL-id ?utm_source=facebook või prinditavad versioonid ?print=true), saate need duplikaatsed URL-id blokeerida:

Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?print=

4. Sitemapi suunamise näitamine

Robots.txt on esimene koht, mida Googlebot veebisaidile saabumisel kontrollib. Sitemapitee siia panemine aitab Google'il sitemapile kiiremini juurde pääseda – isegi kui te pole seda veel Search Console'i kaudu esitanud.

Sitemap: https://example.com/sitemap.xml

Millal peaksid ettevõtted robots.txt-i tähele panema?

Te ei pea alati robots.txt-i muutma. Kuid on aeg, millal selle faili kontrollimine on kohustuslik:

Kui veebisait on just käivitatud (go-live)

See on kõige kriitilisem aeg. Paljud veebisaidid on täielikult skaneerimisest blokeeritud, kuna arendajad unustavad eemaldada rea Disallow: / – rea, mille nad lavastusperioodil lisasid, et Google ei indekseeriks lõpetamata versiooni.

Kontrollige käivitamisel:

KategooriaKuidas kontrollida
robots.txt fail on olemasAvage brauseris https://ten-mien.com/robots.txt
Kogu veebisaiti ei tohiks blokeeridaVeenduge, et Disallow: / rida puudub
Sitemap on deklareeritudVeenduge, et Sitemap: https://ten-mien.com/sitemap.xml rida on olemas
Olulisi lehti ei tohiks blokeeridaKontrollige, et teenuste, ajaveebi ja kontaktide lehti ei oleks Disallow all

✅ Kui teie veebisaiti pole Google indekseerinud juba nädalaid

Kui teil on sitemap, olete selle Search Console'i kaudu esitanud, kuid Google seda ikka ei indekseeri – robots.txt on esimene kahtlusalune, mida tuleks kontrollida.

Kui lisate varjutamist vajavaid sektsioone (liikmeala, sise-lehed)

Kui teie veebisaidile lisatakse konto haldamise leht, liikmepiirkond või sise-leht – värskendage robots.txt-faili, et neid piirkondi blokeerida.

Veebisaidi platvormi muutmisel või uuesti kujundamisel

Iga platvorm (WordPress, Webflow, kohandatud kood) loob erineva URL-i struktuuri. Migreerimisel võib vana robots.txt valesti blokeerida uusi lehti või jätta blokeerimata lehti, mida tuleks blokeerida.

Kui Search Console teatab veast "Blokeeritud robots.txt poolt"

Google Search Console sisaldab aruannet Indekseerimine, mis näitab, millised lehed on robots.txt poolt blokeeritud. Kui näete, et olulisi lehti on blokeeritud – on aeg faili kohe muuta.

5 levinumat robots.txt viga ja nende parandamine

Viga 1: Kogu veebisaidi blokeerimine – kõige tõsisem viga

Sümptomid: Ühtki lehte pole Google indekseerinud. Search Console teatab suure hulga lehtede kohta "Blokeeritud robots.txt poolt".

Põhjus: robots.txt fail sisaldab:

User-agent: 
Disallow: /

Need kaks rida tähendavad: "Keelake kõik botid mis tahes lehele sisenemast." Tavaliselt juhtub see siis, kui arendaja pani selle reegli töökeskkonnas ja unustas selle avaldamisel eemaldada.

Parandus: Muutke järgmiselt:

User-agent: *
Disallow:

Sitemap: https://ten-mien.com/sitemap.xml

Disallow: (tühi pärast koolonit) = lubage indekseerida kõike.

⚠️ See on nr 1 viga, mida näeme uutel ärikliendi veebisaitidel. Pärast parandamist võib Google'il kuluda mõni päev kuni nädal, et uuesti indekseerida. Esitage sitemap uuesti Search Console'i kaudu, et protsessi kiirendada.

---

Viga 2: CSS-i ja JavaScripti blokeerimine

Sümptomid: Veebisait kuvatakse brauseris normaalselt, kuid kui Search Console'is kasutatakse tööriista "URL Inspection", näeb Google, et lehel on rikutud paigutus või tühi sisu.

Põhjus: Robots.txt blokeerib CSS-i ja JS-i sisaldavaid katalooge:

Disallow: /wp-content/
Disallow: /wp-includes/

Google vajab CSS-i ja JS-i lugemiseks, et mõista, kuidas leht välja näeb (nn "renderdamine"). Kui need on blokeeritud, ei saa Google lehte renderdada → ei mõista sisu → mõjutab järjestust.

Parandus:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Allow: /wp-content/
Allow: /wp-includes/

📝 Märkus arendajale: Alates 2014. aastast on Google selgelt soovitanud: ärge blokeerige CSS-i, JS-i ja pilte robots.txt-failis. Googlebot vajab neid ressursse lehe õigeks renderdamiseks. Kasutage Search Console'i tööriista "URL Inspection", et kontrollida, kuidas Google teie lehte renderdab.

Viga 3: Oluliste lehtede vale blokeerimine

Sümptomid: Teenuste lehed, tootelehed või ajaveebi postitused ei ilmu Google'is – kuigi sitemap loetleb neid.

Põhjus: Robots.txt reegel on liiga lai. Näiteks:

Disallow: /dich-vu

See rida blokeerib mitte ainult /dich-vu/, vaid ka /dich-vu-thiet-ke-web/, /dich-vu-seo/ ja mis tahes URL-i, mis algab /dich-vu.

Lahendus: Lisage kataloogi täpseks blokeerimiseks tee lõppu /:

Disallow: /dich-vu-noi-bo/

Või kasutage vajalike lehtede kaitsmiseks Allow:

Disallow: /dich-vu-noi-bo/
Allow: /dich-vu/
Allow: /dich-vu-thiet-ke-web/

📝 Märkus arendajale: Allow ja Disallow järjekord on oluline. Googlebot kasutab kõige konkreetsemat reeglit (most specific path). Kui pikkus on sama, eelistatakse Allow Disallow'le. Testige alati enne kasutuselevõttu Search Console'i Robots Testing Tool abil.

Viga 4: Puudub robots.txt fail

Ilming: Sisestades ten-mien.com/robots.txt → kuvatakse 404 viga.

Põhjus: Käsitsi valmistatud veebisait, kus arendaja seda faili ei loonud. Või fail kustutati ekslikult kasutuselevõtu käigus.

Mõju: Mitte nii tõsine kui viga 1 – kui robots.txt puudub, indekseerib Google vaikimisi kõike. Kuid see tähendab:

  • Google indekseerib ka administraatori lehed, testlehed, siseveebilehed
  • Teil pole võimalust robots.txt kaudu sitemapini juhatada
  • Puudub elementaarne kontroll

Lahendus: Looge robots.txt fail juurkataloogis. Miinimum sisu:

User-agent: *
Disallow: /admin/
Disallow: /search?

Sitemap: https://ten-mien.com/sitemap.xml

---

Viga 5: Robots.txt kasutamine lehtede peitmiseks Google'i eest (eesmärgi valesti mõistmine)

Ilming: Te blokeerite lehe Disallow abil, kuid see leht ilmub endiselt Google'is – kuigi ilma sisutükita.

Põhjus: Robots.txt blokeerib indekseerimist (crawl), mitte indekseerimist (index). Kui leht oli juba varem indekseeritud või sellele viitab tagasilink teiselt veebisaidilt, võib Google hoida URL-i otsingutulemustes – lihtsalt sisu ei kuvata.

Õige lahendus:

EesmärkMida kasutada
Ei soovi, et Google indekseeriks (crawl)Disallow robots.txt-is
Ei soovi, et Google indekseeriks (index) märgend HTML-is
Ei soovi mõlematKasutage HTML-is noindex (ja ärge blokeerige robots.txt-is)

⚠️ See on kõige sagedamini valesti mõistetud punkt: Kui te blokeerite indekseerimise (robots.txt) ja samal ajal lisate noindex (HTML), siis Google ei näe noindex märgendit, kuna lehte ei indekseerita (crawl) – ja leht võib siiski indekseerida. Lahendus: kasutage HTML-is noindex ja eemaldage robots.txt-st selle lehe Disallow reegel.

Näidis robots.txt väikeettevõtte veebisaidile

Siin on robots.txt faili näidis, mis sobib enamikule väikeettevõtete (SMB) veebisaitidele:

# =============================================
# Robots.txt väikeettevõtte veebisaidile
# Värskendatud: 2026-04-20
# =============================================

# Kehtib kõikidele botidele
User-agent: *

# Blokeeri administraatori ja sisealad
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /dashboard/
Disallow: /staging/

# Blokeeri sisesed otsingulehed (vältimaks indekseerimisruumi raiskamist)
Disallow: /search?
Disallow: /*?s=

# Blokeeri jälgimisparameetritega URL-id (vältimaks korduvat sisu)
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?fbclid=

# Blokeeri ostukorv / kassasse mineku lehed (kui on olemas)
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/

# Luba CSS, JS, pildid (Google vajab neid lehe renderdamiseks)
Allow: /wp-content/uploads/
Allow: /wp-content/themes/
Allow: /wp-includes/

# Juhatab sitemapini
Sitemap: https://ten-mien.com/sitemap.xml

📝 Märkus arendajale: robots.txt fail peab asuma domeeni juurkaustas — https://example.com/robots.txt. Mitte /blog/robots.txt ega mõnes teises alamkataloogis. Igal alamdomeenil vajab oma robots.txt faili (näiteks blog.example.com/robots.txt on eraldi failist example.com/robots.txt).

Kuidas kontrollida oma veebisaidi robots.txt-i

1. meetod: Kontrollige otse brauseris

Sisestage aadressiribale https://sinu-domeeni-nimi.com/robots.txt. Näete faili sisu tekstina. Kui näete 404 viga — veebisaitil pole veel robots.txt-i.

2. meetod: Kasutage Google Search Console'i

  1. Logige sisse Google Search Console'i
  2. Minge jaotisse SettingsCrawlingrobots.txt
  3. Vaadake robots.txt faili, mida Google loeb
  4. Kontrollige, kas konkreetne URL on blokeeritud

3. meetod: Kontrollige indekseerimise aruandlust

Search Console'is → Pages (või Indexing) → Leidke jaotis "Blocked by robots.txt". Kui selles loendis on mõni oluline leht, peate robots.txt-i viivitamatult parandama.

💡 Robots.txt-i tuleks kontrollida vähemalt kord kvartalis või iga kord, kui veebisaidil toimuvad suured muudatused (lisatakse lehti, muudetakse struktuuri, migreeritakse platvormi).

Kokkuvõtlik tabel: Mida peaks robots.txt blokeerima ja mida mitte

✅ TULEKS blokeerida❌ EI TULEKS blokeerida
Administraatori lehed (/admin/, /wp-admin/)Esileht, teenuste lehed, kontaktilehed
Staging / testlehedBlogipostitused, artiklid
Sisemised otsingulehed (/search?)CSS ja JavaScript failid
URL-id koos jälgimisparameetritega (?utm_, ?fbclid=)Pildid (Google Pildid toob samuti liiklust)
Ostukorvi, makse, isikliku konto lehedSitemap
Duplikaatsisu sisuga lehed (filtrid, sorteerimine, leheküljendus)KKK lehed, juhtumiuuringud

---

Korduma kippuvad küsimused robots.txt kohta

Kuidas erinevad robots.txt ja sitemap?

Sitemap ütleb: "See on leht, millest tahan, et Google teaks." Robots.txt ütleb: "See on leht, mida ma ei taha, et Google indekseeriks." Kaks faili täiendavad teineteist — sitemap näitab teed sisse, robots.txt paneb barjäärid.

Kui robots.txt-i pole, kas Google saab veebisaiti indekseerida?

Jah. Ilma robots.txt-ita indekseerib Google vaikimisi kõik lehed — sealhulgas need, mida te ei soovi. Seetõttu on seda faili vaja.

Ma kasutan WordPressi, kus robots.txt asub?

WordPress loob ise virtuaalse robots.txt faili. Kui kasutate SEO pistikprogramme nagu Yoast või Rank Math, saate robots.txt-i muuta otse pistikprogrammis, ilma serverisse sisse logimata.

Kas robots.txt mõjutab veebisaidi kiirust?

Ei. See fail on ainult paar KB suurune. See ei mõjuta lehe laadimiskiirust.

Ma blokeerisin lehe robots.txt-iga, miks see siis ikka Google'isse ilmub?

Kuna robots.txt blokeerib ainult indekseerimise, mitte indeksi loomise. Kui soovite, et leht Google'ist täielikult kaoks, kasutage HTML-is meta-märgendit — ja ärge blokeerige seda lehte robots.txt-is (et Google saaks noindex märgendit lugeda).

Kui ma olen robots.txt-i muutnud, kui kaua aega võtab, et Google seda värskendaks?

Google kontrollib robots.txt-i tavaliselt uuesti 24-48 tunni jooksul. Saate minna Search Console'i → Settings → Crawling ja paluda Google'il varem uuesti kontrollida.

Järeldus

Robots.txt on väike fail — tavaliselt vaid paar rida —, kuid see mõjutab otseselt seda, kas Google teie veebisaiti näeb või mitte.

Meeldejätamist väärt:

  1. Robots.txt on silt "Keelatud ala": ütleb Google'ile, milliseid lehti ei tohi indekseerida
  2. Kontrollige kohe, kui veebisait läheb käiku: veebisaidi täieliku blokeerimise viga on levinud ja tõsine
  3. Ärge kasutage robots.txt, et peita lehte Google'i eest: see blokeerib indekseerimise, mitte indekseerimise
  4. Luba alati CSS ja JS: Google peab lehe renderdama, et sisu mõista
  5. Ühendage sitemap ja Search Console: et Google'i indekseerimist ja indekseerimist täielikult kontrollida

Kontrollige oma veebisaidi platvormi

Robots.txt on vaid üks paljudest tehnilistest teguritest, mis mõjutavad SEO-d. Kui te mõtlete: "Kas minu veebisait on õigesti seadistatud?" - vastus peitub kasutatavas platvormis.

GTG CRM aitab teil luua veebisaidi, millel on standardne robots.txt, automaatne sitemap ja Google'i valmis tehniline struktuur – te ei pea muretsema iga faili või koodirea muutmisega.

Muutke loetu reaalseks tulemuseks — rakendage kohe GTG CRM-iga tasuta.

Rakendage kohe