Kas Yra Robots.txt Ir Kada Verslui Reikėtų Juo Susirūpinti?
Jūs turite sitemap, išsiuntėte jį „Google“, o jūsų svetainė pradeda būti indeksuojama. Bet vieną dieną pastebite, kad administratoriaus (admin) puslapis, vidiniai mokėjimų puslapiai ar svetainės staging versija taip pat pasirodo „Google“. Klientas įveda jūsų įmonės pavadinimą – ir mato nebaigtą testavimo puslapį.
Arba atvirkščiai: jūs paskelbiate naują tinklaraščio įrašą, laukiate dvi savaites, bet jo vis tiek nematote „Google“. Paklausę techninės komandos, jie atsako: „Robots.txt failas blokuoja „Google“ nuo visos svetainės nuskaitymo.“
Abi situacijos susijusios su mažu failu, į kurį dažnai nekreipia dėmesio tinklalio administratoriai: robots.txt.
Šiame straipsnyje paprastu kalbos ir su praktiniais pavyzdžiais paaiškinsime, kas yra robots.txt, kaip jis veikia, kada jį reikia redaguoti ir kokių dažnų klaidų verslas turėtų vengti.
Kas Yra Robots.txt? Paaiškinimas Tinklalio Administratoriams
Jei sitemap yra kaip pastato planas – nurodantis „Google“, kokie kambariai yra, – tai robots.txt yra „Ribotos zonos“ ženklas, sakantis „Google“, į kuriuos kambarius negalima eiti.
Techniškai kalbant: robots.txt yra mažas tekstinis failas, esantis svetainės šakninėje direktorijoje (pvz.: https://example.com/robots.txt). Šiame faile yra taisyklių (rules), kurios nurodo paieškos sistemų robotams – pavyzdžiui, Googlebot – ką daryti:
- Kuriuos puslapius leista nuskaityti (crawl)
- Kuriuos puslapius negalima nuskaityti
- Kur yra sitemap
Galite peržiūrėti bet kurios svetainės robots.txt failą, įvedę į naršyklę: domenas.lt/robots.txt.
💡 Svarbu: robots.txt yra tik mandagus prašymas, o ne absoliutus draudimas. Patikimi robotai, tokie kaip Googlebot, jo laikysis, tačiau piktybiški robotai (šlamštas, „scrapers“) gali jį ignoruoti. Jei jums reikia tikros apsaugos, naudokite slaptažodžius ar ugniasienę – nepasikliaukite robots.txt.
Kaip Atrodo Robots.txt Failas?
Jums nereikės rašyti šio failo nuo nulio. Bet kad suprastumėte, ką matote, štai paprastas robots.txt failas:
User-agent: *
Disallow: /admin/
Disallow: /thanh-toan/
Disallow: /staging/
Allow: /
Sitemap: https://example.com/sitemap.xml
Paaiškinimas kiekvienos eilutės:
| Eilutė | Reikšmė |
|---|---|
User-agent: * | Taikoma visiems robotams (Google, Bing ir tt.) |
Disallow: /admin/ | Neleisti robotams patekti į /admin/ direktoriją |
Disallow: /thanh-toan/ | Neleisti robotams patekti į mokėjimo puslapį |
Disallow: /staging/ | Neleisti robotams patekti į staging versiją |
Allow: / | Leisti robotams nuskaityti visą likusią dalį |
Sitemap: https://... | Nurodo robotams, kur yra sitemap |
Štai sudėtingesnis pavyzdys – tinkamas verslo svetainei su tinklaraščiu, paslaugų puslapiais ir administratoriaus zona:
# Leisti visiems robotams nuskaityti viešą turinį
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /search?
Disallow: /*?ref=
Disallow: /*?utm_
# Leisti Googlebot nuskaityti CSS ir JS (būtina puslapių atvaizdavimui)
User-agent: Googlebot
Allow: /wp-content/uploads/
Allow: /wp-includes/
Sitemap: https://example.com/sitemap.xml
📝 Pastaba kūrėjams: Kelio (path) simbolis
yra „wildcard“ –/?utm_reiškia blokavimą visų URL, kuriuose yra?utm_parametras. Simbolis$kelio pabaigoje naudojamas tiksliam URL pabaigos sutikimui. Pavyzdžiui:Disallow: /*.pdf$blokuos visus PDF failus.
---
Kaip Robots.txt Veikia SEO Procese?
Norint suprasti robots.txt failo vietą, grįžkime prie „Google“ proceso, kaip svetainė patenka į paieškos rezultatus:
Crawl → Index → Rank
(Peržiūra) (Indeksavimas) (Reitingavimas)
Robots.txt veikia pirmajame etape – Crawl (Peržiūra).
Prieš „Googlebot“ pradėdamas peržiūrėti bet kurį jūsų svetainės puslapį, jis **pirmiausia patikrina robots.txt**. Jei URL yra įtrauktas į Disallow, „Googlebot“ praleis tą puslapį – neperžiūrės, neskaitys turinio.
Googlebot nori peržiūrėti https://example.com/admin/settings
→ Patikrina robots.txt
→ Randa Disallow: /admin/
→ Praleidžia, neperžiūri
Googlebot nori peržiūrėti https://example.com/dich-vu/
→ Patikrina robots.txt
→ Nėra blokuojama
→ Peržiūri normaliai → Indeksuoja → Gali patekti į paieškos rezultatus
Robots.txt ir „sitemap“: papildantis duetas
| Failas | Vaidmuo |
|---|---|
| Sitemap | „Tai puslapių sąrašas, apie kuriuos noriu, kad „Google“ žinotų“ |
| Robots.txt | „Tai puslapiai, kurių nenoriu, kad „Google“ peržiūrėtų“ |
Šie du failai nesipriešina – jie veikia kartu. „Sitemap“ rodo kelią, „robots.txt“ stato užtvaras. Tinkamai juos sujungus, galite kontroliuoti, ką „Google“ mato ir ką praleidžia jūsų svetainėje.
Kam naudojamas robots.txt? 4 populiarūs atvejai
1. Slėpti administravimo ir vidinius puslapius nuo „Google“
Administravimo puslapiai, CMS backend puslapiai, staging puslapiai, testavimo puslapiai – visa tai neturėtų atsirasti „Google“. Robots.txt padeda pasakyti „Google“: „Neikite čia.“
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /staging/
2. Taupyti „crawl budget“ (peržiūros biudžetą)
„Google“ neperžiūri neribotai. Kiekviena svetainė turi savo „peržiūros biudžetą“ (crawl budget) – puslapių skaičių, kurį „Googlebot“ peržiūrės kiekvieno apsilankymo metu. Jei svetainėje yra daug nesvarbių puslapių (vidinės paieškos puslapiai, filtravimo puslapiai, puslapiavimo puslapiai), „Googlebot“ gali užsiimti jų peržiūra, o ne svarbių paslaugų ar tinklaraščio įrašų puslapių.
Disallow: /search?
Disallow: /tag/
Disallow: /page/
💡 „Crawl budget“ visų pirma yra svarbus didelėms svetainėms (tūkstančiai puslapių). Mažų įmonių svetainėms dažnai nereikia per daug jaudintis, tačiau tvarkingas robots.txt failas išlieka geras įprotis.
3. Blokuoti dubliuojamą turinį
Jei jūsų svetainėje yra daug URL, vedančių į tą patį turinį (pvz., URL su sekimo parametrais ?utm_source=facebook arba spausdinimo versija ?print=true), galite blokuoti šiuos dubliuojamus URL:
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?print=
4. Nurodyti kelią į „sitemap“
Robots.txt yra pirmoji vieta, kurią „Googlebot“ patikrina atvykęs į svetainę. Nurodydami „sitemap“ kelią čia, padedate „Google“ greičiau rasti „sitemap“ – net jei jos dar neišsiuntėte per „Search Console“.
Sitemap: https://example.com/sitemap.xml
Kada įmonėms reikia atkreipti dėmesį į robots.txt?
Ne visada reikia koreguoti robots.txt. Tačiau yra momentų, kai šio failo patikrinimas yra **būtinas**:
Kai svetainė ką tik paleista (go-live)
Tai svarbiausias momentas. Daug svetainių yra visiškai užblokuotos nuo peržiūros, nes kūrėjai pamiršta pašalinti eilutę Disallow: / – eilutę, kurią jie įdėjo „staging“ metu, kad „Google“ neindeksų dar nebaigtos versijos.
Tikrinkite, kai svetainė paleidžiama:
| Kategorija | Kaip patikrinti |
|---|---|
| robots.txt failas egzistuoja | Atidarykite https://ten-mien.com/robots.txt naršyklėje |
| Visas svetainės neblokuojama | Įsitikinkite, kad NĖRA eilutės Disallow: / |
| Yra nukreipimo į žemėlapį deklaracija | Įsitikinkite, kad YRA eilutė Sitemap: https://ten-mien.com/sitemap.xml |
| Svarbūs puslapiai nėra blokuojami | Patikrinkite, ar paslaugų, tinklaraščio, kontaktų puslapiai nėra Disallow |
✅ Kai svetainė ilgai neįtraukiama į Google indeksą po kelių savaičių
Jei turite žemėlapį ir jį išsiuntėte per Search Console, bet Google vis tiek neįtraukia – robots.txt yra pirmasis įtartinas dalykas, kurį reikia patikrinti.
Kai pridedamas regionas, kurį reikia paslėpti (narių puslapis, vidinis puslapis)
Jei svetainė papildomai įtraukia paskyros valdymo puslapį, nario regioną arba vidinius puslapius – atnaujinkite robots.txt, kad užblokuotumėte šiuos regionus.
Keičiant svetainės platformą arba pertvarkant
Kiekviena platforma (WordPress, Webflow, custom code) sukuria skirtingą URL struktūrą. Migruojant, senas robots.txt gali neteisingai užblokuoti naujus puslapius arba praleisti tuos, kuriuos reikia blokuoti.
Kai Search Console praneša apie klaidą "Blocked by robots.txt"
Google Search Console turi Indexing ataskaitą, kuri nurodo, kurie puslapiai yra blokuojami robots.txt. Jei pastebite, kad svarbus puslapis yra blokuojamas – pats laikas taisyti failą.
5 Dažniausios robots.txt klaidos ir jų taisymas
1 klaida: Visos svetainės blokavimas – rimčiausia klaida
Simptomai: Nė vienas puslapis neįtraukiamas į Google indeksą. Search Console praneša apie daugybę puslapių "Blocked by robots.txt".
Priežastis: Robots.txt faile yra:
User-agent:
Disallow: /
Šios dvi eilutės reiškia: "Uždrausti visiems botams patekti į bet kurį puslapį." Dažnai tai atsitinka, kai kūrėjai nustato šią taisyklę dirbdami su staging aplinka ir pamiršta ją pašalinti pereinant į tiesioginę aplinką.
Taisymo būdas: Pakeisti į:
User-agent: *
Disallow:
Sitemap: https://ten-mien.com/sitemap.xml
Disallow: (nieko po dvitaškio) = leidžiama skaityti viską.
⚠️ Tai yra 1-oji klaida, kurią pastebime naujose verslo svetainėse. Po pataisymo Google gali užtrukti nuo kelių dienų iki kelių savaičių, kad vėl perskaitytų. Išsiųskite žemėlapį dar kartą per Search Console, kad pagreitintumėte procesą.
---
2 klaida: CSS ir JavaScript blokavimas
Simptomai: Svetainė naršyklėje atrodo normaliai, bet naudojant Search Console "URL Inspection" įrankį, Google mato, kad puslapio išdėstymas yra sugadintas arba turinys tuščias.
Priežastis: Robots.txt blokuoja CSS ir JS katalogus:
Disallow: /wp-content/
Disallow: /wp-includes/
Google reikia skaityti CSS ir JS, kad suprastų, kaip atrodo puslapis (tai vadinama "rendering"). Jei tai blokuojama, Google negali atvaizduoti puslapio → nesupranta turinio → paveikia reitingą.
Taisymo būdas:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Allow: /wp-content/
Allow: /wp-includes/
📝 Pastaba kūrėjams: Nuo 2014 m. Google aiškiai rekomenduoja: neblokuoti CSS, JS ir paveikslėlių robots.txt faile. Googlebot reikalingi šie ištekliai, kad teisingai atvaizduotų puslapį. Naudokite Search Console URL Inspection įrankį, kad patikrintumėte, kaip Google atvaizduoja jūsų puslapį.
3 klaida: Klaidingas svarbių puslapių blokavimas
Simptomai: Paslaugų, produktų ar tinklaraščio įrašų puslapiai nerodomi Google – net jei jie yra žemėlapyje.
Priežastis: Robots.txt taisyklė yra per plati. Pavyzdžiui:
Disallow: /dich-vu
Ši eilutė blokuoja ne tik /dich-vu/, bet ir /dich-vu-thiet-ke-web/, /dich-vu-seo/ ir bet kokius URL, prasidedančius /dich-vu.
Taisymo būdas: Pridėkite / pabaigoje, kad tiksliai blokuotumėte aplanką:
Disallow: /dich-vu-noi-bo/
Arba naudokite Allow, kad apsaugotumėte reikiamus puslapius:
Disallow: /dich-vu-noi-bo/
Allow: /dich-vu/
Allow: /dich-vu-thiet-ke-web/
📝 Pastaba kūrėjams:
AllowirDisallowtvarka turi įtakos. Googlebot naudoja konkrečiausią taisyklę (most specific path). Jei ilgis sutampa,Allowturi pirmenybę priešDisallow. Visada testuokite naudodami Robots Testing Tool Search Console prieš diegiant.
Klaida 4: Nėra robots.txt failo
Simptomai: Įveskite ten-mien.com/robots.txt → grąžina 404 klaidą.
Priežastis: Svetainė sukurta rankiniu būdu, o kūrėjas nesukūrė šio failo. Arba failas buvo netyčia ištrintas diegimo metu.
Poveikis: Ne toks rimtas kaip 1 klaida - jei nėra robots.txt, Google pagal numatytuosius nustatymus naršo viską. Tačiau tai reiškia:
- Google naršys administratoriaus puslapius, testavimo puslapius, vidinius puslapius
- Neturite būdo nurodyti kelio į žemėlapį per robots.txt
- Trūksta pagrindinės kontrolės
Taisymo būdas: Sukurkite robots.txt failą pagrindinėje kataloge. Minimalus turinys:
User-agent: *
Disallow: /admin/
Disallow: /search?
Sitemap: https://ten-mien.com/sitemap.xml
---
Klaida 5: Robots.txt naudojamas puslapio slėpimui nuo Google (netinkamai suprantama paskirtis)
Simptomai: Jūs blokuojate puslapį naudodami Disallow, bet puslapis vis tiek rodomas Google - nors ir be turinio aprašymo.
Priežastis: Robots.txt blokuoja naršymą, o ne indeksavimą. Jei puslapis jau buvo indeksuotas anksčiau, arba jį rodo atgalinė nuoroda iš kito tinklalapio, Google gali išlaikyti URL paieškos rezultatuose - tiesiog be turinio.
Tinkamas taisymo būdas:
| Tikslas | Ką naudoti |
|---|---|
| Nenorite, kad Google naršytų (skaitytų) | Disallow robots.txt faile |
| Nenorite, kad Google indeksuotų (rodytų) | žyma HTML faile |
| Nenorite nei vieno, nei kito | Naudokite noindex HTML faile (ir neblokuokite robots.txt faile) |
⚠️ Tai dažniausiai netinkamai suprantama vieta: Jei blokuojate naršymą (robots.txt) ir nustatote
noindex(HTML), Google nematys noindex žymos, nes puslapis nėra naršomas — ir puslapis vis tiek gali būti indeksuotas. Sprendimas: naudokitenoindexHTML faile ir pašalinkiteDisallowtaisyklę šiam puslapiui robots.txt faile.
Robots.txt šablonas verslo svetainei
Štai robots.txt failo šablonas, tinkantis daugumai mažų ir vidutinių įmonių verslo svetainių:
# =============================================
# Robots.txt verslo svetainei
# Atnaujinta: 2026-04-20
# =============================================
# Taikoma visiems robotams
User-agent: *
# Blokuoti administratoriaus ir vidines zonas
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /dashboard/
Disallow: /staging/
# Blokuoti vidinės paieškos puslapius (kad nebūtų švaistomas naršymo biudžetas)
Disallow: /search?
Disallow: /*?s=
# Blokuoti sekimo parametrų URL (kad išvengtumėte dubliuojamo turinio)
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?fbclid=
# Blokuoti krepšelio / atsiskaitymo puslapius (jei yra)
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
# Leisti CSS, JS, paveikslėlius (Google reikia juos apdorojant puslapį)
Allow: /wp-content/uploads/
Allow: /wp-content/themes/
Allow: /wp-includes/
# Nurodyti kelią į žemėlapį
Sitemap: https://ten-mien.com/sitemap.xml
📝 Pastaba kūrėjams: robots.txt failas turi būti pagrindiniame aplanke (root domain) —
https://example.com/robots.txt. Ne/blog/robots.txtar kitame subkataloge. Kiekvienam subdomainui reikalingas atskiras robots.txt failas (pvz.,blog.example.com/robots.txtyra atskirai nuoexample.com/robots.txt).
Kaip patikrinti jūsų svetainės robots.txt
1 būdas: Patikrinkite tiesiogiai naršyklėje
Įveskite https://jusu-domen-pavadinimas.com/robots.txt adreso juostoje. Matysite teksto failo turinį. Jei matote 404 klaidą — svetainė dar neturi robots.txt.
2 būdas: Naudokite Google Search Console
- Prisijunkite prie Google Search Console
- Eikite į Settings → Crawling → robots.txt
- Peržiūrėkite robots.txt failą, kurį skaito Google
- Patikrinkite, ar konkreti URL nėra užblokuota
3 būdas: Patikrinkite Indexing ataskaitoje
Search Console → Pages (arba Indexing) → Raskite skiltį "Blocked by robots.txt". Jei svarbūs puslapiai yra šiame sąraše, nedelsdami pataisykite robots.txt.
💡 Rekomenduojama tikrinti robots.txt failą bent kartą per ketvirtį arba kiekvieną kartą, kai svetainėje atliekami dideli pakeitimai (pridedami puslapiai, keičiama struktūra, migruojama platforma).
Apibendrinanti lentelė: Ką turėtų ir ko neturėtų blokuoti robots.txt
| ✅ TURĖTŲ blokuoti | ❌ NETURĖTŲ blokuoti |
|---|---|
Administracijos puslapiai (/admin/, /wp-admin/) | Pagrindinis puslapis, paslaugų puslapiai, kontaktų puslapis |
| Staging / testavimo puslapiai | Blogų įrašai, straipsniai |
Vidinės paieškos puslapiai (/search?) | CSS ir JavaScript failai |
URL su sekimo parametrais (?utm_, ?fbclid=) | Paveikslėliai (Google Images taip pat atneša srautą) |
| Prekių krepšelio, apmokėjimo, asmeninės paskyros puslapiai | Sitemap |
| Dubliuoto turinio puslapiai (filtrai, rūšiavimas, puslapiavimas) | DUK, atvejų tyrimų puslapiai |
---
Dažnai užduodami klausimai apie robots.txt
Kuo skiriasi robots.txt ir sitemap?
Sitemap sako: „Štai puslapis, apie kurį noriu, kad Google žinotų“. Robots.txt sako: „Štai puslapis, kurio Google nenoriu, kad ieškotų“. Du failai papildo vienas kitą — sitemap rodo kelią, robots.txt stato užtvaras.
Jei nėra robots.txt, ar Google gali nuskaityti svetainę?
Taip. Be robots.txt, Google pagal numatytuosius nustatymus naršo visus puslapius — net ir tuos, kurių nenorite. Štai kodėl šis failas yra būtinas.
Aš naudoju WordPress, kur yra robots.txt?
WordPress automatiškai sukuria virtualų robots.txt failą. Jei naudojate SEO papildinį, pvz., Yoast ar Rank Math, galite redaguoti robots.txt tiesiogiai papildinyje, neprisijungę prie serverio.
Ar robots.txt turi įtakos svetainės greičiui?
Ne. Šis failas sveria vos kelis KB. Jis neturi įtakos puslapių įkėlimo greičiui.
Aš užblokavau puslapį per robots.txt, kodėl jis vis tiek rodomas Google?
Nes robots.txt blokuoja tik naršymą (crawl), bet ne indeksavimą (index). Jei norite, kad puslapis visiškai išnyktų iš Google, naudokite žymą HTML — ir neblokuokite to puslapio robots.txt faile (kad Google galėtų perskaityti noindex žymą).
Pataisiau robots.txt, kiek laiko užtruks, kol Google atnaujins?
Google paprastai vėl tikrina robots.txt per 24–48 valandas. Galite eiti į Search Console → Settings → Crawling ir paprašyti Google greičiau patikrinti.
Išvada
Robots.txt yra mažas failas — dažnai vos kelių eilučių — bet jis tiesiogiai paveikia tai, ar Google matys jūsų svetainę, ar ne.
Ką svarbu atsiminti:
- Robots.txt yra „Uždraustos teritorijos“ ženklas: nurodo Google, kurių puslapių neturėtų indeksuoti.
- Patikrinkite, kai svetainė pradeda veikti: klaida, blokuojanti visą svetainę, yra dažna ir rimta.
- Nenaudokite robots.txt puslapiams slėpti nuo Google: jis blokuoja nuskaitymą, bet ne indeksavimą.
- Visada leiskite CSS ir JS: Google reikia atvaizduoti puslapį, kad suprastų turinį.
- Suderinkite su svetainės žemėlapiu ir „Search Console“: kad visiškai kontroliuotumėte, kaip Google nuskaitys ir indeksuos svetainę.
Patikrinkite savo svetainės pagrindą
Robots.txt yra tik vienas iš daugelio techninių veiksnių, turinčių įtakos SEO. Jei svarstote: „Ar mano svetainė yra tinkamai nustatyta?“ – atsakymas slypi jūsų naudojamame pagrinde.
GTG CRM padeda jums sukurti svetainę su tinkamu robots.txt, automatiniu svetainės žemėlapiu ir technine struktūra, paruošta Google – jums nereikės rūpintis kiekvieno failo, kiekvienos kodo eilutės redagavimu.
Paverskite ką tik perskaitytą informaciją realiais rezultatais — pritaikykite tai dabar su GTG CRM, nemokamai.
Pradėti dabar
