raatools/

Robots.txt-generaattori

Rakenna robots.txt-tiedosto visuaalisella editorilla.

Allow
Disallow
robots.txt
# robots.txt generated by raatools.net

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /private/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml

Mika on robots.txt?

Robots.txt on tekstitiedosto verkkosivuston juuressa (example.com/robots.txt), joka kertoo hakukoneiden hakuroboteille, mitae sivuston osia ne saavat indeksoida ja mitae ei. Se on osa Robots Exclusion Protocol -standardia.

Robots.txt-tiedosto koostuu saannoistae, jotka maarittavat User-agentin (mihin hakurobottiin saanto soveltuu) ja Disallow- tai Allow-ohjeet (mitae polkuja estaa tai sallia). Se on ensimmainen asia, jonka hakurobotit tarkistavat.

Robots.txt-syntaksi

  • User-agent: * — koskee kaikkia hakurobotteja. Kayta tarkempia nimia kuten Googlebot kohdennettuja saantoja varten.
  • Disallow: /admin/ — estaa /admin/-hakemiston ja kaiken sen sisallon indeksoinnin.
  • Allow: /admin/public/ — ohittaa laajemman Disallow-saannon salliakseen tiettyjae polkuja.
  • Sitemap: https://example.com/sitemap.xml — kertoo hakuroboteille sivukartan sijainnin.

Tyokalun kayttohje

Valitse haluamasi asetukset — mitae hakurobotteja haluat kohdentaa, mitae hakemistoja estaa ja haluatko sisallyttaa sivukarttaviitteen. Tyokalu generoi oikein muotoillun robots.txt-tiedoston kopioitavaksi.

Yleiset kayttotapaukset

Esta yllapitopaneelit ja kirjautumissivut indeksoinnista. Esta paaallekkaeisen tai ohuen sisallon indeksointi. Esta tietyt hakurobotit (esim. AI-harjoitusrobotit). Ohjaa hakurobotit sivukarttaasi.

Käytännön esimerkki

Oletetaan, että haluat Googlen indeksoivan kaiken paitsi testikansiosi ja sisäiset hakutulokset. Lisää yksi ryhmä, jossa on User-agent: *, rivi Allow: / ja kaksi Disallow-riviä poluille /staging/ ja /search. Lisää loppuun Sitemap: https://example.com/sitemap.xml. Luotu tiedosto kertoo jokaiselle indeksoijalle, että se saa hakea koko sivuston näitä kahta polkuetuliitettä lukuun ottamatta, ja ohjaa sen sivustokarttaasi tehokasta löytämistä varten.

Yleisiä virheitä

Yleinen virhe on käyttää robots.txt-tiedostoa arkaluontoisten sivujen piilottamiseen. Disallow estää vain haravoinnin, ei hakemistoon lisäämistä — estetty URL voi silti näkyä tuloksissa, jos muut sivustot linkittävät siihen, joten käytä sen sijaan noindex-metatunnistetta tai todennusta. Toinen ansa on estää /css/ tai /js/; Google tarvitsee näitä resursseja sivujesi hahmontamiseen ja arviointiin. Lisäksi vertailu erottelee kirjainkoon, joten Disallow: /Admin ei estä polkua /admin.

Usein kysytyt kysymykset

Suojaako robots.txt yksityista sisaltoa?

Ei. Robots.txt on suositus, ei turvallisuustoimenpide. Kuka tahansa tai mika tahansa robotti voi lukea robots.txt-tiedostosi ja tahallaan jattaa sen huomiotta. Kayta todellista todentamista ja valtuutusta yksityisen sisallon suojaamiseen.

Mita tapahtuu, jos minulla ei ole robots.txt-tiedostoa?

Ilman robots.txt-tiedostoa hakurobotit olettavat, etta ne saavat kayttaa kaikkea sivustollasi. Tama on fine useimmille sivustoille, mutta voi johtaa ei-toivottujen sivujen (yllapito, hakutulossivut, kopiot) indeksointiin.

Takaako robots.txt, että sivu pysyy poissa Googlesta?

Ei. Se vain pyytää sääntöjä noudattavia indeksoijia ohittamaan URL-osoitteen haun. Jotta sivu pysyy varmasti pois hakutuloksista, salli haravointi ja lisää noindex-määritys, tai suojaa se kirjautumisen taakse. Haitalliset botit sivuuttavat robots.txt-tiedoston kokonaan.