Robots.txt-generaattori
Rakenna robots.txt-tiedosto visuaalisella editorilla.
# robots.txt generated by raatools.net User-agent: * Allow: / Disallow: /admin/ Disallow: /private/ Disallow: /api/ Sitemap: https://example.com/sitemap.xml
Mika on robots.txt?
Robots.txt on tekstitiedosto verkkosivuston juuressa (example.com/robots.txt), joka kertoo hakukoneiden hakuroboteille, mitae sivuston osia ne saavat indeksoida ja mitae ei. Se on osa Robots Exclusion Protocol -standardia.
Robots.txt-tiedosto koostuu saannoistae, jotka maarittavat User-agentin (mihin hakurobottiin saanto soveltuu) ja Disallow- tai Allow-ohjeet (mitae polkuja estaa tai sallia). Se on ensimmainen asia, jonka hakurobotit tarkistavat.
Robots.txt-syntaksi
- User-agent: * — koskee kaikkia hakurobotteja. Kayta tarkempia nimia kuten Googlebot kohdennettuja saantoja varten.
- Disallow: /admin/ — estaa /admin/-hakemiston ja kaiken sen sisallon indeksoinnin.
- Allow: /admin/public/ — ohittaa laajemman Disallow-saannon salliakseen tiettyjae polkuja.
- Sitemap: https://example.com/sitemap.xml — kertoo hakuroboteille sivukartan sijainnin.
Tyokalun kayttohje
Valitse haluamasi asetukset — mitae hakurobotteja haluat kohdentaa, mitae hakemistoja estaa ja haluatko sisallyttaa sivukarttaviitteen. Tyokalu generoi oikein muotoillun robots.txt-tiedoston kopioitavaksi.
Yleiset kayttotapaukset
Esta yllapitopaneelit ja kirjautumissivut indeksoinnista. Esta paaallekkaeisen tai ohuen sisallon indeksointi. Esta tietyt hakurobotit (esim. AI-harjoitusrobotit). Ohjaa hakurobotit sivukarttaasi.
Käytännön esimerkki
Oletetaan, että haluat Googlen indeksoivan kaiken paitsi testikansiosi ja sisäiset hakutulokset. Lisää yksi ryhmä, jossa on User-agent: *, rivi Allow: / ja kaksi Disallow-riviä poluille /staging/ ja /search. Lisää loppuun Sitemap: https://example.com/sitemap.xml. Luotu tiedosto kertoo jokaiselle indeksoijalle, että se saa hakea koko sivuston näitä kahta polkuetuliitettä lukuun ottamatta, ja ohjaa sen sivustokarttaasi tehokasta löytämistä varten.
Yleisiä virheitä
Yleinen virhe on käyttää robots.txt-tiedostoa arkaluontoisten sivujen piilottamiseen. Disallow estää vain haravoinnin, ei hakemistoon lisäämistä — estetty URL voi silti näkyä tuloksissa, jos muut sivustot linkittävät siihen, joten käytä sen sijaan noindex-metatunnistetta tai todennusta. Toinen ansa on estää /css/ tai /js/; Google tarvitsee näitä resursseja sivujesi hahmontamiseen ja arviointiin. Lisäksi vertailu erottelee kirjainkoon, joten Disallow: /Admin ei estä polkua /admin.
Usein kysytyt kysymykset
Suojaako robots.txt yksityista sisaltoa?
Ei. Robots.txt on suositus, ei turvallisuustoimenpide. Kuka tahansa tai mika tahansa robotti voi lukea robots.txt-tiedostosi ja tahallaan jattaa sen huomiotta. Kayta todellista todentamista ja valtuutusta yksityisen sisallon suojaamiseen.
Mita tapahtuu, jos minulla ei ole robots.txt-tiedostoa?
Ilman robots.txt-tiedostoa hakurobotit olettavat, etta ne saavat kayttaa kaikkea sivustollasi. Tama on fine useimmille sivustoille, mutta voi johtaa ei-toivottujen sivujen (yllapito, hakutulossivut, kopiot) indeksointiin.
Takaako robots.txt, että sivu pysyy poissa Googlesta?
Ei. Se vain pyytää sääntöjä noudattavia indeksoijia ohittamaan URL-osoitteen haun. Jotta sivu pysyy varmasti pois hakutuloksista, salli haravointi ja lisää noindex-määritys, tai suojaa se kirjautumisen taakse. Haitalliset botit sivuuttavat robots.txt-tiedoston kokonaan.