robots.txt
Die robots.txt-Datei legt fest, welche Bereiche einer Website Suchmaschinen-Crawler besuchen dürfen und welche nicht. Sie steuert das Crawling, nicht die Indexierung.
Was ist die robots.txt?
Die robots.txt ist eine einfache Textdatei im Stammverzeichnis einer Website (z. B. beispiel.de/robots.txt), die Suchmaschinen-Crawlern mitteilt, welche Bereiche der Website sie crawlen dürfen und welche nicht. Sie nutzt einfache Regeln wie User-agent, Disallow und Allow und kann Crawler außerdem auf die XML-Sitemap hinweisen.
Typische Einsatzzwecke sind, Crawler von internen Suchergebnissen, Filterkombinationen, Warenkörben oder Testumgebungen fernzuhalten – damit das Crawl-Budget für die wirklich wichtigen Seiten genutzt wird.
Zwei wichtige Einschränkungen:
- Die robots.txt steuert das Crawling, nicht die Indexierung. Eine blockierte URL kann trotzdem in den Suchergebnissen erscheinen, wenn andere Seiten auf sie verlinken. Um eine Seite aus dem Index fernzuhalten, nutzen Sie stattdessen ein
noindex-Meta-Tag – und blockieren Sie diese Seite nicht per robots.txt, sonst können Suchmaschinen die noindex-Anweisung gar nicht sehen. - Sie ist keine Sicherheitsmaßnahme. Die Datei ist öffentlich, und unseriöse Bots können sie ignorieren.
Für internationale Websites gilt: Die robots.txt gilt pro Host – jede Länderdomain und jede Subdomain braucht eine eigene Datei. Prüfen Sie außerdem, ob die Crawler anderer Suchmaschinen, etwa Baiduspider oder Yeti von Naver, versehentlich blockiert werden, wenn diese Märkte für Sie relevant sind.
